For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
Navegación principal
Codex

Codex use case

Descubrir modelos de plegamiento de proteínas

Convierte hipótesis sobre el plegamiento de proteínas en ciclos de experimentación evaluados mediante benchmarks.

Difficulty Avanzado
Time horizon De larga duración

Usa Codex con el modo Objetivo para investigar e implementar modificaciones novedosas en la arquitectura de AlphaFold2 que mejoren el rendimiento del plegamiento de proteínas.

Ideal para

  • Biólogos computacionales que evalúan cambios en la arquitectura, la función de pérdida o el currículo mediante un benchmark con puntuación automática.
  • Investigadores que tienen una hipótesis con fundamento científico y quieren acortar el camino desde la idea hasta un fork experimental funcional.
  • Ingenieros de ML que ejecutan ciclos prolongados de investigación automatizada que requieren un seguimiento persistente de los experimentos y una depuración iterativa.

Contents

    ← Todos los casos de uso

    Descubrir modelos de plegamiento de proteínas

    Convierte hipótesis sobre el plegamiento de proteínas en ciclos de experimentación evaluados mediante benchmarks.

    Usa Codex con el modo Objetivo para investigar e implementar modificaciones novedosas en la arquitectura de AlphaFold2 que mejoren el rendimiento del plegamiento de proteínas.

    Avanzado
    De larga duración

    Usa Codex con el modo Objetivo para investigar e implementar modificaciones novedosas en la arquitectura de AlphaFold2 que mejoren el rendimiento del plegamiento de proteínas.

    Avanzado
    De larga duración

    Ideal para

    • Biólogos computacionales que evalúan cambios en la arquitectura, la función de pérdida o el currículo mediante un benchmark con puntuación automática.
    • Investigadores que tienen una hipótesis con fundamento científico y quieren acortar el camino desde la idea hasta un fork experimental funcional.
    • Ingenieros de ML que ejecutan ciclos prolongados de investigación automatizada que requieren un seguimiento persistente de los experimentos y una depuración iterativa.

    Prompt inicial

    Usa el modo Objetivo para mejorar la puntuación lDDT-Cα de validación de este modelo de estructura de proteínas al estilo de AlphaFold2 en el benchmark público NanoFold. La hipótesis científica es que los estados geométricos persistentes de orden superior podrían ayudar al modelo a aprender la geometría de proteínas de manera más eficiente con datos limitados: - conserva las representaciones estándar de MSA y por pares; - agrega estados dispersos aprendidos de caras de 2-símplices para tripletes seleccionados de residuos; - agrega estados tetraédricos dispersos aprendidos de 3-símplices para cuartetos seleccionados de residuos; - construye la topología únicamente a partir de las entradas oficiales del benchmark y de la geometría reciclada generada por el modelo; - mantén la implementación viable en términos computacionales bajo las restricciones de NanoFold. Mantén archivos de seguimiento persistentes para registrar: 1. la estrategia actual, el estado y los próximos pasos propuestos en PLAN.md 2. un registro estructurado de los experimentos y resultados en EXPERIMENTS.md 3. un bloc continuo de notas e ideas en EXPERIMENT_NOTES.md En cada iteración: 1. indica la hipótesis que se pondrá a prueba; 2. realiza el cambio coherente más pequeño posible en el código o la configuración; 3. ejecuta las pruebas pertinentes y el subconjunto correspondiente del benchmark; 4. registra las métricas, la latencia, la memoria y los modos de falla; 5. decide si conservar, revertir o perfeccionar el cambio; 6. reevalúa periódicamente la dirección de la búsqueda a nivel de arquitectura en lugar de limitarte a ajustar hiperparámetros locales. No afirmes que hay mejoras de generalización basándote en pruebas de humo ni en diagnósticos de sobreajuste en una sola cadena. Prioriza las comparaciones pareadas y respeta los límites de la evidencia.
    Usa el modo Objetivo para mejorar la puntuación lDDT-Cα de validación de este modelo de estructura de proteínas al estilo de AlphaFold2 en el benchmark público NanoFold. La hipótesis científica es que los estados geométricos persistentes de orden superior podrían ayudar al modelo a aprender la geometría de proteínas de manera más eficiente con datos limitados: - conserva las representaciones estándar de MSA y por pares; - agrega estados dispersos aprendidos de caras de 2-símplices para tripletes seleccionados de residuos; - agrega estados tetraédricos dispersos aprendidos de 3-símplices para cuartetos seleccionados de residuos; - construye la topología únicamente a partir de las entradas oficiales del benchmark y de la geometría reciclada generada por el modelo; - mantén la implementación viable en términos computacionales bajo las restricciones de NanoFold. Mantén archivos de seguimiento persistentes para registrar: 1. la estrategia actual, el estado y los próximos pasos propuestos en PLAN.md 2. un registro estructurado de los experimentos y resultados en EXPERIMENTS.md 3. un bloc continuo de notas e ideas en EXPERIMENT_NOTES.md En cada iteración: 1. indica la hipótesis que se pondrá a prueba; 2. realiza el cambio coherente más pequeño posible en el código o la configuración; 3. ejecuta las pruebas pertinentes y el subconjunto correspondiente del benchmark; 4. registra las métricas, la latencia, la memoria y los modos de falla; 5. decide si conservar, revertir o perfeccionar el cambio; 6. reevalúa periódicamente la dirección de la búsqueda a nivel de arquitectura en lugar de limitarte a ajustar hiperparámetros locales. No afirmes que hay mejoras de generalización basándote en pruebas de humo ni en diagnósticos de sobreajuste en una sola cadena. Prioriza las comparaciones pareadas y respeta los límites de la evidencia.

    Explorar una hipótesis sobre una arquitectura de plegamiento de proteínas

    Usa el modo Objetivo de Codex cuando tengas una hipótesis sobre el plegamiento de proteínas que requiera más de una iteración de implementación. Proporciona a Codex una línea científica acotada, una línea base funcional y un benchmark con puntuación automática. Codex puede implementar el fork de la arquitectura, hacer seguimiento de los experimentos, diagnosticar fallas y seguir iterando mientras revisas la evidencia.

    Este ejemplo partió de una pregunta concreta: ¿podría un modelo al estilo de AlphaFold2 aprender geometría proteica útil con mayor eficiencia si su tronco representara no solo residuos y pares de residuos, sino también objetos topológicos explícitos de orden superior?

    Definir un experimento acotado

    AlphaFold2 ya usa un potente razonamiento por pares y basado en triángulos dentro del Evoformer. Sus operaciones triangulares mejoran las representaciones de las aristas, pero los resultados siguen volcándose en un tensor de pares. El científico propuso evaluar si las representaciones aprendidas persistentes de las caras triangulares y las celdas tetraédricas podrían aportar un sesgo inductivo útil en un entorno con datos limitados.

    El repositorio público resultante, SimplexFold, agrega estados dispersos de caras F_ijk y estados tetraédricos U_ijkl junto con la representación convencional por pares Z_ij.

    MSA representation M
            <-> pair / edge tensor Z_ij
            <-> sparse face tensor F_ijk
            <-> sparse tetra tensor U_ijkl
            -> structure module
            -> recycled geometry
            loops back into the next pass

    Comienza con el prompt inicial de esta página, una línea base mínima al estilo de AlphaFold2 y el benchmark público NanoFold. El benchmark proporciona una base pequeña y depurada, con datos fijos y puntuación automática, para experimentar en biología estructural. Mantén la primera implementación lo bastante pequeña como para probarla mediante pruebas unitarias específicas y microbenchmarks antes de iniciar ejecuciones costosas de entrenamiento.

    Ejecutar la búsqueda con el modo Objetivo

    1. Proporciona una hipótesis científica de alto nivel y falsable en lugar de pedirle al modelo que formule desde cero todo un programa de investigación.
    2. Usa GPT-5.5 Pro en ChatGPT para convertir esa línea de investigación en un plan de implementación con restricciones y ablaciones explícitas.
    3. Pídele a Codex que implemente la línea base ejecutable más pequeña de SimplexFold y luego verifícala con pruebas unitarias específicas y microbenchmarks.
    4. Proporciona el repositorio resultante al modo Objetivo de Codex e indícale que maximice mediante ascenso de colina el lDDT-Cα de validación en el benchmark NanoFold, a la vez que conserva los registros de experimentos, los planes y las referencias a los artefactos.
    5. Mantén el modo Objetivo en ejecución continua mientras usa la retroalimentación del benchmark para iterar sobre la arquitectura, la estrategia de entrenamiento y el arnés de ejecución experimental. En este ejemplo, el ciclo se ejecutó durante más de 150 horas.

    Usa PLAN.md para la estrategia actual y los próximos pasos, EXPERIMENTS.md para llevar un registro estructurado de los resultados y EXPERIMENT_NOTES.md como bloc de notas continuo. Estos artefactos permiten auditar una búsqueda prolongada y te ofrecen un lugar estable desde el cual orientar la siguiente iteración.

    El modo Objetivo resulta útil aquí porque la búsqueda requiere ciclos repetidos de implementación, pruebas, seguimiento de experimentos, diagnóstico de fallas e iteraciones guiadas por el benchmark. La investigación automatizada sin orientación tendía a desviarse hacia cambios locales conocidos como funciones de pérdida, optimizadores e hiperparámetros. Una hipótesis concisa sobre la arquitectura, formulada por un científico, le dio a Codex un espacio de búsqueda más pertinente y, al mismo tiempo, dejó margen para probar, diagnosticar y perfeccionar la implementación.

    Este flujo de trabajo también resulta útil para los equipos que evalúan cómo cambia la calidad de la búsqueda científica con agentes cuando un científico interviene para orientar el proceso.

    Resultado de ejemplo

    El resultado de este flujo de trabajo fue SimplexFold, una arquitectura experimental con estados explícitos de símplices de orden superior. Revisa la topología junto con los registros del benchmark para confirmar que cada iteración siga poniendo a prueba la idea científica original.

    Comparación de la geometría proteica con símplices de orden 1, 2 y 3.

    La lección útil no es que Codex haya resuelto de forma autónoma el plegamiento de proteínas. Este flujo de trabajo muestra cómo el modo Objetivo puede funcionar como un ciclo persistente de ingeniería científica: un científico aporta la propuesta conceptual y Codex acorta el ciclo de implementación, experimentación, depuración y búsqueda posterior.

    Considera los diagnósticos prometedores como evidencia de que la vía de implementación funciona, no como prueba de generalización. Revisa periódicamente la trayectoria del agente, oriéntalo de nuevo hacia preguntas sobre arquitectura que sean científicamente pertinentes si se limita al ajuste local de hiperparámetros y respalda las afirmaciones solo después de comparaciones pareadas de validación pública y réplicas adecuadas.

    Recursos

    Casos de uso relacionados