For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
Navigation principale
Codex

Codex use case

Découvrez des modèles de repliement des protéines

Transformez des hypothèses sur le repliement des protéines en boucles expérimentales évaluées sur un benchmark.

Difficulty Avancé
Time horizon Longue durée

Utilisez Codex avec le mode Objectif pour étudier et implémenter de nouvelles modifications de l’architecture d’AlphaFold2 afin d’améliorer les performances de repliement des protéines.

Idéal pour

  • Biologistes computationnels qui évaluent des modifications de l’architecture, de la fonction de perte ou du programme d’apprentissage à l’aide d’un benchmark dont le score est calculé automatiquement.
  • Chercheurs disposant d’une hypothèse motivée par des considérations scientifiques et souhaitant accélérer le passage de l’idée à un fork expérimental opérationnel.
  • Ingénieurs ML menant des boucles d’autorecherche de longue durée qui nécessitent un suivi durable des expériences et un débogage itératif.

Contents

    ← Tous les cas d’utilisation

    Découvrez des modèles de repliement des protéines

    Transformez des hypothèses sur le repliement des protéines en boucles expérimentales évaluées sur un benchmark.

    Utilisez Codex avec le mode Objectif pour étudier et implémenter de nouvelles modifications de l’architecture d’AlphaFold2 afin d’améliorer les performances de repliement des protéines.

    Avancé
    Longue durée

    Utilisez Codex avec le mode Objectif pour étudier et implémenter de nouvelles modifications de l’architecture d’AlphaFold2 afin d’améliorer les performances de repliement des protéines.

    Avancé
    Longue durée

    Idéal pour

    • Biologistes computationnels qui évaluent des modifications de l’architecture, de la fonction de perte ou du programme d’apprentissage à l’aide d’un benchmark dont le score est calculé automatiquement.
    • Chercheurs disposant d’une hypothèse motivée par des considérations scientifiques et souhaitant accélérer le passage de l’idée à un fork expérimental opérationnel.
    • Ingénieurs ML menant des boucles d’autorecherche de longue durée qui nécessitent un suivi durable des expériences et un débogage itératif.

    Prompt de démarrage

    Utilisez le mode Objectif pour améliorer le score lDDT-Cα de validation de ce modèle de structure protéique de type AlphaFold2 sur le benchmark public NanoFold. L’hypothèse scientifique est que des états géométriques persistants d’ordre supérieur peuvent aider le modèle à apprendre plus efficacement la géométrie des protéines à partir de données limitées : - conservez les représentations MSA standard et les représentations par paires ; - ajoutez des états appris et parcimonieux de faces 2-simplexes pour certains triplets de résidus ; - ajoutez des états tétraédriques 3-simplexes appris et parcimonieux pour certains quadruplets de résidus ; - construisez la topologie uniquement à partir des entrées officielles du benchmark et de la géométrie recyclée générée par le modèle ; - veillez à ce que l’implémentation reste viable sur le plan du calcul dans le respect des contraintes de NanoFold. Tenez à jour des fichiers de suivi pérennes pour : 1. La stratégie actuelle, l’état d’avancement et les prochaines étapes proposées dans PLAN.md 2. Un journal structuré des expériences et des résultats dans EXPERIMENTS.md 3. Un bloc-notes évolutif regroupant les notes et réflexions dans EXPERIMENT_NOTES.md À chaque itération : 1. indiquez l’hypothèse testée ; 2. apportez la plus petite modification cohérente possible au code ou à la configuration ; 3. exécutez les tests pertinents et le segment correspondant du benchmark ; 4. consignez les métriques, la latence, l’utilisation de la mémoire et les modes d’échec ; 5. déterminez s’il faut conserver, annuler ou affiner la modification ; 6. réévaluez régulièrement l’orientation globale de la recherche d’architecture au lieu de vous limiter au réglage des hyperparamètres locaux. N’affirmez pas avoir obtenu des gains de généralisation à partir de smoke tests ou de diagnostics de surapprentissage sur une seule chaîne. Privilégiez les comparaisons appariées et limitez vos conclusions à ce que démontrent les résultats.
    Utilisez le mode Objectif pour améliorer le score lDDT-Cα de validation de ce modèle de structure protéique de type AlphaFold2 sur le benchmark public NanoFold. L’hypothèse scientifique est que des états géométriques persistants d’ordre supérieur peuvent aider le modèle à apprendre plus efficacement la géométrie des protéines à partir de données limitées : - conservez les représentations MSA standard et les représentations par paires ; - ajoutez des états appris et parcimonieux de faces 2-simplexes pour certains triplets de résidus ; - ajoutez des états tétraédriques 3-simplexes appris et parcimonieux pour certains quadruplets de résidus ; - construisez la topologie uniquement à partir des entrées officielles du benchmark et de la géométrie recyclée générée par le modèle ; - veillez à ce que l’implémentation reste viable sur le plan du calcul dans le respect des contraintes de NanoFold. Tenez à jour des fichiers de suivi pérennes pour : 1. La stratégie actuelle, l’état d’avancement et les prochaines étapes proposées dans PLAN.md 2. Un journal structuré des expériences et des résultats dans EXPERIMENTS.md 3. Un bloc-notes évolutif regroupant les notes et réflexions dans EXPERIMENT_NOTES.md À chaque itération : 1. indiquez l’hypothèse testée ; 2. apportez la plus petite modification cohérente possible au code ou à la configuration ; 3. exécutez les tests pertinents et le segment correspondant du benchmark ; 4. consignez les métriques, la latence, l’utilisation de la mémoire et les modes d’échec ; 5. déterminez s’il faut conserver, annuler ou affiner la modification ; 6. réévaluez régulièrement l’orientation globale de la recherche d’architecture au lieu de vous limiter au réglage des hyperparamètres locaux. N’affirmez pas avoir obtenu des gains de généralisation à partir de smoke tests ou de diagnostics de surapprentissage sur une seule chaîne. Privilégiez les comparaisons appariées et limitez vos conclusions à ce que démontrent les résultats.

    Explorez une hypothèse d’architecture pour le repliement des protéines

    Utilisez le mode Objectif de Codex quand une hypothèse sur le repliement des protéines exige plus d’une passe d’implémentation. Fournissez à Codex une orientation scientifique bien délimitée, une baseline fonctionnelle et un benchmark dont le score est calculé automatiquement. Codex peut implémenter le fork d’architecture, suivre les expériences, diagnostiquer les échecs et poursuivre les itérations pendant que vous examinez les éléments probants.

    Cet exemple est parti d’une question précise : un modèle de type AlphaFold2 pourrait-il apprendre plus efficacement les propriétés géométriques utiles des protéines si son tronc représentait non seulement les résidus et les paires de résidus, mais aussi des objets topologiques explicites d’ordre supérieur ?

    Définissez une expérience bien délimitée

    AlphaFold2 utilise déjà un puissant raisonnement par paires et par triangles au sein de l’Evoformer. Ses opérations triangulaires améliorent les représentations des arêtes, mais réinjectent toujours leurs résultats dans un tenseur de paires. Le scientifique a proposé de tester si des représentations apprises et persistantes des faces triangulaires et des cellules tétraédriques pouvaient constituer un biais inductif utile avec peu de données.

    Le dépôt public qui en résulte, SimplexFold, ajoute des états de faces parcimonieux F_ijk et des états tétraédriques U_ijkl en complément de la représentation par paires classique Z_ij.

    MSA representation M
            <-> pair / edge tensor Z_ij
            <-> sparse face tensor F_ijk
            <-> sparse tetra tensor U_ijkl
            -> structure module
            -> recycled geometry
            loops back into the next pass

    Commencez par le prompt de démarrage de cette page, une baseline minimale de type AlphaFold2, et le benchmark public NanoFold. Ce benchmark fournit un support compact et soigneusement élaboré, avec des données fixes et un score calculé automatiquement, pour mener des expériences de biologie structurale. Veillez à ce que la première implémentation reste suffisamment réduite pour être testée avec des tests unitaires ciblés et des microbenchmarks avant de lancer des entraînements coûteux.

    Lancez la recherche avec le mode Objectif

    1. Fournissez une hypothèse scientifique générale et réfutable, plutôt que de demander au modèle d’inventer de toutes pièces un programme de recherche complet.
    2. Utilisez GPT-5.5 Pro dans ChatGPT pour transformer cette orientation en plan d’implémentation assorti de contraintes et d’ablations explicites.
    3. Demandez à Codex d’implémenter une baseline SimplexFold exécutable aussi réduite que possible, puis vérifiez-la à l’aide de tests unitaires ciblés et de microbenchmarks.
    4. Confiez le dépôt obtenu à Codex en mode Objectif et demandez-lui d’améliorer par ascension locale le score lDDT-Cα de validation sur le benchmark NanoFold, tout en conservant les journaux d’expériences, les plans et les références aux artefacts.
    5. Laissez le mode Objectif s’exécuter en continu afin qu’il exploite les retours du benchmark pour faire évoluer l’architecture, le protocole d’entraînement et le harnais expérimental. Dans cet exemple, la boucle s’est exécutée pendant plus de 150 heures.

    Utilisez PLAN.md pour consigner la stratégie actuelle et les prochaines étapes, EXPERIMENTS.md pour tenir un journal structuré des résultats et EXPERIMENT_NOTES.md comme bloc-notes évolutif. Ces artefacts permettent d’auditer une recherche de longue durée et vous offrent un espace stable pour orienter l’itération suivante.

    Le mode Objectif est utile ici, car la recherche exige des cycles répétés d’implémentation, de test, de suivi des expériences, de diagnostic des échecs et d’itérations pilotées par le benchmark. L’autorecherche non guidée dérivait souvent vers des modifications locales classiques, comme les fonctions de perte, les optimiseurs et les hyperparamètres. Une hypothèse d’architecture concise fournie par le scientifique a offert à Codex un espace de recherche plus pertinent, tout en lui laissant assez de latitude pour tester, diagnostiquer et affiner l’implémentation.

    Ce workflow est également utile aux équipes qui évaluent l’effet d’un pilotage avec un scientifique dans la boucle sur la qualité de la recherche scientifique agentique.

    Exemple de résultat

    Ce workflow a abouti à SimplexFold, une architecture expérimentale dotée d’états explicites de simplexes d’ordre supérieur. Examinez conjointement la topologie et les journaux du benchmark pour vérifier que chaque itération continue de tester l’idée scientifique initiale.

    Comparaison de la géométrie protéique en 1-, 2- et 3-simplexes.

    L’enseignement à retenir n’est pas que Codex a résolu le repliement des protéines en toute autonomie. Ce workflow montre que le mode Objectif peut servir de boucle persistante d’ingénierie scientifique : un scientifique apporte l’idée conceptuelle, et Codex raccourcit le cycle d’implémentation, d’expérimentation, de débogage et de recherche complémentaire.

    Considérez les diagnostics prometteurs comme des indices que la voie d’implémentation fonctionne, et non comme une preuve de généralisation. Examinez régulièrement la trajectoire de l’agent, puis réorientez-le vers des questions d’architecture scientifiquement pertinentes si sa recherche se réduit au réglage local des hyperparamètres. Ne formulez d’affirmations qu’après avoir effectué des comparaisons appariées sur le jeu public de validation et des réplications appropriées.

    Ressources

    Cas d’utilisation associés