Codex use case
Ajoutez des évaluations à votre application d’IA
Utilisez Codex pour transformer le comportement attendu en une suite d’évaluation Promptfoo.
Demandez à Codex d’examiner votre application d’IA, d’identifier le comportement à évaluer et d’ajouter une suite d’évaluation Promptfoo exécutable.
Idéal pour
- Applications d’IA qui comportent déjà des prompts, des appels à un modèle, des outils, un système de récupération, des agents ou des exigences produit, mais aucune suite d’évaluation reproductible.
- Équipes qui préparent une modification de modèle, de prompt, de système de récupération ou d’agent et souhaitent disposer de tests de régression avant la fusion de la pull request.
- Revues de qualité au cours desquelles des vérifications manuelles récurrentes doivent devenir des cas d’évaluation versionnés dans le dépôt.
Contents
Ajoutez des évaluations à votre application d’IA
Utilisez Codex pour transformer le comportement attendu en une suite d’évaluation Promptfoo.
Demandez à Codex d’examiner votre application d’IA, d’identifier le comportement à évaluer et d’ajouter une suite d’évaluation Promptfoo exécutable.
Demandez à Codex d’examiner votre application d’IA, d’identifier le comportement à évaluer et d’ajouter une suite d’évaluation Promptfoo exécutable.
Liens connexes
Idéal pour
- Applications d’IA qui comportent déjà des prompts, des appels à un modèle, des outils, un système de récupération, des agents ou des exigences produit, mais aucune suite d’évaluation reproductible.
- Équipes qui préparent une modification de modèle, de prompt, de système de récupération ou d’agent et souhaitent disposer de tests de régression avant la fusion de la pull request.
- Revues de qualité au cours desquelles des vérifications manuelles récurrentes doivent devenir des cas d’évaluation versionnés dans le dépôt.
Skills et plugins
- Plugin qui inclut `$promptfoo-evals` et `$promptfoo-provider-setup` pour créer, connecter et exécuter des suites d’évaluation, ainsi qu’en contrôler la qualité.
| Skill | Why use it |
|---|---|
| Promptfoo | Plugin qui inclut `$promptfoo-evals` et `$promptfoo-provider-setup` pour créer, connecter et exécuter des suites d’évaluation, ainsi qu’en contrôler la qualité. |
Prompt de démarrage
Introduction
Lorsque vous développez une application d’IA ou modifiez une application existante, vous devez vous assurer qu’elle se comporte comme prévu. Les évaluations permettent de tester systématiquement un ensemble de scénarios et de détecter les régressions avant leur déploiement.
Vous pouvez utiliser Promptfoo pour exécuter des évaluations sur votre application d’IA et Codex pour vous aider à les créer et à les maintenir.
Utilisation
Utilisez Codex avec la skill $promptfoo-evals du plugin Promptfoo pour transformer un comportement d’application d’IA en suite d’évaluation reproductible. Si l’application ne dispose pas encore d’une cible Promptfoo fonctionnelle, $promptfoo-provider-setup permet de relier la suite au parcours de l’application que vous souhaitez tester.
Codex peut examiner l’application, proposer des cas de test particulièrement pertinents, ajouter la configuration Promptfoo et les données de test, exécuter la suite en local et vous fournir une commande à réutiliser.
Ce cas d’usage est particulièrement adapté aux comportements concrets : qualité des réponses d’assistance, ancrage dans les données récupérées, étiquettes produites par un classificateur, appels d’outils, structure JSON, règles métier ou confiance dans les migrations de prompts et de modèles.
Une première version solide doit se composer de code et de données de test faciles à relire : un fichier promptfooconfig.yaml ou une configuration équivalente, un petit répertoire evals/, des cas de test, tout adaptateur cible nécessaire pour appeler l’application et une commande locale telle que npm run evals.
Choisissez ce que vous souhaitez évaluer
Commencez par une seule promesse faite aux utilisateurs. Évitez de demander à Codex d’évaluer l’ensemble du système d’IA en une seule passe. Une suite plus restreinte inspire davantage confiance, se relit plus facilement et s’exécute plus aisément dans la durée.
Voici quelques bonnes cibles pour commencer :
- Exactitude : classification, extraction, résumé, routage ou transformation.
- Ancrage : réponses qui doivent rester ancrées dans les documents récupérés ou les sources citées.
- Utilisation des outils : choix de l’outil approprié, transmission d’arguments valides et gestion des erreurs renvoyées par les outils.
- Format ou règles métier : schémas JSON, noms de champs, limites définies par les règles métier ou contrats portant sur les textes affichés dans l’interface.
- Migration de prompt ou de modèle : vérification qu’un nouveau prompt, modèle, message système ou paramètre de récupération ne fait pas échouer des cas importants.
Partez des exigences produit, des rapports de bug, des signalements remontés par le support ou d’exemples débarrassés de toute donnée sensible que votre équipe accepte de versionner dans le dépôt.
Demandez un plan d’évaluation
Codex doit examiner l’application avant de la modifier. Demandez-lui un plan qui précise le parcours cible, les fixtures, les assertions, l’adaptateur et les commandes. Vous pourrez ainsi repérer une mauvaise cible ou des cas de test peu pertinents avant l’ajout des fichiers.
Examinez le plan avant l’implémentation. Il doit préciser le parcours de l’application ou le point de terminaison que Promptfoo appellera, les cas initiaux, les assertions, les fichiers que Codex créera, la commande locale, ainsi que les éventuels secrets ou services nécessaires. Si le plan teste directement le modèle plutôt que le parcours de l’application emprunté par les utilisateurs, demandez à Codex si ce choix est intentionnel.
Implémentez, exécutez, puis itérez
Lorsque le plan est correct, demandez à Codex de l’implémenter. La première implémentation doit rester simple : configuration, cas de test, fixtures, adaptateur cible si nécessaire, commande et preuve de l’exécution de cette commande.
Une petite suite qui s’appuie sur l’application pourrait se présenter ainsi :
evals/
promptfooconfig.yaml
tests/
cases.yaml
providers/
provider.js # only if the built-in provider cannot call the app directly
Exécutez la suite avant de modifier le comportement. Cette exécution de référence vous indique si l’application échoue déjà sur certains cas, si les assertions doivent être ajustées ou si l’adaptateur cible est incorrect. Ajustez les assertions lorsqu’elles sont trop fragiles ou trop vagues, mais laissez visibles les véritables défaillances du produit.
Après la première exécution, utilisez la suite pour comparer les modifications apportées à l’application avant leur mise en production. Ajoutez de nouveaux cas chaque fois qu’un bug, une exigence de lancement ou une revue produit révèle un comportement que vous souhaitez maintenir stable. Lorsque la commande locale est stable, demandez à Codex de l’ajouter à la CI ou à votre liste de contrôle de mise en production.
Cas d’utilisation associés
Mettez à niveau votre intégration à l’API
Utilisez Codex pour mettre à jour votre intégration existante à l’API OpenAI afin d’adopter...
Résorber un backlog de vulnérabilités
Importez des constats approuvés provenant d’outils de gestion des tickets ou de systèmes de...
Effectuez une analyse de sécurité approfondie
Utilisez le plugin Codex Security pour effectuer un audit plus complet d’un dépôt ou d’un...