For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
Navegación principal
Codex

Codex use case

Agrega evaluaciones a tu aplicación de IA

Usa Codex para convertir el comportamiento esperado en un conjunto de evaluaciones de Promptfoo.

Difficulty Intermedio
Time horizon 1 h

Pide a Codex que inspeccione tu aplicación de IA, identifique el comportamiento que quieres evaluar y agregue un conjunto de evaluaciones ejecutable de Promptfoo.

Ideal para

  • Aplicaciones de IA que ya tienen prompts, llamadas a modelos, herramientas, recuperación, agentes o requisitos del producto, pero no un conjunto de evaluaciones repetible.
  • Equipos que preparan un cambio de modelo, prompt, recuperación o agente y quieren tener pruebas de regresión antes de que se fusione el Pull Request.
  • Revisiones de calidad en las que las comprobaciones manuales repetidas deben convertirse en casos de evaluación incorporados al repositorio.

Contents

    ← Todos los casos de uso

    Agrega evaluaciones a tu aplicación de IA

    Usa Codex para convertir el comportamiento esperado en un conjunto de evaluaciones de Promptfoo.

    Pide a Codex que inspeccione tu aplicación de IA, identifique el comportamiento que quieres evaluar y agregue un conjunto de evaluaciones ejecutable de Promptfoo.

    Intermedio
    1 h

    Pide a Codex que inspeccione tu aplicación de IA, identifique el comportamiento que quieres evaluar y agregue un conjunto de evaluaciones ejecutable de Promptfoo.

    Intermedio
    1 h

    Ideal para

    • Aplicaciones de IA que ya tienen prompts, llamadas a modelos, herramientas, recuperación, agentes o requisitos del producto, pero no un conjunto de evaluaciones repetible.
    • Equipos que preparan un cambio de modelo, prompt, recuperación o agente y quieren tener pruebas de regresión antes de que se fusione el Pull Request.
    • Revisiones de calidad en las que las comprobaciones manuales repetidas deben convertirse en casos de evaluación incorporados al repositorio.

    Habilidades y complementos

    • Complemento que incluye `$promptfoo-evals` y `$promptfoo-provider-setup` para crear y conectar conjuntos de evaluaciones, ejecutarlos y comprobar su calidad.
    Skill Why use it
    Promptfoo Complemento que incluye `$promptfoo-evals` y `$promptfoo-provider-setup` para crear y conectar conjuntos de evaluaciones, ejecutarlos y comprobar su calidad.

    Prompt inicial

    Usa $promptfoo-evals para agregar un conjunto de evaluaciones de Promptfoo para esta aplicación de IA. Si aún no hay un proveedor de Promptfoo o un adaptador de destino que funcione, usa primero $promptfoo-provider-setup. Comportamiento que se evaluará: [support answer quality / tool-call correctness / retrieval grounding / business rules / agent task completion] Antes de editar: - Inspecciona la ruta de la aplicación que usan los usuarios y las evaluaciones o pruebas existentes. - Propón el plan de evaluación útil más pequeño posible: adaptador de destino, casos iniciales, aserciones, archivos, comandos y variables de entorno o servicios locales requeridos. - No cambies los prompts de producción, la configuración del modelo ni el comportamiento de la aplicación hasta que exista una evaluación de referencia y se haya ejecutado. Requisitos: - Prueba, cuando sea posible, la ruta de la aplicación que usan los usuarios y no solo el prompt del modelo sin procesar. - Asegúrate de que los datos de prueba no contengan secretos, datos de clientes ni datos personales sensibles. - Agrega un comando local de evaluación como `npm run evals` o documenta el comando exacto que debe ejecutarse. Al finalizar, incluye: - Archivos modificados - Comandos de evaluación ejecutados - Casos que pasaron y fallaron - Próximas evaluaciones que se recomienda agregar
    Usa $promptfoo-evals para agregar un conjunto de evaluaciones de Promptfoo para esta aplicación de IA. Si aún no hay un proveedor de Promptfoo o un adaptador de destino que funcione, usa primero $promptfoo-provider-setup. Comportamiento que se evaluará: [support answer quality / tool-call correctness / retrieval grounding / business rules / agent task completion] Antes de editar: - Inspecciona la ruta de la aplicación que usan los usuarios y las evaluaciones o pruebas existentes. - Propón el plan de evaluación útil más pequeño posible: adaptador de destino, casos iniciales, aserciones, archivos, comandos y variables de entorno o servicios locales requeridos. - No cambies los prompts de producción, la configuración del modelo ni el comportamiento de la aplicación hasta que exista una evaluación de referencia y se haya ejecutado. Requisitos: - Prueba, cuando sea posible, la ruta de la aplicación que usan los usuarios y no solo el prompt del modelo sin procesar. - Asegúrate de que los datos de prueba no contengan secretos, datos de clientes ni datos personales sensibles. - Agrega un comando local de evaluación como `npm run evals` o documenta el comando exacto que debe ejecutarse. Al finalizar, incluye: - Archivos modificados - Comandos de evaluación ejecutados - Casos que pasaron y fallaron - Próximas evaluaciones que se recomienda agregar

    Introducción

    Cuando creas una aplicación de IA o modificas una existente, quieres asegurarte de que se comporte como esperas. Las evaluaciones permiten probar sistemáticamente un conjunto de situaciones y detectar regresiones antes del lanzamiento.

    Puedes usar Promptfoo para ejecutar evaluaciones en tu aplicación de IA y Codex para ayudarte a crearlas y mantenerlas.

    Cómo usarlo

    Usa Codex junto con la habilidad $promptfoo-evals del complemento de Promptfoo para convertir un comportamiento de la aplicación de IA en un conjunto de evaluaciones repetible. Si la aplicación aún no tiene un destino de Promptfoo que funcione, $promptfoo-provider-setup ayuda a conectar el conjunto con la ruta de la aplicación que quieres probar.

    Codex puede inspeccionar la aplicación, proponer casos que aporten señales claras, agregar la configuración de Promptfoo y los datos de prueba, ejecutar el conjunto localmente y darte un comando que puedas seguir usando.

    Este caso de uso funciona mejor cuando el comportamiento es concreto: calidad de las respuestas de soporte, anclaje en la información recuperada, etiquetas del clasificador, llamadas a herramientas, estructura JSON, reglas de negocio o confianza al migrar prompts y modelos.

    Una buena primera versión debe incluir código y datos de prueba fáciles de revisar: un archivo promptfooconfig.yaml o una configuración equivalente, un pequeño directorio evals/, casos de prueba, cualquier adaptador de destino necesario para llamar a la aplicación y un comando local como npm run evals.

    Elige qué evaluar

    Comienza con una promesa visible para los usuarios. Evita pedirle a Codex que evalúe todo el sistema de IA de una sola vez. Es más fácil confiar en un conjunto más pequeño, revisarlo y seguir ejecutándolo.

    Algunos buenos objetivos iniciales son:

    • Corrección: clasificación, extracción, resumen, enrutamiento o transformación.
    • Anclaje: respuestas que deben mantenerse vinculadas a los documentos recuperados o las fuentes citadas.
    • Uso de herramientas: elegir la herramienta adecuada, pasar argumentos válidos y gestionar los errores de las herramientas.
    • Formato o reglas de negocio: esquemas JSON, nombres de campos, límites impuestos por reglas de negocio o contratos para el texto de la interfaz de usuario.
    • Migración de prompts o modelos: asegurarse de que un cambio de prompt, modelo, mensaje del sistema o configuración de recuperación no provoque fallas en casos importantes.

    Parte de los requisitos del producto, informes de errores, casos que el equipo de soporte haya escalado o ejemplos depurados que tu equipo no tenga inconveniente en incorporar al repositorio.

    Pide un plan de evaluación

    Codex debe inspeccionar la aplicación antes de editarla. Pide un plan que indique la ruta de destino, los datos de prueba, las aserciones, el adaptador y los comandos. Así podrás detectar si se eligió un destino incorrecto o si los casos de prueba son deficientes antes de agregar los archivos.

    Revisa el plan antes de implementarlo. Debe indicar la ruta de la aplicación o el punto de acceso al que llamará Promptfoo, los casos iniciales, las aserciones, los archivos que creará Codex, el comando local y los secretos o servicios necesarios. Si el plan prueba directamente el modelo en lugar de la ruta de la aplicación que usan los usuarios, pregúntale a Codex si eso es intencional.

    Implementa, ejecuta e itera

    Cuando el plan sea correcto, pídele a Codex que lo implemente. La primera implementación debe ser sencilla: configuración, casos, datos de prueba, un adaptador de destino si es necesario, un comando y evidencia de que el comando se ejecutó.

    Un conjunto pequeño de evaluaciones de la aplicación podría verse así:

    evals/
      promptfooconfig.yaml
      tests/
        cases.yaml
      providers/
        provider.js  # only if the built-in provider cannot call the app directly

    Ejecuta el conjunto antes de cambiar el comportamiento. La evaluación de referencia te indica si la aplicación ya falla en esos casos, si es necesario ajustar las aserciones o si el adaptador de destino no es el correcto. Ajusta las aserciones cuando sean demasiado frágiles o vagas, pero mantén visibles las fallas reales del producto.

    Después de la primera ejecución, usa el conjunto para comparar los cambios en la aplicación antes de lanzarlos. Agrega nuevos casos cada vez que un error, un requisito de lanzamiento o una revisión del producto revele un comportamiento que quieras mantener estable. Cuando el comando local sea estable, pídele a Codex que lo agregue a CI o a tu lista de verificación para lanzamientos.

    Casos de uso relacionados