For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
Navegação principal
Codex

Codex use case

Adicione avaliações ao seu aplicativo de IA

Use o Codex para transformar o comportamento esperado em uma suíte de avaliações do Promptfoo.

Difficulty Intermediário
Time horizon 1 h

Peça ao Codex para inspecionar seu aplicativo de IA, identificar o comportamento que você quer avaliar e adicionar uma suíte de avaliações executável do Promptfoo.

Ideal para

  • Aplicativos de IA que já têm prompts, chamadas ao modelo, ferramentas, recuperação, agentes ou requisitos de produto, mas não têm uma suíte de avaliações reproduzível.
  • Equipes que preparam uma alteração no modelo, no prompt, na recuperação ou no agente e querem testes de regressão antes que a pull request seja mesclada.
  • Revisões de qualidade em que verificações manuais recorrentes devem se transformar em casos de avaliação versionados no repositório.

Contents

    ← Todos os casos de uso

    Adicione avaliações ao seu aplicativo de IA

    Use o Codex para transformar o comportamento esperado em uma suíte de avaliações do Promptfoo.

    Peça ao Codex para inspecionar seu aplicativo de IA, identificar o comportamento que você quer avaliar e adicionar uma suíte de avaliações executável do Promptfoo.

    Intermediário
    1 h

    Peça ao Codex para inspecionar seu aplicativo de IA, identificar o comportamento que você quer avaliar e adicionar uma suíte de avaliações executável do Promptfoo.

    Intermediário
    1 h

    Ideal para

    • Aplicativos de IA que já têm prompts, chamadas ao modelo, ferramentas, recuperação, agentes ou requisitos de produto, mas não têm uma suíte de avaliações reproduzível.
    • Equipes que preparam uma alteração no modelo, no prompt, na recuperação ou no agente e querem testes de regressão antes que a pull request seja mesclada.
    • Revisões de qualidade em que verificações manuais recorrentes devem se transformar em casos de avaliação versionados no repositório.

    Habilidades e Plug-ins

    • Plug-in que inclui `$promptfoo-evals` e `$promptfoo-provider-setup` para criar, conectar, executar e validar suítes de avaliações.
    Skill Why use it
    Promptfoo Plug-in que inclui `$promptfoo-evals` e `$promptfoo-provider-setup` para criar, conectar, executar e validar suítes de avaliações.

    Prompt inicial

    Use $promptfoo-evals para adicionar uma suíte de avaliações do Promptfoo a este aplicativo de IA. Se ainda não houver um provedor ou adaptador de destino do Promptfoo que funcione, use $promptfoo-provider-setup primeiro. Comportamento a avaliar: [support answer quality / tool-call correctness / retrieval grounding / business rules / agent task completion] Antes de editar: - Inspecione o caminho do aplicativo acessado pelos usuários e todas as avaliações ou testes existentes. - Proponha o menor plano de avaliação útil possível: adaptador de destino, casos iniciais, asserções, arquivos, comandos e variáveis de ambiente ou serviços locais necessários. - Não altere os prompts de produção, as configurações do modelo nem o comportamento do aplicativo até que exista uma avaliação de referência e ela tenha sido executada. Requisitos: - Sempre que possível, teste o caminho do aplicativo acessado pelos usuários, não apenas o prompt bruto do modelo. - Não inclua segredos, dados de clientes nem dados pessoais sensíveis nos fixtures. - Adicione um comando local de avaliação, como `npm run evals`, ou documente o comando exato a ser executado. Conclua com: - Arquivos alterados - Comandos de avaliação executados - Casos que passaram e que falharam - Próximas avaliações recomendadas
    Use $promptfoo-evals para adicionar uma suíte de avaliações do Promptfoo a este aplicativo de IA. Se ainda não houver um provedor ou adaptador de destino do Promptfoo que funcione, use $promptfoo-provider-setup primeiro. Comportamento a avaliar: [support answer quality / tool-call correctness / retrieval grounding / business rules / agent task completion] Antes de editar: - Inspecione o caminho do aplicativo acessado pelos usuários e todas as avaliações ou testes existentes. - Proponha o menor plano de avaliação útil possível: adaptador de destino, casos iniciais, asserções, arquivos, comandos e variáveis de ambiente ou serviços locais necessários. - Não altere os prompts de produção, as configurações do modelo nem o comportamento do aplicativo até que exista uma avaliação de referência e ela tenha sido executada. Requisitos: - Sempre que possível, teste o caminho do aplicativo acessado pelos usuários, não apenas o prompt bruto do modelo. - Não inclua segredos, dados de clientes nem dados pessoais sensíveis nos fixtures. - Adicione um comando local de avaliação, como `npm run evals`, ou documente o comando exato a ser executado. Conclua com: - Arquivos alterados - Comandos de avaliação executados - Casos que passaram e que falharam - Próximas avaliações recomendadas

    Introdução

    Ao criar um aplicativo de IA ou modificar um existente, você precisa garantir que ele se comporte como esperado. As avaliações permitem testar sistematicamente um conjunto de cenários e detectar regressões antes que cheguem à produção.

    Você pode usar o Promptfoo para executar avaliações no seu aplicativo de IA e o Codex para ajudar a criar e manter essas avaliações.

    Como usar

    Use o Codex com a habilidade $promptfoo-evals do plug-in Promptfoo para transformar um comportamento do aplicativo de IA em uma suíte de avaliações reproduzível. Quando o aplicativo ainda não tiver um destino funcional do Promptfoo, $promptfoo-provider-setup ajudará a conectar a suíte ao caminho do aplicativo que você quer testar.

    O Codex pode inspecionar o aplicativo, propor casos de alto valor informativo, adicionar a configuração do Promptfoo e os dados de teste, executar a suíte localmente e fornecer um comando para você continuar usando.

    Este caso de uso funciona melhor quando o comportamento é concreto: qualidade das respostas de suporte, fundamentação em informações recuperadas, rótulos do classificador, chamadas de ferramentas, estrutura JSON, regras de negócio ou confiança na migração de prompts e modelos.

    Uma primeira entrega sólida deve incluir código e dados de teste que possam ser revisados: um arquivo promptfooconfig.yaml ou uma configuração equivalente, um pequeno diretório evals/, casos de teste, qualquer adaptador de destino necessário para chamar o aplicativo e um comando local como npm run evals.

    Escolha o que avaliar

    Comece com uma promessa perceptível para o usuário. Evite pedir ao Codex que avalie todo o sistema de IA de uma só vez. É mais fácil confiar em uma suíte menor, revisá-la e continuar executando-a.

    Bons alvos iniciais incluem:

    • Correção: classificação, extração, sumarização, roteamento ou transformação.
    • Fundamentação: respostas que devem permanecer vinculadas aos documentos recuperados ou às fontes citadas.
    • Uso de ferramentas: escolher a ferramenta certa, passar argumentos válidos e tratar erros das ferramentas.
    • Formato ou regras de negócio: esquemas JSON, nomes de campos, limites definidos por regras de negócio ou contratos para textos exibidos na interface.
    • Migração de prompt ou de modelo: garantir que um novo prompt, modelo, mensagem do sistema ou configuração de recuperação não faça casos importantes falharem.

    Comece com requisitos de produto, relatórios de bugs, escalonamentos de suporte ou exemplos sanitizados que sua equipe se sinta à vontade para versionar no repositório.

    Peça um plano de avaliação

    O Codex deve inspecionar antes de editar. Peça um plano que indique o caminho de destino, os fixtures, as asserções, o adaptador e os comandos. Assim, você terá a oportunidade de identificar um destino incorreto ou casos de teste fracos antes que os arquivos sejam adicionados.

    Revise o plano antes da implementação. Ele deve indicar o caminho do aplicativo ou o endpoint que o Promptfoo chamará, os casos iniciais, as asserções, os arquivos que o Codex criará, o comando local e todos os segredos ou serviços necessários. Se o plano testar o modelo diretamente, em vez do caminho do aplicativo acessado pelos usuários, pergunte ao Codex se isso é intencional.

    Implemente, execute e itere

    Quando o plano estiver correto, peça ao Codex para implementá-lo. A primeira implementação deve ser simples e previsível: configuração, casos, fixtures, um adaptador de destino se necessário, um comando e uma comprovação de que o comando foi executado.

    Uma pequena suíte que testa o aplicativo pode ter esta aparência:

    evals/
      promptfooconfig.yaml
      tests/
        cases.yaml
      providers/
        provider.js  # only if the built-in provider cannot call the app directly

    Execute a suíte antes de alterar o comportamento. A execução de referência indica se o aplicativo já falha nesses casos, se as asserções precisam de ajustes ou se o adaptador de destino está incorreto. Ajuste as asserções quando forem frágeis ou vagas demais, mas mantenha visíveis as falhas reais do produto.

    Após a primeira execução, use a suíte para comparar as alterações no aplicativo antes que cheguem à produção. Adicione novos casos sempre que um bug, requisito de lançamento ou revisão de produto revelar um comportamento que você deseja manter estável. Quando o comando local estiver estável, peça ao Codex para adicioná-lo à CI ou à sua lista de verificação de lançamento.

    Casos de uso relacionados