Codex use case
AI 애플리케이션에 평가 추가
Codex를 사용해 예상 동작을 Promptfoo 평가 스위트로 전환하세요.
Codex에 AI 애플리케이션을 검사하고 평가하려는 동작을 파악한 뒤 실행 가능한 Promptfoo 평가 스위트를 추가하도록 요청하세요.
적합한 대상
- 프롬프트, 모델 호출, 도구, 검색, 에이전트 또는 제품 요구 사항은 이미 있지만 반복 실행 가능한 평가 스위트는 없는 AI 애플리케이션.
- 모델, 프롬프트, 검색 또는 에이전트 변경을 준비하며 Pull Request가 병합되기 전에 회귀 테스트를 하려는 팀.
- 반복적인 수동 점검을 레포지토리에 커밋할 평가 케이스로 전환해야 하는 품질 검토.
Contents
AI 애플리케이션에 평가 추가
Codex를 사용해 예상 동작을 Promptfoo 평가 스위트로 전환하세요.
Codex에 AI 애플리케이션을 검사하고 평가하려는 동작을 파악한 뒤 실행 가능한 Promptfoo 평가 스위트를 추가하도록 요청하세요.
Codex에 AI 애플리케이션을 검사하고 평가하려는 동작을 파악한 뒤 실행 가능한 Promptfoo 평가 스위트를 추가하도록 요청하세요.
관련 링크
적합한 대상
- 프롬프트, 모델 호출, 도구, 검색, 에이전트 또는 제품 요구 사항은 이미 있지만 반복 실행 가능한 평가 스위트는 없는 AI 애플리케이션.
- 모델, 프롬프트, 검색 또는 에이전트 변경을 준비하며 Pull Request가 병합되기 전에 회귀 테스트를 하려는 팀.
- 반복적인 수동 점검을 레포지토리에 커밋할 평가 케이스로 전환해야 하는 품질 검토.
스킬 및 플러그인
- 평가 스위트를 생성, 연결, 실행 및 QA하는 데 사용하는 `$promptfoo-evals` 및 `$promptfoo-provider-setup` 스킬을 포함한 플러그인.
| Skill | Why use it |
|---|---|
| Promptfoo | 평가 스위트를 생성, 연결, 실행 및 QA하는 데 사용하는 `$promptfoo-evals` 및 `$promptfoo-provider-setup` 스킬을 포함한 플러그인. |
시작 프롬프트
소개
AI 애플리케이션을 개발하거나 기존 애플리케이션을 변경할 때는 예상대로 작동하는지 확인해야 합니다. 평가는 일련의 시나리오를 체계적으로 테스트하고 출시 전에 회귀를 발견하는 방법입니다.
Promptfoo를 사용해 AI 애플리케이션을 평가하고, Codex의 도움을 받아 평가를 만들고 유지 관리할 수 있습니다.
사용 방법
Promptfoo 플러그인에 포함된 $promptfoo-evals 스킬을 Codex와 함께 사용해 AI 앱의 한 가지 동작을 반복 실행 가능한 평가 스위트로 만드세요. 앱에 작동하는 Promptfoo 대상이 아직 없다면 $promptfoo-provider-setup를 사용해 평가 스위트를 테스트하려는 애플리케이션 경로에 연결할 수 있습니다.
Codex는 앱을 검사하고 핵심 동작을 잘 검증하는 케이스를 제안하며, Promptfoo 구성과 테스트 데이터를 추가하고, 스위트를 로컬에서 실행한 뒤 계속 사용할 명령을 제공할 수 있습니다.
이 사용 사례는 지원 답변 품질, 검색 그라운딩, 분류기 레이블, 도구 호출, JSON 구조, 비즈니스 규칙, 프롬프트 및 모델 마이그레이션의 안정성처럼 평가할 동작이 구체적일 때 가장 효과적입니다.
제대로 된 첫 결과물은 검토 가능한 코드와 테스트 데이터로 구성되어야 합니다. 즉, promptfooconfig.yaml 또는 이에 상응하는 구성 파일, 소규모 evals/ 디렉터리, 테스트 케이스, 앱 호출에 필요한 대상 어댑터, npm run evals 같은 로컬 명령이 있어야 합니다.
평가할 항목 선택
사용자에게 제공해야 할 동작 하나부터 시작하세요. Codex에 전체 AI 시스템을 한 번에 평가하도록 요청하지 마세요. 작은 스위트일수록 신뢰하고 검토하며 지속적으로 실행하기 쉽습니다.
처음 평가하기 좋은 대상은 다음과 같습니다:
- 정확성: 분류, 추출, 요약, 라우팅 또는 변환.
- 그라운딩: 검색된 문서 또는 인용된 출처에 근거해야 하는 답변.
- 도구 사용: 올바른 도구 선택, 유효한 인수 전달, 도구 오류 처리.
- 형식 또는 비즈니스 규칙: JSON 스키마, 필드 이름, 비즈니스 규칙상의 제한 또는 UI 문구 규약.
- 프롬프트 또는 모델 마이그레이션: 새 프롬프트, 모델, 시스템 메시지 또는 검색 설정으로 인해 중요한 케이스가 실패하지 않는지 확인.
제품 요구 사항, 버그 보고서, 고객 지원 에스컬레이션 또는 레포지토리에 커밋해도 괜찮다고 팀에서 판단한 민감 정보 제거 예시에서 시작하세요.
평가 계획 요청
Codex는 편집하기 전에 먼저 검사해야 합니다. 대상 경로, 픽스처, 어설션, 어댑터 및 명령이 명시된 계획을 요청하세요. 그러면 파일을 추가하기 전에 대상이 잘못되었거나 테스트 케이스가 부실한지 확인할 수 있습니다.
구현하기 전에 계획을 검토하세요. 계획에는 Promptfoo가 호출할 앱 경로 또는 엔드포인트, 초기 시드 케이스, 어설션, Codex가 생성할 파일, 로컬 명령, 필요한 비밀 정보 또는 서비스가 명시되어야 합니다. 사용자가 이용하는 애플리케이션 경로가 아닌 원시 모델을 테스트하도록 계획되어 있다면 의도한 것인지 Codex에 확인하세요.
구현, 실행 및 반복 개선
계획이 올바르면 Codex에 구현을 요청하세요. 첫 구현은 구성, 케이스, 픽스처, 필요한 경우 대상 어댑터, 명령, 그리고 명령이 실행되었다는 증거만 담아 단순하게 만드세요.
소규모 앱 연동형 스위트의 예시는 다음과 같습니다:
evals/
promptfooconfig.yaml
tests/
cases.yaml
providers/
provider.js # only if the built-in provider cannot call the app directly
동작을 변경하기 전에 스위트를 실행하세요. 베이스라인을 통해 앱이 이미 해당 케이스에서 실패하는지, 어설션을 조정해야 하는지, 대상 어댑터가 잘못되었는지 알 수 있습니다. 어설션이 사소한 변화에도 실패하거나 지나치게 모호하면 조정하되, 실제 제품 오류는 계속 드러나게 하세요.
첫 실행 후에는 스위트를 사용해 출시 전에 앱 변경 사항을 비교하세요. 버그, 출시 요구 사항 또는 제품 검토를 통해 안정적으로 유지하려는 동작이 드러날 때마다 새 케이스를 추가하세요. 로컬 명령이 안정화되면 Codex에 이를 CI 또는 출시 체크리스트에 추가하도록 요청하세요.