For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
기본 탐색
Codex

Codex use case

어려운 문제를 반복적으로 개선하기

Codex를 점수 기반 개선 루프로 활용해 어려운 작업을 해결하세요.

Difficulty 고급
Time horizon 장시간 실행

스크립트와 검토 가능한 아티팩트 같은 평가 시스템을 Codex에 제공하면, 점수가 충분히 높아질 때까지 어려운 작업을 계속 개선할 수 있습니다.

적합한 대상

  • 각 이터레이션을 점수로 평가할 수 있지만, 최상의 결과를 얻으려면 보통 여러 차례 반복해야 하는 문제
  • 출력이 시각적이거나 주관적이어서 결정론적 검사와 LLM 심사 점수가 모두 필요한 작업
  • 컨텍스트에 의존하는 대신 진행 상황을 명확히 추적하고 싶은 장시간 Codex 채팅

Contents

    ← 모든 사용 사례

    어려운 문제를 반복적으로 개선하기

    Codex를 점수 기반 개선 루프로 활용해 어려운 작업을 해결하세요.

    스크립트와 검토 가능한 아티팩트 같은 평가 시스템을 Codex에 제공하면, 점수가 충분히 높아질 때까지 어려운 작업을 계속 개선할 수 있습니다.

    고급
    장시간 실행

    스크립트와 검토 가능한 아티팩트 같은 평가 시스템을 Codex에 제공하면, 점수가 충분히 높아질 때까지 어려운 작업을 계속 개선할 수 있습니다.

    고급
    장시간 실행

    적합한 대상

    • 각 이터레이션을 점수로 평가할 수 있지만, 최상의 결과를 얻으려면 보통 여러 차례 반복해야 하는 문제
    • 출력이 시각적이거나 주관적이어서 결정론적 검사와 LLM 심사 점수가 모두 필요한 작업
    • 컨텍스트에 의존하는 대신 진행 상황을 명확히 추적하고 싶은 장시간 Codex 채팅

    시작 프롬프트

    이 워크스페이스에 어려운 작업이 있습니다. 이 작업을 평가 기반 개선 루프로 진행해 주세요. 수정하기 전에: - `AGENTS.md`를 읽으세요. - 현재 출력의 점수를 산정하는 스크립트 또는 명령어를 찾으세요. 이터레이션 루프: - 한 번에 하나의 개선 사항에 집중해 수정하세요. - 의미 있는 변경을 할 때마다 평가 명령어를 다시 실행하세요. - 점수와 변경 내용을 기록하세요. - 생성된 아티팩트를 직접 검사하세요. 출력이 시각적이면 `view_image`를 사용하세요. - 종합 점수와 LLM 평균이 모두 90%를 넘을 때까지 계속하세요. 제약 조건: - 처음으로 수용 가능한 결과가 나왔을 때 멈추지 마세요. - 새 결과가 점수나 아티팩트 측면에서 확실히 더 나쁜 경우가 아니라면 이전 버전으로 되돌리지 마세요. - 평가 결과가 개선됐지만 여전히 목표에 미달하면 병목을 설명하고 계속하세요. 출력: - 현재 최고 점수 - 주요 이터레이션 로그 - 남은 위험 요소 또는 미흡한 부분
    이 워크스페이스에 어려운 작업이 있습니다. 이 작업을 평가 기반 개선 루프로 진행해 주세요. 수정하기 전에: - `AGENTS.md`를 읽으세요. - 현재 출력의 점수를 산정하는 스크립트 또는 명령어를 찾으세요. 이터레이션 루프: - 한 번에 하나의 개선 사항에 집중해 수정하세요. - 의미 있는 변경을 할 때마다 평가 명령어를 다시 실행하세요. - 점수와 변경 내용을 기록하세요. - 생성된 아티팩트를 직접 검사하세요. 출력이 시각적이면 `view_image`를 사용하세요. - 종합 점수와 LLM 평균이 모두 90%를 넘을 때까지 계속하세요. 제약 조건: - 처음으로 수용 가능한 결과가 나왔을 때 멈추지 마세요. - 새 결과가 점수나 아티팩트 측면에서 확실히 더 나쁜 경우가 아니라면 이전 버전으로 되돌리지 마세요. - 평가 결과가 개선됐지만 여전히 목표에 미달하면 병목을 설명하고 계속하세요. 출력: - 현재 최고 점수 - 주요 이터레이션 로그 - 남은 위험 요소 또는 미흡한 부분

    소개

    일부 작업은 한 번만 검증해도 됩니다. 빌드가 성공하고 테스트가 통과하면 끝입니다. 하지만 해결하기 어려워 긴밀한 평가 루프를 따라 여러 차례 이터레이션해야 하는 최적화 문제도 있습니다. 어느 방향으로 진행할지 판단하려면 Codex가 현재 출력을 검사하고 점수를 매긴 뒤, 다음 변경 사항을 결정하는 과정을 결과가 실제로 만족스러울 때까지 반복해야 합니다.

    이러한 사용 사례에는 Codex가 각 이터레이션의 출력과 생성된 아티팩트를 기록하게 하고, 진행 상황을 시각적으로 확인할 수 있는 맞춤 UI가 잘 맞습니다. Codex가 앱에서 계속 작업하는 동안 목표 아티팩트, 모델 출력 또는 생성된 에셋이 점점 개선되는 모습을 지켜볼 수 있습니다. 핵심은 평가 지표와 검사할 아티팩트를 생성하는 데 필요한 스크립트를 Codex에 제공하는 것입니다.

    평가부터 시작하기

    작업을 시작하기 전에 성공을 측정할 방법을 정의하세요. 가장 좋은 설정은 보통 다음 요소를 함께 사용합니다:

    • 결정론적 검사: 제약 조건 위반 여부나 코드로 계산한 결정론적 지표처럼 스크립트가 직접 점수를 산정할 수 있는 항목
    • LLM 심사 기반 검사: 유사성, 가독성, 유용성 또는 전반적인 품질처럼 정확하게 코드로 표현하기 어려운 특성을 루브릭에 따라 평가한 점수로, 텍스트 또는 이미지 출력을 기반으로 할 수 있습니다.

    주관적 평가가 중요하다면, 예를 들어 Responses API를 사용해 모델을 호출하고 구조화된 점수를 반환할 수 있는 스크립트를 Codex에 제공하세요. 결정론적 검사를 대체하려는 것이 아니라, 사람이 직접 보고 판단해야 할 부분을 일관되게 판정하는 수단으로 보완하려는 것입니다.

    평가 출력이 기계가 읽을 수 있는 형식이고, 실행할 때마다 저장되며, 시간에 따른 변화를 쉽게 비교할 수 있을 때 루프가 가장 효과적으로 작동합니다.

    : 실행하려는 검사 내용을 설명하고 Codex에 평가 스크립트를 생성해 달라고 요청하세요.

    Codex에 중단 조건 제시하기

    어려운 작업은 프롬프트에 언제 중단할지 밝히지 않은 채 “계속 개선”하라고만 쓰면 방향을 잃기 쉽습니다. 중단 조건을 명시하세요.

    실용적인 방법은 다음과 같습니다:

    1. 종합 점수의 목표치를 설정합니다.
    2. LLM 심사 점수 평균의 목표치를 별도로 설정합니다.
    3. 한 점수만이 아니라 두 점수가 모두 임계값을 넘을 때까지 Codex가 계속 작업하도록 합니다.

    예를 들어 목표가 고품질 아티팩트라면, 종합 점수와 LLM 평균이 모두 90%를 넘을 때까지 Codex가 계속 작업하도록 요청하세요. 그러면 작업 상태가 명확해져 Codex가 아직 목표에 미달하는지, 격차가 어디에 있는지, 최근 변경이 도움이 되었는지 판단할 수 있습니다.

    루프 진행 로그 유지하기

    장시간 실행되는 작업에서는 Codex가 채팅 컨텍스트에만 의존하지 않고 루프에 관한 메모를 남길 때 훨씬 더 안정적으로 진행할 수 있습니다.

    진행 로그에는 다음 내용을 기록해야 합니다:

    • 현재까지의 최고 점수
    • 직전 이터레이션에서 변경한 내용
    • 평가 결과상 개선되거나 악화된 부분
    • Codex가 다음으로 시도할 내용

    작업이 오래 실행될수록 특히 중요합니다. 이 로그는 작업을 재개할 때의 인계 지점이자 현재 실행의 자체 평가 기록이 됩니다.

    로그뿐 아니라 아티팩트도 검사하기

    일부 어려운 작업에서는 코드 diff와 지표 출력만으로 충분하지 않습니다. Codex는 자신이 생성한 아티팩트를 살펴봐야 합니다.

    생성 이미지, 레이아웃 또는 렌더링된 상태처럼 출력이 시각적이라면, 예를 들어 출력이 디스크에 이미지로 저장되어 있을 때 Codex가 해당 아티팩트를 직접 검사하고 현재 결과를 이전의 최고 결과나 의도한 루브릭과 비교하게 하세요.

    이렇게 하면 루프가 더 견고해집니다:

    • 평가 스크립트가 점수를 보고합니다
    • 아티팩트는 점수에서 놓친 부분을 보여 줍니다
    • 다음 변경은 두 결과를 모두 근거로 삼습니다

    이 조합은 실행 사이에 코드를 무작정 변경하는 것보다 훨씬 효과적입니다.

    각 이터레이션을 명확히 정의하기

    Codex가 매번 동일한 루프를 따르도록 요청하세요:

    1. 현재 베이스라인에 대해 평가를 실행합니다.
    2. 점수와 아티팩트를 바탕으로 가장 큰 실패 요인을 파악합니다.
    3. 해당 병목을 해결하기 위한 한 가지 변경에 집중합니다.
    4. 평가를 다시 실행합니다.
    5. 새 점수와 변경이 도움이 되었는지 기록합니다.
    6. 임계값을 충족할 때까지 계속합니다.

    이러한 원칙은 중요합니다. 이터레이션마다 너무 많은 항목을 한꺼번에 변경하면 Codex는 어떤 아이디어가 점수를 높였는지 알 수 없습니다. 기록을 생략하면 작업을 신뢰하기도, 다시 이어서 진행하기도 어려워집니다.

    관련 사용 사례