블로그 목록
AI/ML 리서치

프롬프트 최적화에서 prompt bloat를 줄이는 ESPO

진화적 프롬프트 최적화는 규칙만 길어지는 prompt bloat 문제가 있었어요. arXiv 2609.04197의 ESPO는 오류 구조를 먼저 진단하고, 후보를 다양화한 뒤 부트스트랩 선택으로 안정성을 높여 평균 정확도 74.67%를 달성했어요. GEPA보다 47% 더 짧은 프롬프트로 더 높은 정확도를 얻은 구조를 정리했어요.

2026년 9월 7일 5분 읽기

프롬프트가 불어지는 구조적 이유

자동 프롬프트 최적화 방법인 GEPA는 반복마다 규칙과 예외 문구를 계속 추가해 프롬프트가 3배 이상 길어지면서도 정확도는 거의 오르지 않는 prompt bloat 현상을 보였어요. 연구진은 이 문제가 세 가지 구조적 결손에서 온다고 분석했어요: 첫째, 매 라운드에서 3~8개의 무작위 오류만 관찰해서 체계적 오류 패턴을 놓치는 incomplete error observation, 둘째, 한 종류의 변형만 쓰는 limited search diversity, 셋째, 작은 검증셋에서 점추정으로 후보를 고르는 unreliable selection이에요.

ESPO의 세 단계 프레임워크

ESPO는 Error-Structured Prompt Optimization의 약자로, 진화 탐색을 구조적 통계 추정으로 다시 설계했어요. 첫 단계 Diagnose는 학습 오류 전체를 3~7개의 구조적 패턴으로 클러스터링해 한 번에 전체 오류 커버리지를 만드는 단계예요. 두 번째 Propose는 진단 결과에 따라 4가지 상호보완 전략으로 후보 프롬프트를 생성해요: 각 오류 유형에 대해 서로 다른 귀납 편향을 가진 diagnostic revision, consolidation, ablation, factual injection이에요. 세 번째 Select는 B=20회 부트스트랩 리샘플링으로 가장 안정적인 후보를 고르는 bootstrap stability selection을 적용해요.

GEPA와의 정량적 차이

연구팀은 Tweet, MMLU, GSM8K, HotpotQA, ScoNe, HoVer, PUPA 등 7개 공개 NLP 벤치마크에서 약한 기본 프롬프트에서 시작해 비교했어요. ESPO의 평균 정확도는 74.67%로, GEPA의 70.91%보다 +3.76pp 높았어요. 무엇보다 평균 프롬프트 길이는 1,004자로 GEPA의 1,878자보다 47% 짧았어요. HotpotQA 같은 과제에서는 GEPA가 2,845자까지 불어나는 반면 ESPO는 1,008자로 유사한 정확도를 유지했어요.

여러 모델에 걸친 일반화 검증

추가 학생 모델인 Gemma 3 12B, Mistral 14B, Qwen3 32B, Claude Haiku 4.5에서도 같은 약한 프롬프트로 최적화했을 때 ESPO가 평균 정확도에서 항상 가장 높았어요. 특히 Qwen3 GSM8K에서 기본 15.00%를 ESPO는 91.40%까지 끌어올려 GEPA 대비 +56.00pp 개선을 보였어요. 4개 추가 모델 모두에서 ESPO 프롬프트가 GEPA보다 30~60% 짧아서 추론 지연도 줄어드는 효과가 확인됐어요.

이 구조가 중요한 이유

길이만 줄인 제약 GEPA는 평균 정확도가 70.91%에서 71.00%로 거의 움직이지 않았어요. 길이 제약만으로는 prompt bloat를 줄일 수 있어도 정확도 향상으로 연결되지 않는다는 점이 명확해졌어요. 반면 ESPO는 Diagnose가 어떤 규칙이 핵심인지 구분하고, Propose가 짧으면서 정확한 후보를 만들고, Select가 검증셋 노이즈 속에서도 안정적인 선택을 하기 때문에 두 가지를 동시에 달성했어요.

실제 적용과 한계

ESPO의 부트스트랩 선택은 작은 검증셋에서의 다중검정 문제를 줄여주지만, 여전히 반사 LLM으로 Claude Sonnet 4.5 하나만 사용하고 70/30/500 분할에 의존하는 점은 제한이에요. 이론적 경계도 전략 간 독립·정규 잡음·최적 후보가 충분히 분리되어 있다는 가정을 쓰기 때문에 모든 설정에서 tight한 보증은 아니에요. 그럼에도 불구하고 진화적 프롬프트 최적화의 prompt bloat 문제를 구조 단계에서 줄이고, 짧은 프롬프트로 더 높은 정확도를 얻는 실용적 경로를 제시한 점에서 주목할 만해요.

참고 링크

#ESPO#prompt optimization#GEPA#LLM#arXiv

관련 글

Robeedau

발행 전 운영자가 직접 큐레이션·검수·편집합니다.