프롬프트 최적화에서 prompt bloat를 줄이는 ESPO
진화적 프롬프트 최적화는 규칙만 길어지는 prompt bloat 문제가 있었어요. arXiv 2609.04197의 ESPO는 오류 구조를 먼저 진단하고, 후보를 다양화한 뒤 부트스트랩 선택으로 안정성을 높여 평균 정확도 74.67%를 달성했어요. GEPA보다 47% 더 짧은 프롬프트로 더 높은 정확도를 얻은 구조를 정리했어요.
프롬프트가 불어지는 구조적 이유
자동 프롬프트 최적화 방법인 GEPA는 반복마다 규칙과 예외 문구를 계속 추가해 프롬프트가 3배 이상 길어지면서도 정확도는 거의 오르지 않는 prompt bloat 현상을 보였어요. 연구진은 이 문제가 세 가지 구조적 결손에서 온다고 분석했어요: 첫째, 매 라운드에서 3~8개의 무작위 오류만 관찰해서 체계적 오류 패턴을 놓치는 incomplete error observation, 둘째, 한 종류의 변형만 쓰는 limited search diversity, 셋째, 작은 검증셋에서 점추정으로 후보를 고르는 unreliable selection이에요.
ESPO의 세 단계 프레임워크
ESPO는 Error-Structured Prompt Optimization의 약자로, 진화 탐색을 구조적 통계 추정으로 다시 설계했어요. 첫 단계 Diagnose는 학습 오류 전체를 3~7개의 구조적 패턴으로 클러스터링해 한 번에 전체 오류 커버리지를 만드는 단계예요. 두 번째 Propose는 진단 결과에 따라 4가지 상호보완 전략으로 후보 프롬프트를 생성해요: 각 오류 유형에 대해 서로 다른 귀납 편향을 가진 diagnostic revision, consolidation, ablation, factual injection이에요. 세 번째 Select는 B=20회 부트스트랩 리샘플링으로 가장 안정적인 후보를 고르는 bootstrap stability selection을 적용해요.
GEPA와의 정량적 차이
연구팀은 Tweet, MMLU, GSM8K, HotpotQA, ScoNe, HoVer, PUPA 등 7개 공개 NLP 벤치마크에서 약한 기본 프롬프트에서 시작해 비교했어요. ESPO의 평균 정확도는 74.67%로, GEPA의 70.91%보다 +3.76pp 높았어요. 무엇보다 평균 프롬프트 길이는 1,004자로 GEPA의 1,878자보다 47% 짧았어요. HotpotQA 같은 과제에서는 GEPA가 2,845자까지 불어나는 반면 ESPO는 1,008자로 유사한 정확도를 유지했어요.
여러 모델에 걸친 일반화 검증
추가 학생 모델인 Gemma 3 12B, Mistral 14B, Qwen3 32B, Claude Haiku 4.5에서도 같은 약한 프롬프트로 최적화했을 때 ESPO가 평균 정확도에서 항상 가장 높았어요. 특히 Qwen3 GSM8K에서 기본 15.00%를 ESPO는 91.40%까지 끌어올려 GEPA 대비 +56.00pp 개선을 보였어요. 4개 추가 모델 모두에서 ESPO 프롬프트가 GEPA보다 30~60% 짧아서 추론 지연도 줄어드는 효과가 확인됐어요.
이 구조가 중요한 이유
길이만 줄인 제약 GEPA는 평균 정확도가 70.91%에서 71.00%로 거의 움직이지 않았어요. 길이 제약만으로는 prompt bloat를 줄일 수 있어도 정확도 향상으로 연결되지 않는다는 점이 명확해졌어요. 반면 ESPO는 Diagnose가 어떤 규칙이 핵심인지 구분하고, Propose가 짧으면서 정확한 후보를 만들고, Select가 검증셋 노이즈 속에서도 안정적인 선택을 하기 때문에 두 가지를 동시에 달성했어요.
실제 적용과 한계
ESPO의 부트스트랩 선택은 작은 검증셋에서의 다중검정 문제를 줄여주지만, 여전히 반사 LLM으로 Claude Sonnet 4.5 하나만 사용하고 70/30/500 분할에 의존하는 점은 제한이에요. 이론적 경계도 전략 간 독립·정규 잡음·최적 후보가 충분히 분리되어 있다는 가정을 쓰기 때문에 모든 설정에서 tight한 보증은 아니에요. 그럼에도 불구하고 진화적 프롬프트 최적화의 prompt bloat 문제를 구조 단계에서 줄이고, 짧은 프롬프트로 더 높은 정확도를 얻는 실용적 경로를 제시한 점에서 주목할 만해요.
참고 링크
관련 글
AI/ML 리서치LLM 추론을 5,000배 빠르게 만드는 두 단계 프레임워크
arXiv 2609.05363은 LLM 추론을 15.5M 학생에게 증류하고 카테고리별 어댑터로 추론을 특화하는 프레임워크를 제안해요. 100K 쌍에서 5,000배 빠르고 AUC 0.941을 달성해요.
AI/ML 리서치리테일 검색 지역 편차, 그래디언트 충돌로 풀어낸 RegionFed
Walmart Global Tech가 arXiv 2609.05403으로 공개한 RegionFed는 리테일 검색의 지역별 데이터 편차를 gradient-level 신호로 풀어 연합학습이 트랜스포머에서 붕괴하는 문제를 해결한다. T5·RoBERTa·CNN에서 아키텍처 변경 없이 92.27% 정확도, ε≈0.60 차등정보보호를 달성한 점이 핵심 결과다.
동시 확률 게임 학습, 첫 PAC 프레임워크 제시
Angel Y. He와 David Parker는 일반합 동시 확률 게임에서 천이 불확실성을 다루는 최초의 PAC 학습 프레임워크를 제시했다. 데이터 기반 신뢰구간과 강건한 MDP 탐색 메커니즘을 결합해 근사 Nash 균형을 계산하거나 균형이 존재하지 않음을 사운드하게 인증한다. 샘플 복잡도는 이론 경계와 일치하는 수준으로 실증됐다.
발행 전 운영자가 직접 큐레이션·검수·편집합니다.