블로그 목록
AI/ML 리서치

LLM 추론을 5,000배 빠르게 만드는 두 단계 프레임워크

arXiv 2609.05363은 LLM 추론을 15.5M 학생에게 증류하고 카테고리별 어댑터로 추론을 특화하는 프레임워크를 제안해요. 100K 쌍에서 5,000배 빠르고 AUC 0.941을 달성해요.

2026년 9월 8일 6분 읽기

트레이드업 추천, 왜 지금 필요한가

온라인 스토어에서 상품 A를 고르는 순간 더 나은 등급의 대안을 추천하는 기능은 매출과 고객 만족도에 직접 연결돼요. 그런데 이 작업은 단순한 대체 추천과 달리 방향성과 문맥을 동시에 고려해야 해서 어려워요. 같은 세탁 세제라도 농축형, 액체형, 포드형 중 어느 쪽이 진짜 업그레이드인지 판단하려면 소비자의 본래 구매 의도와 제품의 속성 변화를 구분해야 하거든요.

이 문제를 해결하려고 최근 연구들은 LLM의 추론 능력을 상품 관계 판단에 활용하고 있지만, 실제 수백만 쌍의 상품 후보에 적용하는 것은 현실적으로 불가능해요. 그 자체로 수백만 달러의 추론 비용과 수주 단위의 지연을 유발하거든요. arXiv 2609.05363은 이 두 요구사항을 동시에 만족하려고 LLM 추론을 비생성 학생 모델로 증류하는 Level 1과 카테고리별 경량 어댑터로 추론을 특화하는 Level 2라는 두 단계 프레임워크를 제안해요.

두 단계 프레임워크의 핵심 구성

Distill Globally, Adapt Locally 프레임워크 개요출처: arXiv 2609.05363

Level 1은 검색 증강 few-shot LLM 교사로부터 구조화된 관계 라벨과 자연어 근거를 생성해요. 그 다음 교사의 근거 텍스트를 인코딩하고, 이를 임베딩 쌍 분류기와 정렬 대조 목표를 통해 정렬해요. 추론 시점에는 학생 모델이 미리 계산된 768차원 상품 임베딩 두 개만 사용하므로 LLM 호출이나 텍스트 생성이 전혀 필요하지 않아요. 전체 파라미터는 15.5M에 불과하지만 4클래스 관계 분류를 그대로 수행해요.

Level 2는 Product-Type Test-Time Training, PT-TTT라는 이름의 테스트타임 특화 단계예요. 각 상품 유형마다 소수 개의 레이블된 예시를 사용해 글로벌 학생 모델 위에 경량 카테고리 어댑터를 최적화해요. 여기서는 LoRA 스타일의 저랭크 모듈만 학습하고 기본 학생 모델은 동결해요. 덕분에 카테고리마다 다른 트레이드업 기준을 로컬 결정 경계로 반영하면서도 전체 카탈로그 스코어링의 효율성은 유지돼요.

실험 결과와 성능 분석

연구팀은 Amazon-Walmart 데이터셋에서 29개 상품 유형, 1,019,241쌍의 실버 감독 데이터와 8,352쌍의 인간 주석 홀드아웃 벤치마크로 평가했어요. 핵심 결과를 보면, 15.5M 파라미터의 사분류 reasoning-distilled 학생 모델이 홀드아웃에서 AUC 0.924를 달성했어요. 같은 구조의 라벨만 사용한 학생은 0.912라서 근거 기반 증류가 약 0.012 포인트 향상을 가져온 셈이에요.

PT-TTT를 적용하면 AUC가 0.924에서 0.941로 오르고 평균 정밀도도 0.920에서 0.940으로 개선돼요. 특히 흥미로운 점은 4배 큰 딥 라벨 온리 학생보다 얕은 reasoning-distilled 학생이 홀드아웃에서 우수하다는 거예요. 이는 실버 라벨 노이즈에 딥 모델이 과적합하기 쉬운 반면, 교사의 자연어 근거가 표현 기하를 정제해서 일반화를 도왔기 때문으로 해석돼요.

실제 서빙 관점에서의 의미

이 연구의 가장 큰 장점은 추론 비용과 속도예요. 100K 쌍 규모 프록시 카탈로그에서 단일 8-GPU 머신상의 증류 학생은 LLM 직접 추론보다 약 5,000배 빠르고 추정 비용은 10,000배 낮아요. 또 카테고리별로 어댑터를 한 번 맞춘 뒤 모든 쿼리 쌍에 재사용하므로, 쿼리 단위 적응보다 3,448배 이상 연산 효율이 높아요.

한계와 다음 단계

현재 접근은 상품 유형별로 어댑터를 따로 쓰기 때문에 유형이 극단적으로 많거나 새로 등장하는 도메인에는 별도의 지원 세트 관리가 필요해요. 또한 교사 LLM이 블랙박스라서 logit 수준 전이가 아니라 근거 임베딩 정렬에 의존하는데, 교사 추론 경로가 바뀌면 실버 감독 품질도 함께 바뀔 수 있어요. 마지막으로 본 논문은 29개 상품 유형에 대한 실험을 보고 있지만, 규모가 훨씬 큰 실제 마켓플레이스에서의 배치 안정성은 추가 검증이 필요해요.

참고 링크

#지식증류#트레이드업추천#테스트타임트레이닝#LLM 추론 최적화#아마존 e-commerce

관련 글

리테일 검색 지역별 그래디언트 충돌 비교 이미지AI/ML 리서치

리테일 검색 지역 편차, 그래디언트 충돌로 풀어낸 RegionFed

Walmart Global Tech가 arXiv 2609.05403으로 공개한 RegionFed는 리테일 검색의 지역별 데이터 편차를 gradient-level 신호로 풀어 연합학습이 트랜스포머에서 붕괴하는 문제를 해결한다. T5·RoBERTa·CNN에서 아키텍처 변경 없이 92.27% 정확도, ε≈0.60 차등정보보호를 달성한 점이 핵심 결과다.

#연합학습#개인화 검색#gradient-level personalization
2026년 9월 8일 6분 읽기
AI/ML 리서치

프롬프트 최적화에서 prompt bloat를 줄이는 ESPO

진화적 프롬프트 최적화는 규칙만 길어지는 prompt bloat 문제가 있었어요. arXiv 2609.04197의 ESPO는 오류 구조를 먼저 진단하고, 후보를 다양화한 뒤 부트스트랩 선택으로 안정성을 높여 평균 정확도 74.67%를 달성했어요. GEPA보다 47% 더 짧은 프롬프트로 더 높은 정확도를 얻은 구조를 정리했어요.

#ESPO#prompt optimization#GEPA
2026년 9월 7일 5분 읽기
AI/ML 리서치

동시 확률 게임 학습, 첫 PAC 프레임워크 제시

Angel Y. He와 David Parker는 일반합 동시 확률 게임에서 천이 불확실성을 다루는 최초의 PAC 학습 프레임워크를 제시했다. 데이터 기반 신뢰구간과 강건한 MDP 탐색 메커니즘을 결합해 근사 Nash 균형을 계산하거나 균형이 존재하지 않음을 사운드하게 인증한다. 샘플 복잡도는 이론 경계와 일치하는 수준으로 실증됐다.

#강건 강화학습#게임 이론#다중 에이전트
2026년 9월 7일 7분 읽기
Robeedau

발행 전 운영자가 직접 큐레이션·검수·편집합니다.