AI가 자기 학습 알고리즘을 만든다면? AI4AI-Bench
AI가 스스로를 만드는 훈련 알고리즘을 다시 쓸 수 있는지 측정하는 최초의 벤치마크 AI4AI-Bench가 공개됐다. 6개 시스템 29개 구성의 평균 점수는 0.166으로, 현실의 에이전트는 학습 방식을 바꾸지 않고 도전 자체를 꺼린다는 현황을 계량했다. 재귀적 자기 개선(RSI)의 현실화 속도를 보여주는 지표를 초록 기준으로 정리했다.
왜 '자기 개선'을 벤치마크로 만들기 어려웠나
재귀적 자기 개선(Recursive Self-Improvement, RSI)은 "AI가 자신을 만드는 과정을 스스로 개선하고, 그 개선이 다음 세대에 그대로 이어지는가"를 묻는 질문이다. 여기서 그 '과정'은 바로 훈련 알고리즘이다. 목적 함수나 업데이트 규칙이 좋아지면 이후 모든 실행의 계산 대비 성능 교환 비율이 좋아질 수 있다. 그래서 RSI가 실현 가능한지의 핵심은 "에이전트가 훈련 알고리즘을 직접 설계할 수 있는가"에 달린다.
문제는 이 능력을 격리해 측정할 벤치마크가 없었다는 점이다. 기존 평가는 데이터 수집이나 하이퍼파라미터 튜닝으로 이기는 경우가 많았고, "실행 방식을 바꾼 것"과 "모델이 학습하는 방식을 바꾼 것"을 분리하지 못했다. 2026년 8월 20일 arXiv에 올라온 AI4AI-Bench가 정확히 이 빈틈을 겨냥한다.
AI4AI-Bench의 설계
AI4AI-Bench는 10개의 훈련 알고리즘 계열을 포괄하는 10개 고정(frozen) 연구 저장소로 구성된다. 각 과제에서 에이전트는 하나의 B300 GPU에서 4시간 동안 훈련 알고리즘을 다시 작성한다. 작성한 코드는 최대 12시간 동안 처음부터 다시 실행되고, 에이전트에게 숨겨진 고정 평가기가 저장소의 원래 알고리즘과 동일한 절차로 점수를 매긴다.
10개 지표는 서로 비교할 수 없어(incommensurable) 한 척도로 정규화된다.
| 점수 | 의미 |
|---|---|
| 0.0 | 정보가 없는(uninformative) 모델 수준 |
| 0.1 | 저장소가 제공하는 기본 알고리즘 수준 |
| 1.0 | 과제별 최적(task optimum) 수준 |
결과: 에이전트는 '학습 방식'을 바꾸지 못하고 있다
6개 시스템을 10개 과제에 걸쳐 29개 구성으로 평가한 결과 평균 0.166, 최고 시스템은 0.250이었다. 가장 강한 에이전트조차 "이미 있던 알고리즘"과 "최적" 사이 거리의 5분의 1도 채우지 못한 셈이다.
격차가 생긴 위치가 더 흥미롭다. 대부분의 제출은 모델이 학습하는 방식을 전혀 바꾸지 않았고, 실제로 학습 방식을 바꾼 소수는 평균 0.226을 기록했다(나머지 0.126). 즉 현재 LLM 에이전트의 약점은 코드를 더 잘 쓰는 것이 아니라, "학습 파이프라인 자체를 건드릴 의지"에 더 가깝다.
추론 비용이 사는 곳은 '도전할 용기'
추론 노력을 늘리는 것이 곧바로 능력 향상으로 이어지는 것은 아니었다. 초록이 보여주는 패턴은 추론 시간을 늘리면 주로 "학습 방식을 바꿀 의향"이 커진다는 쪽이다. 학습 방식을 바꾼 제출 비율이 8%에서 64%로 늘었고, 평균 점수도 0.094에서 0.196으로 올랐다.
정리하면 더 오래 생각하는 것은 "문제를 더 잘 푸는" 데보다, 처음부터 "어디를 건드려야 하는지"를 발견하게 만드는 데 더 크게 기여한다고 해석할 수 있다. 아직 학습 알고리즘 설계 자체의 능력은 부족하지만, 탐색 행동은 확실히 달라진다.
정리와 시사점
AI4AI-Bench는 "에이전트가 자신을 만드는 알고리즘을 다시 쓸 수 있는가"라는 RSI의 핵심 질문을 측정 가능하게 만든 첫 시도다. 과제 모음과 평가기, 그리고 모든 채점 제출을 함께 공개해 시스템이 바뀜에 따라 측정을 반복할 수 있게 했다.
현재 결론은 분명하다. 최고 시스템(0.250)도 기본 알고리즘과 최적 사이의 5분의 1 미만만 채웠고, 대부분의 에이전트는 학습 방식을 바꾸지 않았다. 출발선을 정확히 계량해줬다는 것 자체가 이 벤치마크의 가치다. 다음 실험이 다시 돌려졌을 때 평균 점수와 '학습 방식 변경 비율'이 어느 방향으로 움직일지 지켜보는 것이 RSI 현실화의 속도계가 될 것이다.
원문 출처: arXiv:2608.20318, AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement
Related posts
The Conditions for Trustworthy Synthetic Inference: A Size-Weight Frontier
Synthetic data alone doesn't guarantee better inference. arXiv 2608.28576 proposes a size-weight frontier that keeps target coverage when mixing real and LLM responses.
Continuous Sepsis Score Without Hourly Supervision — arXiv 2608
Modern ICUs need sepsis scoring without fixed interval measurements. This two-center study learns a 0–10 continuous sepsis score with 43 variables over 72 hours, enabling dynamic monitoring.
How VK Deployed a GNN Ranker on a 194M-User Graph
VK scaled GNN friend recommendation on 194M users and 28B edges. Multi-hash embeddings cut storage by >98%, temporal sampling reduced lookup cost. Online A/B: +16% accuracy, +11.5% more recommenders.
Curated, fact-checked, and edited by a single operator before publishing.