블로그 목록
AI/ML 리서치

AI가 자기 학습 알고리즘을 만든다면? AI4AI-Bench

AI가 스스로를 만드는 훈련 알고리즘을 다시 쓸 수 있는지 측정하는 최초의 벤치마크 AI4AI-Bench가 공개됐다. 6개 시스템 29개 구성의 평균 점수는 0.166으로, 현실의 에이전트는 학습 방식을 바꾸지 않고 도전 자체를 꺼린다는 현황을 계량했다. 재귀적 자기 개선(RSI)의 현실화 속도를 보여주는 지표를 초록 기준으로 정리했다.

2026년 8월 23일 5분 읽기

왜 '자기 개선'을 벤치마크로 만들기 어려웠나

재귀적 자기 개선(Recursive Self-Improvement, RSI)은 "AI가 자신을 만드는 과정을 스스로 개선하고, 그 개선이 다음 세대에 그대로 이어지는가"를 묻는 질문이다. 여기서 그 '과정'은 바로 훈련 알고리즘이다. 목적 함수나 업데이트 규칙이 좋아지면 이후 모든 실행의 계산 대비 성능 교환 비율이 좋아질 수 있다. 그래서 RSI가 실현 가능한지의 핵심은 "에이전트가 훈련 알고리즘을 직접 설계할 수 있는가"에 달린다.

문제는 이 능력을 격리해 측정할 벤치마크가 없었다는 점이다. 기존 평가는 데이터 수집이나 하이퍼파라미터 튜닝으로 이기는 경우가 많았고, "실행 방식을 바꾼 것"과 "모델이 학습하는 방식을 바꾼 것"을 분리하지 못했다. 2026년 8월 20일 arXiv에 올라온 AI4AI-Bench가 정확히 이 빈틈을 겨냥한다.

AI4AI-Bench의 설계

AI4AI-Bench는 10개의 훈련 알고리즘 계열을 포괄하는 10개 고정(frozen) 연구 저장소로 구성된다. 각 과제에서 에이전트는 하나의 B300 GPU에서 4시간 동안 훈련 알고리즘을 다시 작성한다. 작성한 코드는 최대 12시간 동안 처음부터 다시 실행되고, 에이전트에게 숨겨진 고정 평가기가 저장소의 원래 알고리즘과 동일한 절차로 점수를 매긴다.

10개 지표는 서로 비교할 수 없어(incommensurable) 한 척도로 정규화된다.

점수의미
0.0정보가 없는(uninformative) 모델 수준
0.1저장소가 제공하는 기본 알고리즘 수준
1.0과제별 최적(task optimum) 수준

결과: 에이전트는 '학습 방식'을 바꾸지 못하고 있다

6개 시스템을 10개 과제에 걸쳐 29개 구성으로 평가한 결과 평균 0.166, 최고 시스템은 0.250이었다. 가장 강한 에이전트조차 "이미 있던 알고리즘"과 "최적" 사이 거리의 5분의 1도 채우지 못한 셈이다.

격차가 생긴 위치가 더 흥미롭다. 대부분의 제출은 모델이 학습하는 방식을 전혀 바꾸지 않았고, 실제로 학습 방식을 바꾼 소수는 평균 0.226을 기록했다(나머지 0.126). 즉 현재 LLM 에이전트의 약점은 코드를 더 잘 쓰는 것이 아니라, "학습 파이프라인 자체를 건드릴 의지"에 더 가깝다.

추론 비용이 사는 곳은 '도전할 용기'

추론 노력을 늘리는 것이 곧바로 능력 향상으로 이어지는 것은 아니었다. 초록이 보여주는 패턴은 추론 시간을 늘리면 주로 "학습 방식을 바꿀 의향"이 커진다는 쪽이다. 학습 방식을 바꾼 제출 비율이 8%에서 64%로 늘었고, 평균 점수도 0.094에서 0.196으로 올랐다.

정리하면 더 오래 생각하는 것은 "문제를 더 잘 푸는" 데보다, 처음부터 "어디를 건드려야 하는지"를 발견하게 만드는 데 더 크게 기여한다고 해석할 수 있다. 아직 학습 알고리즘 설계 자체의 능력은 부족하지만, 탐색 행동은 확실히 달라진다.

정리와 시사점

AI4AI-Bench는 "에이전트가 자신을 만드는 알고리즘을 다시 쓸 수 있는가"라는 RSI의 핵심 질문을 측정 가능하게 만든 첫 시도다. 과제 모음과 평가기, 그리고 모든 채점 제출을 함께 공개해 시스템이 바뀜에 따라 측정을 반복할 수 있게 했다.

현재 결론은 분명하다. 최고 시스템(0.250)도 기본 알고리즘과 최적 사이의 5분의 1 미만만 채웠고, 대부분의 에이전트는 학습 방식을 바꾸지 않았다. 출발선을 정확히 계량해줬다는 것 자체가 이 벤치마크의 가치다. 다음 실험이 다시 돌려졌을 때 평균 점수와 '학습 방식 변경 비율'이 어느 방향으로 움직일지 지켜보는 것이 RSI 현실화의 속도계가 될 것이다.

원문 출처: arXiv:2608.20318, AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement

#AI4AI-Bench#재귀적 자기 개선#LLM 에이전트#벤치마크#머신러닝

관련 글

AI/ML 리서치

합성 데이터가 신뢰할 수 있는 추론을 만드는 조건: 사이즈-웨이트 프론티어

합성 데이터를 신뢰도 높은 통계 추론에 녹여 쓰려면 단순히 표본을 늘리는 것만으론 부족하다. arXiv 2608.28576은 '크기-무게 프론티어'라는 구조적 제한을 제시한다. 이 논문은 실험에서 LLM으로 합성한 여론조사 응답을 실제 데이터에 더했을 때, 목표 coverage를 유지하면서도 신뢰구간을 상당히 좁힐 수 있음을 보여준다.

#합성 데이터#신뢰구간#LLM
2026년 9월 1일 7분 읽기
AI/ML 리서치

세패 중증도 점수를 매시간 감독 없이 학습하는 방법 — arXiv 2608.27421

현재 세패 중증도 지수는 수십 년 전 정적 가중치 기반으로, 오늘날 중환자실 환자군과 맞지 않아요. 이 연구는 두 병원 3만 7천여 환자 데이터로 72시간 윈도우 43개 변수만으로 0~10점 연속 세패 지수를 학습했어요. 외부 병원에서도 일관된 예후 분리를 보여 의사결정 보조 도구로서 가능성을 제시합니다.

#세패#중증도 예측#환자 궤적
2026년 8월 30일 5분 읽기
AI/ML 리서치

VK가 194M 사용자 그래프에 GNN 랭커를 실제로 올린 방법

VK 연구진이 1억 9천만 사용자·280억 엣지 그래프에서 GNN 기반 친구 추천 랭커를 운용한 사례를 정리했다. 핵심은 ID 임베딩을 멀티해시로 98% 이상 줄이고, 시간 정렬 CSR로 시간 이웃 샘플링 비용을 대수 수준으로 낮춘 점이다. 온라인 A/B에서 추천 친구 추가 16%, 고유 추가자 11.5% 개선을 보고했다.

#그래프 신경망#친구 추천#임베딩
2026년 8월 29일 5분 읽기
Robeedau

발행 전 운영자가 직접 큐레이션·검수·편집합니다.