ARC-AGI-3에서 GPT-6 Astra 99.9%가 보여준 것과 숨겨진 것
ARC-AGI-3 벤치마크에서 GPT-6 Astra가 Standard 62.7%, Provider Adapter 99.9%를 기록했어요. 높은 점수만큼 비용과 평가 조건의 차이도 함께 봐야 해요. 이 글은 공식 결과와 비용 비교, 행동 효율성, 대수적 속기, 그리고 99.9%가 AGI 증거가 아니라 벤치마크 포화일 뿐이라는 이유를 정리했어요.
ARC-AGI-3가 보여준 것
ARC-AGI-3 Semi-Private에서 GPT-6 Astra가 Standard 62.7%, **Provider Adapter 99.9%**를 기록했어요. 같은 모델이 평가 조건에 따라 두 배 이상 점수 차이가 나는 상황은, 벤치마크 해석에 있어 "조건이 곧 의미"라는 점을 다시 보여줍니다.
ARC Prize가 2026년 9월 3일 공개한 결과에 따르면, Standard 하네스는 모델이 환경에서 직접 가시적 메모를 선택하고 전달하는 최소 인터페이스예요. 반면 Provider Adapter는 공급자가 설계한 문맥 관리 기능까지 허용하는 설정으로, 요청 사이의 추론 상태 보존과 긴 대화 압축을 사용해요. 같은 Astra라도 어느 하네스로 평가하느냐에 따라 성능과 비용이 크게 달라지는 구조예요.
벤치마크가 묻는 네 가지 능력
ARC-AGI-3는 명시적 지시 없이 새로운 턴 기반 환경을 탐색하고 규칙을 발견하며 내부 모델을 만든 뒤 행동을 계획하는 에이전트 지능 벤치마크예요. 기존 ARC-AGI-1·2와 달리 다음 네 가지 요소를 함께 평가해요.
- 탐색: 환경과 상호작용하며 필요한 정보를 능동적으로 얻어내는 능력
- 모델링: 원시 관찰을 미래 상태와 결과를 예측할 수 있는 일반화된 모델로 바꾸는 능력
- 목표 설정: 희소한 보상만으로 목표 상태를 식별하는 능력
- 계획과 실행: 현재 상태에서 목표까지 경로를 만들고 새 정보에 맞춰 수정하는 능력
환경은 핵심 지식 사전 요소만 포함하고, 인간 참가자 실험으로 난이도가 조정돼요. 인간은 이 환경의 100%를 해결할 수 있다고 ARC Prize는 밝혀요.
Astra의 점수와 비용
Standard와 Provider Adapter 모두에서 Astra는 최고 수준 점수를 기록했어요. Standard Astra(max)는 62.7%에 $26,098였고, Provider Adapter Astra(high)는 99.9%에 $18,817이었어요. 추론 수준이 높을수록 행동·모델 호출·토큰이 줄어 비용이 낮아지는 경향이 나타나, max 추론이 오히려 가장 낮은 비용을 기록하기도 했어요.
| 추론 수준 | Standard | Provider Adapter |
|---|---|---|
| max | 62.7%, $26,098 | 98.6%, $17,332 |
| xhigh | 59.3%, $37,317 | 98.4%, $18,147 |
| high | 54.8%, $40,705 | 99.9%, $18,817 |
| medium | 38.6%, $48,090 | 98.4%, $19,285 |
| low | 17.5%, $38,166 | 98.0%, $21,298 |
| none | 35.2%, $49,791 | 96.7%, $23,457 |
공식 리더보드와 전체 결과는 ARC Prize 웹사이트에서 확인할 수 있어요.
인간보다 적었던 행동 수
ARC-AGI-3는 퍼즐 경험이나 능력으로 선발하지 않은 일반인 약 500명을 대상으로 행동 효율성 기준선을 만들었어요. AI가 더 많은 행동을 사용하면 효율성이 낮고, 더 적게 사용하면 높아요.
Provider Adapter의 Astra(max)는 완료한 레벨 중 96.0%에서 인간 중앙값보다 적은 행동을 사용했어요. 레벨당 평균 행동 수도 인간보다 51.7% 적었어요. 환경을 해결하더라도 인간보다 훨씬 많이 탐색할 것으로 예상했던 것과 달리, Astra는 역학을 이해한 뒤 인간 효율성 범위 안에서 실행하는 양상을 보였어요.
대수적 속기로 만든 세계 모델
Astra의 눈길을 끌었던 점 중 하나는 낯선 게임 환경에서 즉석으로 대수적 속기를 만들어 객체·좌표·규칙·미완료 계획을 압축 기록한 거예요. 완전한 프로그래밍 언어보다는 실행 중 만드는 도메인 특화 표기법에 가까웠어요.
예를 들어 게임 상태는 L8: hub q2 (8↓). Lengths: 14=1…처럼 레벨, 지역 회전 인덱스, 장치 길이를 기록했고, 다단계 계획은 extend8 to3; retract10 to2; shorten8 to1처럼 변경 순서를 저장했어요. 조작과 좌표는 9-=(39,4), rotate=(49,18), 14+=(59,11)으로 연결했고, 시간과 위치는 Turn 5: P=(24,20), empty, facing west로 나타냈어요. 이런 표기는 게임별 소프트웨어 라이브러리까지 제작한 PRO-LONG 하네스에서도 관찰되는 패턴이에요.
출처: ARC Prize
두 하네스는 서로 다른 질문에 답한다
Standard 하네스는 공급자 중립적인 최소 인터페이스에서 모델을 비교해요. 게임 해결에 필요한 정보는 제공하지만, 무엇을 가시적 메모로 보존할지는 모델이 결정해요. 반면 Provider Adapter는 모델 공급자가 설계한 문맥 관리 기능까지 활용할 때의 성능을 측정해요. Astra의 Provider Adapter는 요청 사이의 불투명한 추론 상태를 보존하고 장기 대화 압축을 사용했어요.
Public과 Semi-Private 전체, 모든 추론 수준에서 두 하네스가 모두 해결한 167개 게임·추론 조합을 비교하면, Provider Adapter가 기록된 경과 시간 기준 약 3.66배 빨랐고 전체 토큰도 49% 적게 사용했어요. 향후 ARC Prize는 두 하네스 결과를 조건이 명확히 구분된 형태로 리더보드에 함께 게재할 예정이라고 밝혔어요.
99.9%가 AGI가 아닌 이유
Astra의 결과는 분명 프런티어 모델에서 뚜렷한 단계적 변화를 보여주지만, ARC-AGI-3의 범위와 형식은 엄격히 제한돼 있어요. 환경의 역학과 목표가 결정적이고 폐쇄적이어서 현실 세계의 복잡성과 개방성을 대표하지 못해요. 벤치마크 포화는 AGI 달성의 증거가 아니며, ARC Prize도 이를 분명히 선언했어요.
앞으로 재귀적 자기 개선과 개방형 혁신을 어떻게 평가할지 탐색 중이라고 밝힌 점은, 다음 세대 벤치마크가 단순 점수 경쟁이 아니라 어떤 능력이 아직 불가능한지 구분하는 데 초점을 맞출 거라는 뜻이에요.
참고 링크
Related posts
67 Cents, 1.5 Hours to Train a Tiny Transformer Beating LLMs on ARC-AGI-1
Mithil Vakde trained a tiny Transformer from scratch on one RTX 5090 for $0.67 and 1.5 hours, scoring 44% on ARC-AGI-1 and 7% on ARC-AGI-2. It beats multiple LLMs and matches TRM/HRM.
Claude Fable 5.1 and Mythos 5.1: Same Model, Different Safeguards
Anthropic released Claude Fable 5.1 and Mythos 5.1, sharing one model with different safeguards. Fable is for general users; Mythos is limited to vetted experts, with a 75% cached-input price cut.
Agent Behavior Standard: A New Way to Evaluate AI Agents
Agent Behavior standardizes repeated AI agent actions. This framework makes long-running agent behavior observable and measurable across recognition, judgment, execution, and recovery.
Curated, fact-checked, and edited by a single operator before publishing.