블로그 목록
테크 블로그 & 팁

ARC-AGI-3에서 GPT-6 Astra 99.9%가 보여준 것과 숨겨진 것

ARC-AGI-3 벤치마크에서 GPT-6 Astra가 Standard 62.7%, Provider Adapter 99.9%를 기록했어요. 높은 점수만큼 비용과 평가 조건의 차이도 함께 봐야 해요. 이 글은 공식 결과와 비용 비교, 행동 효율성, 대수적 속기, 그리고 99.9%가 AGI 증거가 아니라 벤치마크 포화일 뿐이라는 이유를 정리했어요.

2026년 9월 4일 6분 읽기

ARC-AGI-3가 보여준 것

ARC-AGI-3 Semi-Private에서 GPT-6 Astra가 Standard 62.7%, **Provider Adapter 99.9%**를 기록했어요. 같은 모델이 평가 조건에 따라 두 배 이상 점수 차이가 나는 상황은, 벤치마크 해석에 있어 "조건이 곧 의미"라는 점을 다시 보여줍니다.

ARC Prize가 2026년 9월 3일 공개한 결과에 따르면, Standard 하네스는 모델이 환경에서 직접 가시적 메모를 선택하고 전달하는 최소 인터페이스예요. 반면 Provider Adapter는 공급자가 설계한 문맥 관리 기능까지 허용하는 설정으로, 요청 사이의 추론 상태 보존과 긴 대화 압축을 사용해요. 같은 Astra라도 어느 하네스로 평가하느냐에 따라 성능과 비용이 크게 달라지는 구조예요.

벤치마크가 묻는 네 가지 능력

ARC-AGI-3는 명시적 지시 없이 새로운 턴 기반 환경을 탐색하고 규칙을 발견하며 내부 모델을 만든 뒤 행동을 계획하는 에이전트 지능 벤치마크예요. 기존 ARC-AGI-1·2와 달리 다음 네 가지 요소를 함께 평가해요.

  • 탐색: 환경과 상호작용하며 필요한 정보를 능동적으로 얻어내는 능력
  • 모델링: 원시 관찰을 미래 상태와 결과를 예측할 수 있는 일반화된 모델로 바꾸는 능력
  • 목표 설정: 희소한 보상만으로 목표 상태를 식별하는 능력
  • 계획과 실행: 현재 상태에서 목표까지 경로를 만들고 새 정보에 맞춰 수정하는 능력

환경은 핵심 지식 사전 요소만 포함하고, 인간 참가자 실험으로 난이도가 조정돼요. 인간은 이 환경의 100%를 해결할 수 있다고 ARC Prize는 밝혀요.

Astra의 점수와 비용

Standard와 Provider Adapter 모두에서 Astra는 최고 수준 점수를 기록했어요. Standard Astra(max)는 62.7%에 $26,098였고, Provider Adapter Astra(high)는 99.9%에 $18,817이었어요. 추론 수준이 높을수록 행동·모델 호출·토큰이 줄어 비용이 낮아지는 경향이 나타나, max 추론이 오히려 가장 낮은 비용을 기록하기도 했어요.

추론 수준StandardProvider Adapter
max62.7%, $26,09898.6%, $17,332
xhigh59.3%, $37,31798.4%, $18,147
high54.8%, $40,70599.9%, $18,817
medium38.6%, $48,09098.4%, $19,285
low17.5%, $38,16698.0%, $21,298
none35.2%, $49,79196.7%, $23,457

공식 리더보드와 전체 결과는 ARC Prize 웹사이트에서 확인할 수 있어요.

인간보다 적었던 행동 수

ARC-AGI-3는 퍼즐 경험이나 능력으로 선발하지 않은 일반인 약 500명을 대상으로 행동 효율성 기준선을 만들었어요. AI가 더 많은 행동을 사용하면 효율성이 낮고, 더 적게 사용하면 높아요.

Provider Adapter의 Astra(max)는 완료한 레벨 중 96.0%에서 인간 중앙값보다 적은 행동을 사용했어요. 레벨당 평균 행동 수도 인간보다 51.7% 적었어요. 환경을 해결하더라도 인간보다 훨씬 많이 탐색할 것으로 예상했던 것과 달리, Astra는 역학을 이해한 뒤 인간 효율성 범위 안에서 실행하는 양상을 보였어요.

대수적 속기로 만든 세계 모델

Astra의 눈길을 끌었던 점 중 하나는 낯선 게임 환경에서 즉석으로 대수적 속기를 만들어 객체·좌표·규칙·미완료 계획을 압축 기록한 거예요. 완전한 프로그래밍 언어보다는 실행 중 만드는 도메인 특화 표기법에 가까웠어요.

예를 들어 게임 상태는 L8: hub q2 (8↓). Lengths: 14=1…처럼 레벨, 지역 회전 인덱스, 장치 길이를 기록했고, 다단계 계획은 extend8 to3; retract10 to2; shorten8 to1처럼 변경 순서를 저장했어요. 조작과 좌표는 9-=(39,4), rotate=(49,18), 14+=(59,11)으로 연결했고, 시간과 위치는 Turn 5: P=(24,20), empty, facing west로 나타냈어요. 이런 표기는 게임별 소프트웨어 라이브러리까지 제작한 PRO-LONG 하네스에서도 관찰되는 패턴이에요.

ARC-AGI-3 리더보드출처: ARC Prize

두 하네스는 서로 다른 질문에 답한다

Standard 하네스는 공급자 중립적인 최소 인터페이스에서 모델을 비교해요. 게임 해결에 필요한 정보는 제공하지만, 무엇을 가시적 메모로 보존할지는 모델이 결정해요. 반면 Provider Adapter는 모델 공급자가 설계한 문맥 관리 기능까지 활용할 때의 성능을 측정해요. Astra의 Provider Adapter는 요청 사이의 불투명한 추론 상태를 보존하고 장기 대화 압축을 사용했어요.

Public과 Semi-Private 전체, 모든 추론 수준에서 두 하네스가 모두 해결한 167개 게임·추론 조합을 비교하면, Provider Adapter가 기록된 경과 시간 기준 약 3.66배 빨랐고 전체 토큰도 49% 적게 사용했어요. 향후 ARC Prize는 두 하네스 결과를 조건이 명확히 구분된 형태로 리더보드에 함께 게재할 예정이라고 밝혔어요.

99.9%가 AGI가 아닌 이유

Astra의 결과는 분명 프런티어 모델에서 뚜렷한 단계적 변화를 보여주지만, ARC-AGI-3의 범위와 형식은 엄격히 제한돼 있어요. 환경의 역학과 목표가 결정적이고 폐쇄적이어서 현실 세계의 복잡성과 개방성을 대표하지 못해요. 벤치마크 포화는 AGI 달성의 증거가 아니며, ARC Prize도 이를 분명히 선언했어요.

앞으로 재귀적 자기 개선과 개방형 혁신을 어떻게 평가할지 탐색 중이라고 밝힌 점은, 다음 세대 벤치마크가 단순 점수 경쟁이 아니라 어떤 능력이 아직 불가능한지 구분하는 데 초점을 맞출 거라는 뜻이에요.

참고 링크

#ARC-AGI#GPT-6 Astra#OpenAI#AGI 벤치마크#AI 평가

관련 글

테크 블로그 & 팁

67센트로 1.5시간 학습한 소형 Transformer, ARC-AGI-1에서 여러 LLM을 앞서다

Mithil Vakde가 RTX 5090 한 장으로 1.5시간·67센트만 들여 소형 Transformer를 처음부터 학습시킨 결과가 공개됐어요. ARC-AGI-1에서 44%, ARC-AGI-2에서 7%를 기록하며 여러 LLM을 앞서고, TRM·HRM과도 비슷한 수준의 성능을 냈어요.

#ARC-AGI#소형Transformer#표본효율성
2026년 9월 2일 5분 읽기
테크 블로그 & 팁

Claude Fable 5.1과 Mythos 5.1, 같은 모델 다른 안전장치

Anthropic이 동일 기반 모델에 서로 다른 보호 장치를 적용한 Claude Fable 5.1과 Mythos 5.1을 공개했다. Fable은 일반 사용자용이며 캐시 읽기 가격 75% 인하로 최대 45% 저렴해지고, 코딩·지식 노동·장기 에이전트 작업에서 성능이 크게 개선됐다. Mythos는 검증된 사이버 보안·생명과학 전문가만 접근할 수 있다.

#Claude#AI 모델#AI 안전성
2026년 9월 2일 6분 읽기
테크 블로그 & 팁

AI 에이전트 평가의 새로운 틀: Agent Behavior 표준이 말하는 것

AI 에이전트의 반복 행동을 문서화해 평가 기준으로 삼는 Agent Behavior 표준이 공개됐어요. 단일 성과 지표로는 파악하기 어려운 장기 실행 에이전트의 행동을, 확인·판단·실행·복구 흐름으로 나눠 평가할 수 있도록 돕는 개방형 포맷이 특징이에요.

#AI에이전트#AgentBehavior#AI평가
2026년 8월 29일 5분 읽기
Robeedau

발행 전 운영자가 직접 큐레이션·검수·편집합니다.