블로그 목록
테크 블로그 & 팁

67센트로 1.5시간 학습한 소형 Transformer, ARC-AGI-1에서 여러 LLM을 앞서다

Mithil Vakde가 RTX 5090 한 장으로 1.5시간·67센트만 들여 소형 Transformer를 처음부터 학습시킨 결과가 공개됐어요. ARC-AGI-1에서 44%, ARC-AGI-2에서 7%를 기록하며 여러 LLM을 앞서고, TRM·HRM과도 비슷한 수준의 성능을 냈어요.

2026년 9월 2일 5분 읽기

67센트와 1.5시간으로 ARC-AGI-1에서 44%

Mithil Vakde가 2026년 7월 25일 공개한 블로그에 따르면, RTX 5090 한 장에서 소형 Transformer를 처음부터 학습해 ARC-AGI-1 공개 평가에서 44%, ARC-AGI-2에서 **7%**를 기록했어요. 학습부터 추론까지 전체 비용은 약 67센트, 소요 시간은 1.5시간이에요. LLM처럼 거대 모델이나 방대한 사전학습 없이, 단일 GPU에서 단일 트랜스포머가 낸 결과치로는 상당히 높은 수준이에요.

표본 효율성이 중요한 이유

이 실험의 핵심 목표는 표본 효율성이에요. 최근 AI 연구는 연산량과 매개변수를 늘려 성능을 얻는 경우가 많지만, 이 접근은 비용이 빠르게 증가해요. 표본 효율성을 높이면 적은 데이터와 적은 연산으로도 의미 있는 성능을 낼 수 있으니, 연구자들이 실험을 반복하기 훨씬 쉬워져요. ARC 벤치마크는 이 목표를 시험하기에 적합해요. 전체 퍼즐이 약 1,000개로 적고, 각 퍼즐은 다른 규칙을 공유하는 메타학습 과제라서 일반화 능력을 직접 확인할 수 있거든요.

모델은 어떻게 학습시키나요

기본 구조는 비교적 단순해요. 입력·출력 격자 쌍을 토큰 시퀀스로 바꾸고, 소형 Transformer가 자기회귀 방식으로 다음 토큰을 예측하도록 학습시켜요. 여기서는 입력 토큰까지 학습하는 대신 출력 토큰만 손실 계산에 사용하는 지도학습 방식을 택했어요. 이 변경만으로 점수가 약 40%에서 44%로 올랐다고 해요. 다만 테스트 손실은 오히려 나빠졌는데, 소규모 데이터에서 최저 검증 손실만을 목표로 하는 기존 방식과는 다른 failure mode를 보여줘요.

위치 정보는 3D RoPE로 인코딩하고, 각 퍼즐마다 별도의 학습 가능한 과제별 임베딩을 부여해요. 색상 순열과 이면체 변환으로 시퀀스를 증강하고, 추론 때는 테스트 입력을 변환한 뒤 출력에 역변환을 적용한 뒤 가장 빈번한 출력 2개를 제출하는 AAIVR 방식을 써요.

아키텍처 변경이 성능을 높인 핵심

저자는 기존 결과에서 점수를 약 40%에서 44%로 끌어올린 설계 요소를 구체적으로 정리했어요. 성능 향상에는 3D RoPE, 과제별 임베딩, SwiGLU, RMSNorm, 8개 계층이 크게 기여했어요. 비용 절감에는 NorMuon 옵티마이저로의 전환과 가변 길이 FlashAttention, 추론용 FlexAttention 커널이 핵심이에요.

절제 실험 결과를 보면 3D RoPE를 1D RoPE로 바꾸면 점수가 약 24%로 떨어지고, 과제별 임베딩을 제거해도 마찬가지로 약 24%로 하락해요. 두 요소가 표현력에 얼마나 중요한지 보여주는 수치예요. 입력 토큰까지 학습하면 점수가 약 39%로 소폭 하락하고, 여러 실행에서 해결된 과제의 합집합은 **55%**라서 같은 체계 안에서 65% 도달 가능성도 열려있어요.

67센트 논란과 테스트 시점 학습 구분

이 결과는 일각에서 '테스트 데이터 학습'이 아니냐는 비판을 받았어요. 저자는 평가 퍼즐의 테스트 출력 라벨은 숨겨져 있었고, 학습에 사용하지 않았다고 명확히 설명해요. ARC는 메타학습 벤치마크라서 평가 퍼즐의 예제 쌍까지 학습하는 것이 허용된다는 점도 강조해요. 또 67센트는 사전학습 비용을 제외한 모델 초기화부터 전체 과제 추론까지 포함한 평생 계산 비용으로, Vast.ai에서 RTX 5090을 2시간 사용한 가격 기준이에요.

왜 이 결과가 중요한가요

단일 트랜스포머만으로 ARC-AGI-1에서 44%를 달성한 건, 합성 데이터나 거대 모델 없이도 적은 비용으로 표본 효율성을 높일 수 있는 경로가 있음을 보여줘요. 공개 코드와 상세한 구현 변경 사항도 함께 공개돼서, 다른 연구자가 같은 체계에서 비용을 더 낮추거나 점수를 높이는 실험을 직접 할 수 있어요. 다만 모든 평가 과제를 한꺼번에 학습하는 방식이 현실 문제와는 다르다는 비판도 타당하니, 이 결과가 어떤 조건에서 성립하는지 구분해서 보는 게 좋아요.

참고 링크

#ARC-AGI#소형Transformer#표본효율성#RTX5090#3DRoPE

관련 글

테크 블로그 & 팁

Claude Fable 5.1과 Mythos 5.1, 같은 모델 다른 안전장치

Anthropic이 동일 기반 모델에 서로 다른 보호 장치를 적용한 Claude Fable 5.1과 Mythos 5.1을 공개했다. Fable은 일반 사용자용이며 캐시 읽기 가격 75% 인하로 최대 45% 저렴해지고, 코딩·지식 노동·장기 에이전트 작업에서 성능이 크게 개선됐다. Mythos는 검증된 사이버 보안·생명과학 전문가만 접근할 수 있다.

#Claude#AI 모델#AI 안전성
2026년 9월 2일 6분 읽기
테크 블로그 & 팁

AI 에이전트 평가의 새로운 틀: Agent Behavior 표준이 말하는 것

AI 에이전트의 반복 행동을 문서화해 평가 기준으로 삼는 Agent Behavior 표준이 공개됐어요. 단일 성과 지표로는 파악하기 어려운 장기 실행 에이전트의 행동을, 확인·판단·실행·복구 흐름으로 나눠 평가할 수 있도록 돕는 개방형 포맷이 특징이에요.

#AI에이전트#AgentBehavior#AI평가
2026년 8월 29일 5분 읽기
테크 블로그 & 팁

GLM-5.3 오픈웨이트, 단일 모델로 코딩·에이전트·보안을 한 번에 바꾼다

Z.ai가 GLM-5.3 오픈웨이트를 공개했다. 같은 기반 모델에 후속 학습만으로 코딩·장기 에이전트·사이버 보안 성능이 크게 올랐고, 직접 배포·미세 조정도 가능하다. 오픈 소스 LLM 사용처를 다시 고민하게 만드는 발표다.

#GLM-5.3#오픈웨이트#코딩 LLM
2026년 8월 29일 6분 읽기
Robeedau

발행 전 운영자가 직접 큐레이션·검수·편집합니다.