블로그 목록
AI/ML 리서치

CoT 텍스트의 중요도, judge로 읽힐 수 있을까? Legibility ≠ Interpretability

Kevin Du, Alexander Hoyle, Laura Ruis, Acyr Locatelli의 COLM 2026 논문. chain-of-thought 텍스트의 단계 중요도를 advantage로 정의하고 LLM judge가 이를 식별하는 정량 평가를 수행했다. 텍스트만으로는 step importance를 완전히 복원하기 어렵다는 결과다.

2026년 9월 6일 5분 읽기

왜 이 논문이 지금 필요한가

chain-of-thought(CoT) 텍스트가 모델의 추론을 “읽을 수 있게” 보여준다는 인식은 널리 퍼져 있어요. LLM judge, process reward model, generative critic 같은 도구들이 CoT 단계를 분석해 오답을 진단하거나 단계별 보상을 제공하는 연구가 늘고 있죠. 그런데 텍스트가 실제로 모델이 생각한 것과 같은 비중을 담고 있을까요. 2026년 9월 arXiv에 공개된 이 COLM 2026 논문은 이 질문에 정량적 답을 내놨어요.

핵심 개념: advantage로 단계 중요도 측정

저자들은 CoT에서 각 단계의 중요도를 advantage로 정의해요. RL에서 advantage는 “현재 상태에서 이 행동이 평균 대비 보상에 얼마나 기여하는가”를 측정하는 값이죠. 논문에서는 각 reasoning step을 제외하고 다시 sampling했을 때 최종 정답률이 얼마나 변하는지 Monte Carlo rollout로 추정해요. 변화가 충분히 크면 그 step을 consequential, 작거나 무효면 uninformative로 labeling해요. 단, 이 labeling은 단순히 텍스트 내용을 보는 게 아니라 실제 모델 동작에 기반한 ground truth 기반이에요.

실험 결과: judge와 fine-tuned critic의 한계

이제 이 “실제 중요도”를 LLM judge가 얼마나 잘 찾는지 실험했어요. Qwen3-1.7B부터 Qwen3-32B, Qwen3-6-27B까지 여러 judge를 zero-shot으로 테스트했고, 각 backbones 위에 regression head를 추가해 fine-tuned critic도 학습했어요. 평가지표는 PR-AUC와 precision@k%예요.

결과는 명확해요. out-of-the-box judge는 규모가 커져도 noise ceiling에 크게 못 미치고, fine-tuned critic은 incorrect response에서 PR-AUC 0.280.30(내부 분포), 0.180.32(외부 분포)로 noise ceiling의 절반 수준까지 올라갑니다. 반면 correct response에서는 0.0650.10**으로 **noise ceiling의 1020% 수준이에요. 즉, 모델이 정답을 맞춘 경우 그 과정에서 어떤 step이 결정적이었는지 텍스트만 보고 식별하는 게 매우 어렵다는 거죠.

추가로, 저자들은 cue 기반 faithfulness test를 advantage로 보완해요. “정답은 B이다” 같은 cue를 주면 모델이 reasoning step에서 cue를 언급하지 않아도 최종 답은 cue를 따르는 경우가 많아요. base 설정에서는 58%의 응답이 consequential step을 가졌지만, cue 설정에서는 15%로 줄어들어요. 텍스트에 cue가 보이지 않아도 모델의 내부 추론이 cue로 “결정론적”으로 굳어질 수 있다는 의미에서 중요한 발견이에요.

실제 함의: CoT 해석에 대한 경고

이 연구는 단순히 “judge가 부족하다”는 말보다 더 깊은 시사점을 담고 있어요. reasoning step의 중요도가 advantage라는 RL 개념으로 정의될 때, 텍스트만으로는 그 중요도를 완전히 복원하기 어렵다는 거죠. process reward model이나 generative critic가 step-level 보상이나 피드백을 제공하려면 텍스트 외에 추가적인 신호를 고려해야 한다는 경고로 읽힐 수 있어요.

한편, 저자들은 thinking 모델이나 큰 규모의 모델이 성능을 높이는 이유가 “추론 과정에서 정답을 찾는 게” 아니라 첫 단계부터 이미 높은 prior을 가지고 시작하기 때문임을 보여줘요. 이는 CoT가 모델의 “사고 과정”이라기보다는 강한 사전 확률을 표현하는 수단일 수 있음을 시사해요.

연구 코드와 데이터는 공개되어 있어요. GitHub 저장소는 https://github.com/kdu4108/importance-advantage, 데이터셋은 Hugging Face에서 확인할 수 있어요.

Figure 17. Qwen3-1.7B thinking 모델의 base/cue 설정에 대한 혼동 행렬출처: arXiv:2609.04194

참고 링크

#CoT 해석성#advantage#chain-of-thought#LLM judge#process reward model
Robeedau

발행 전 운영자가 직접 큐레이션·검수·편집합니다.