코드 리뷰 비용 45배 줄인 Jev, 정확도는 어떤가
TypeSafe의 System One 모델 Jev를 Gemini 3.8 Flash·Claude Fable 5.1과 같은 Python 코드 리뷰 과업에 넣고 비용·속도·정확도·일관성을 비교한 벤치마크예요. Jev가 비용을 45~274배 아끼고 응답도 4~5배 빠르지만, 정확도 98%로 소폭 손해를 봐요.
코드 리뷰, 비싼 모델만 쓸 필요는 없을까
AI 코드 리뷰를 자동화하면 병목은 "정확도"만 남는 게 아니에요. 대형 모델을 부를 때마다 비용과 응답 지연이 쌓이니까요. 최근 해커뉴스에서 화제가 된 벤치마크가 "그래서 좀 더 싸고 빠른 모델로 일부는 거를 수 있냐"는 질문에 실제 수치로 답했어요.
주인공은 TypeSafe가 만든 Jev라는 System One 모델이에요. 이를 Gemini Flash(3.8)와 Claude Fable(5.1)와 같은 코드 리뷰 과업에 넣고, 비용·속도·정확도·일관성을 직접 비교한 실험이거든요. 원문 README 링크로 누구나 재현할 수 있게 데이터와 스크립트까지 공개되어 있어요.
Jev는 뭘 하는 모델인가
Jev는 TypeSafe의 대표 System One 모델이에요. 일반 LLM이 문장을 생성하는 방식과 달리, 정해진 질문(question)을 받아 구조화된 답변을 바로 돌려줘요. 질문 유형은 Choice(선택), Score(점수), Noul(참/거짓) 세 가지이고, 각 답변에 확률과 신뢰도가 따라와요. 코드가 직접 분기하거나 정렬하고 라우팅할 수 있게요.
벤치마크는 이 점을 활용해서, 파이썬 코드와 리뷰 규칙 4개를 주고 "이 코드가 각 규칙을 지키는가"를 묻는 방식으로 진행됐어요. 같은 질문을 Jev, Gemini Flash, Claude Fable 세 모델에 모두 보냈죠.
비교 방법과 핵심 수치
실험 구성부터 보면 꽤 탄탄해요. 24개의 작은 프로그램 패밀리, 패밀리당 5가지 코드 버전, 3라운드 반복으로 메인 비교 호출만 1,080회를 실행했어요.
리뷰마다 규칙 4개를 확인하고, 숨겨진 동작 검사와 소스 검사로 정답을 확정했어요. 실행일은 2026년 9월 17일, 비교 모델은 중간 reasoning 설정이에요.
| 지표 | Jev | Gemini 3.8 Flash | Claude Fable 5.1 |
|---|---|---|---|
| 360건 실제 비용 | $0.01545 | $0.69965 | $4.24097 |
| 1,000건 환산 비용 | $0.043 | $1.943 | $11.780 |
| 응답 중앙값 | 0.75초 | 3.59초 | 4.31초 |
| 정확도 | 98.0% | 100% | 100% |
| 코드 품질 점수 | 99.5% | 100% | 100% |
| 3라운드 결정 변경 | 0.83% | 0% | 0% |
출처: gemanor/jev-code-review-benchmark 문서
비용 차이와 응답 시간
비용 차이는 숫자로 보면 체감이 커요. 같은 360건 기준으로 Jev는 $0.015, Flash는 $0.70, Fable은 $4.24였고, 1,000건으로 환산하면 각각 $0.04 / $1.94 / $11.78이에요. README 기준으로 Jev가 Flash보다 45배, Fable보다 274배 싼 셈이죠.
응답도 중앙값 0.75초라서 대화형 도구에 붙이기 좋은 수준이에요. 다만 정확도에선 손해를 봐요. Jev의 정확도는 98.0%(95% 신뢰구간 94.7100%), 코드 품질 점수는 99.5%(98.8100%)인데, 두 비교 모델은 100%였죠.
3라운드를 돌렸을 때 Jev는 0.83%에서 결정이 바뀌었지만 경쟁 모델은 0%였어요. 이것도 "작은 예제 + 명시적 규칙"이라는 한정된 환경이라, 프로덕션 코드 리뷰나 맥락 없는 버그 발견까지 일반화할 수는 없어요.
출처: gemanor/jev-code-review-benchmark 문서
"Jev로 먼저, 애매한 건 크게" 라우팅 구상
저자가 제시한 실용 구상은 하이브리드 라우팅이에요. Jev로 먼저 거르고, 일부(보낼 비율 p)만 Gemini로 올리면 비용이 Jev 단가 + p × Gemini 단가가 돼요.
5%만 올려 보내면 결합 비용이 Gemini 단독 대비 약 14배 낮아진다는 계산이에요. 다만 이건 정확도 검증이 안 된 추정치일 뿐이라 강조했어요. "정확도가 2% 낮다고 2%만 올려보내면 된다"는 뜻이 아니라는 점을 명시적으로 경고해요.
Jev가 네이티브 확률을 돌려주는 점은 이런 라우팅에 유리한 요소로 보여요. 단, 확률 값 자체가 오류를 잡는 법칙을 보장하진 않는다는 게 저자의 결론이에요.
실용 시사점과 한계
이 벤치마크의 가장 큰 가치는 독립적으로 재현 가능하다는 점이에요. Python 3.12과 uv만 있으면 uv run determinest check로 로컬 검사를 돌리고, API 키를 넣으면 smoke($2)/study($25) 프로필로 직접 실험을 재현할 수 있어요. 데이터·스크립트·결과 차트가 전부 공개되어 있어, "제품 마케팅 수치"가 아니라 검증 가능한 결과라는 뜻이에요.
주의할 한계도 분명해요. 실험이 작고 인위적인 예제에 "명시적 규칙" 기반이라 실전 PR 리뷰나 맥락 있는 버그 발견을 재현하진 못하고, 두 대형 모델이 100%여서 유의미한 구간 비교가 어렵고, Gemini는 reasoning을 낮춘 설정이 API에서 400 오류로 거부돼 모든 설정을 살펴보지 못했어요. 다른 작업에서도 Jev가 싸다는 결론은 아직 가설 단계예요.
어떤 팀이든 "전체 리뷰를 다 비싼 모델에 넣을 필요가 있나"를 고민하는 시점이라면, 이 자료가 좋은 출발점이 될 거예요. 단순 규칙 점검 같은 고빈도·저위험 작업을 싸고 빠른 모델로 돌리고, 진짜 어려운 건 큰 모델로 올리는 구조를 실제 수치로 비교해 볼 수 있거든요.
참고 링크
관련 글
IT 뉴스 & 트렌드Anthropic, 평가자를 사내 상주시키는 실험을 시작해요
Anthropic이 Accenture와 손잡고 프런티어 AI의 독립 평가 체계를 만들기 시작했어요. 평가자가 회사 내부에 상주하며 직원급 접근권으로 모델 훈련과 배포 과정을 지켜보는 '내장 평가'의 첫 실험인데, 양사는 5년간 각각 최소 10억 달러를 투자할 계획이에요.
Gemini가 후임 모델을 9달러에 스스로 훈련했다
개발자가 취미용 스크래퍼의 댓글 단위 AI 결제를 줄이려고, Gemini에 라벨을 한 번만 맡기고 오픈소스 NER 모델 GLiNER로 이식했다. 총비용은 라벨 9달러+GPU 2.5달러이고 결과는 검증셋 0.83 F1. 작은 파인튜닝 일감의 실제 비용과 삽질을 솔직하게 공개한 HN 인기글이다.
IT 뉴스 & 트렌드앱 마케팅 이미지를 AI 에이전트에게 맡기는 시대가 왔어요
Show HN에 오픈소스 '에이전트 스킬'이 올라왔어요. 앱 스크린샷과 화면 녹화만 넘겨주면 App Store·Play 스토어용 스크린샷, 소셜 카드, 3D 디바이스 목업과 프로모 영상을 로컬에서 자동 생성해 줍니다. Claude Code·Codex·Cursor·Gemini CLI에서 동작해요.
발행 전 운영자가 직접 큐레이션·검수·편집합니다.