AI AI
속보
심층
이벤트
Pro
더보기
자금 조달 정보
특집
온체인 생태계
용어
팟캐스트
데이터
OPRR
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
XRP
$2.25
2.07%
DOGE
$0.325
2.23%
USDC
$0.999
3.05%

Jev에 과연 진입 장벽이 있는가? OpenJEV는 이미 4개 파벌로 나뉘었다: 말을 안 하는 건 쉽지만, 확률이 믿을 만한 건 매우 어렵다

동찰 Beating AI 속보, Jev가 공개된 지 일주일도 안 되어 오픈소스 커뮤니티에서 이미 '답을 쓰지 않고 확률을 직접 제시하는' 이 모델을 복제하기 시작했다.


이들은 모두 같은 일을 하려 한다: 토큰별 생성을 생략하고 선택지와 확률을 바로 제시하는 것. 하지만 구체적인 방식은 이미 몇 가지 완전히 다른 노선으로 나뉘었다.


1. SemIf는 가장 단순해서 모델을 재학습할 필요조차 없다. 기존 Qwen을 그대로 가져와서, 모델이 A, B, C를 답하려 할 때 가로막고 더 이상 쓰지 못하게 한 뒤, 각 선택지의 점수를 바로 읽어 확률로 변환한다.


2. Simple Jev도 기존 대형 모델을 사용하지만 반복 계산을 더 줄였다. 같은 자료를 한 번만 읽고, 이후 여러 질문이 이 결과를 공유한 뒤 각각 답을 판단한다. 저자도 Jev의 사용 방식을 복제한 것이며 정확도, 속도, 확률 보정 모두 동등하게 달성하지는 못했다고 명확히 밝혔다.


3. Laya는 아예 텍스트를 생성하는 대형 모델을 쓰지 않고, 더 전통적인 분류기에 가까운 인코딩 모델로 바꿨다. 장점은 작고 빠르다는 것이고, 단점도 뚜렷하다. 한 번에 77개 선택지 중에서 고를 때 Laya의 정확도는 42.5%에 불과했고, Jev는 87.0%였다.


4. Von도 전용 의사결정 모델 노선을 걸었다. 약 4억 개 파라미터에 불과하고, 텍스트를 생성하지 않으며, 한 번의 순전파로 Choice, Noul, Score를 직접 완료한다. 자연어를 읽을 수 있는 차세대 분류기에 더 가깝다.


5. Verdict는 더 작아서 약 1.5억 개 파라미터에 불과하다. 저자는 두 가지 문제에 집중했다: 틀렸는데도 높은 신뢰도를 보고하는 것, 그리고 선택지 순서를 바꾸면 결과도 따라 바뀌는 것. 확률과 판단 모두를 안정시키는 데 더 신경 썼다.


6. Kev는 대형 모델을 유지하기로 했다. Qwen을 베이스로 삼고 전용 의사결정 구조를 추가해서, 같은 입력을 한 번만 읽고 여러 질문이 각각 확률을 계산하게 한다. 제3자가 이전에 Jev를 리버스 엔지니어링했을 때도 비슷한 설계를 사용했을 가능성을 추측했다.


Kev의 자체 테스트에서 학습 시 보지 못한 새 문제로 시험했을 때, 8B 버전 정확도는 약 78%, Jev는 약 86%였다. 더 뚜렷한 차이는 신뢰도로, Kev는 일부 틀린 문제에서도 90% 이상의 확신을 제시한다.


7. Nimble은 학습에 중점을 뒀다. Qwen3.5-9B를 사용하고, '사실 하나만 바꾸면 정답이 뒤집히는' 데이터를 준비해 후학습을 진행했다. 학습에 참여하지 않은 324개 테스트 샘플에서 Nimble은 90.1%가 참조 답을 선택했고, Jev는 93.2%였다. 다만 저자도 현재로서는 모델이 '90%라고 보고하면 정말 90% 맞다'고 보장할 수 없다고 당부했다.


8. OpenJev가 가장 멀리 나아가서 아예 DiffusionGemma로 교체했다. 먼저 몇 개의 답변 위치를 비워두고, 확산 모델이 이미지를 채우듯이 한 번에 채워 넣는다. RTX PRO 6000에서 단일 요청 중위 지연은 약 94ms이다.


며칠 사이에 OpenJEV는 이미 네 갈래로 나뉘었다: 기존 모델의 답변 점수를 직접 읽는 방식, 전용 의사결정 모델을 훈련하는 방식, 대형 모델을 의사결정 모델로 개조하는 방식, 그리고 확산 모델로 답변을 직접 채우는 방식.


Jev 이 노선은 따라 하기 쉬워 보인다. 진짜 격차를 벌리는 것은 여전히 정확도, 일반화, 확률 보정이다. 모델이 감히 90%라고 보고할 때, 이 90%가 얼마나 믿을 만한지가 가장 어려운 부분이다.

举报 오류 신고/제보
오류 신고/제보
제출
새 문고 추가
자신만 보기
공개
저장
문고 선택
새 문고 추가
취소
완료