홈
AI AI
속보
심층
이벤트
Pro
더보기
자금 조달 정보
특집
온체인 생태계
용어
팟캐스트
데이터
OPRR
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
XRP
$2.25
2.07%
DOGE
$0.325
2.23%
USDC
$0.999
3.05%

GLM-5.2가 미세 조정 랭킹 1위를 차지하며 논란을 불러일으키자, 벤치마크 작성자가 "Claude를 증류한 것이 아니다"라고 해명했다.

동차 Beating 모니터링에 따르면, 오픈소스 모델 GLM-5.2가 자체 미세 조정 벤치마크 PostTrainBench에서 1위를 차지했으나, 비판자 scaling01은 이것이 실질적인 가치가 부족하다고 지적했습니다. 그는 모델 순위가 몇 달 만에 22위에서 1위로 급등한 것은 극히 이례적이며, 테스트에 숨겨진 데이터셋이 없어 에이전트가 순위 조작을 통해 목표 지향적 최적화를 유도하기 쉽고, 이렇게 도출된 모델은 실제 환경에서 적용되기 어렵다고 주장했습니다.

그러나 지지 측은 단일 H100 GPU에서 10시간 제한 조건 하에 에이전트가 일반적인 미세 조정을 완료하도록 요구하는 것은 현실적이지 않으며, 목표 지향적 최적화는 머신러닝에서 흔한 방식이라고 반박했습니다. 공개된 로그에 따르면, GLM-5.2는 명확한 실험 논리를 갖추고 있으며, 다양한 샘플링 가설의 데이터를 자동으로 수집하고, 성능 기준 설정, 미세 조정, 거부 샘플링을 통한 데이터 필터링의 완전한 체인을 자율적으로 계획하며, 사고 체인에서 과적합을 회피하려는 시도를 보여줍니다.

이번 논란의 더 큰 가치는 원래 미세 조정 능력을 평가하기 위해 사용된 공개 실행 궤적이, 우연히 국내 대형 모델의 '중증 증류 Claude' 업계 소문을 무너뜨렸다는 점입니다. 벤치마크 작성자 Maksym Andriushchenko는 GLM-5.2 로그를 검토한 후, 모델이 데이터 수집, 전략 조합 및 결정 경로에서 Claude와 본질적인 차이를 보이며, 모방이나 증류의 흔적이 없다고 지적했습니다. 제3자 벤치마크의 공개적 투명성은 오히려 오픈소스 대형 모델이 독창적인 연구 개발 역량을 입증하는 가장 직접적인 창구가 되었습니다.

举报 오류 신고/제보
인기 기사
오류 신고/제보
제출
새 문고 추가
자신만 보기
공개
저장
문고 선택
새 문고 추가
취소
완료