동찰 Beating 트래킹에 따르면, 텐센트 혼원 및 SSV 디지털 문화 실험실이 중국 과학원 정보통신 연구소 등 기관과 공동으로, 「Qi Character Transformation」을 보유한 최초의 감성 평가 기준 Chronicles-OCR을 공식 발표했습니다. 이 기준은 전문가들이 교차로 지정한 2,800장의 이미지를 포함하며, 갑부자조 등 7종류의 서체의 인식 난이도를 최초로 통합적으로 측정합니다.
연구 팀은 28개의 주류 다중모달 대언어 모델을 평가했으며 결과는, 그들이 옛서체에서 거의 완패했음을 보여줍니다. 시대를 초월하는 문자 감지 작업에서, GPT-5와 Gemini 2.5 Pro의 핵심 지표는 거의 0에 가까우며, 최고의 모델도 16.5 뿐입니다. 심지어 이미지 상에서 직접 상자를 그려 위치 설정 단계를 생략한 경우에도, 최고 정확도는 27.1%로, 그 중 Gemini 3.1 Pro의 갑부자조에서의 정확도는 14.0%에 불과합니다.
이것은 현대 모델이 현대적 레이아웃 선행 조건에 매우 의존하고 있음을 입증합니다. 자유롭고 강력한 노이즈가 있는 고대 물리 매체에 직면할 때, 모델의 텍스트 분할 메커니즘은 직접 실패합니다. 폰트 분류 결과는 모델이 주로 매체 질감(거북 등껍질 또는 청동 녹슨 것과 같은)을 인식하고 있음을 보여줍니다.
실험은 한 가지 비직관적인 현상을 드러냈습니다: 사고 모드를 활성화하면 오히려 고대 문자의 인식률이 하락합니다. 대조적으로, 이 모드를 지원하는 모든 모델은 사고를 활성화한 후 성능이 하락합니다. 기본 시각적 인식이 부족한 경우, 사고 체인은 오류를 교정하는 데 도움이 되지 않을 뿐만 아니라, 일반적으로 확신 있게 잘못된 답을 출력하는 환상 증폭기가 됩니다.