동찰 Beating AI 속보, 애플이 장문 문서 처리를 전문으로 하는 시각 언어 모델 LensVLM-9B를 오픈소스로 공개했으며, 이 모델은 Qwen3.5-9B-Base를 기반으로 훈련되었다. 장문 문서를 처리할 때, 먼저 전체 문서를 저해상도 페이지로 압축하여 빠르게 훑어본 후, 관련 페이지를 찾으면 그 안의 원본 텍스트나 고해상도 이미지를 읽는다.
이렇게 하면 전체 텍스트를 모델 컨텍스트에 모두 넣을 필요가 없다. 논문에서 100페이지 문서를 테스트했을 때, 전체 텍스트를 직접 읽으면 51,273개의 토큰이 필요했지만, LensVLM은 8,090개만 사용했다. 이에 대응하는 KV 캐시는 약 1.6GB에서 253MB로 줄어 84.2% 감소했다.
압축 후에도 정확도는 크게 떨어지지 않았다. 7개 문서 질의응답 테스트에서 전체 텍스트를 직접 읽는 평균 정확률은 72.4%였고, LensVLM은 약 4.3배 압축에서도 68.9%를 유지했다. 텍스트를 이미지로 축소하여 모델이 인식하게 하는 방식과 비교했을 때, 동일하게 약 5배 압축 시 정확률이 31.3%에서 68.9%로 향상되었다.
다만, 현재로서는 속도가 더 느리다. LensVLM은 관련 페이지를 찾은 후 원문을 읽기 위해 도구를 한 번 더 호출해야 하므로 연속 두 번의 추론을 실행해야 한다. 논문 테스트에서 한 번 답변에 약 17초가 소요되었으며, 이 압축 방식을 사용하지 않고 전체 문서를 텍스트로 Qwen3.5-9B에 직접 입력하면 한 번 답변 생성에 약 8초가 소요되었다.