동찰 Beating AI 속보, 즈푸가 GLM-5.3-FlashX를 출시했다. GLM-5.3-Flash의 고속 버전으로 이해할 수 있으며, 최대 출력 속도가 200 tokens/s에 달한다. 공식적으로 이번에는 새로운 성능 벤치마크나 아키텍처 변화를 공개하지 않았고, 업데이트의 핵심은 추론 속도를 계속 높이는 것이다.
이번 발표는 어제의 추론 시스템 최적화 직후에 이루어졌다. 즈푸는 방금 GLM-5.3 기반의 Infra Agent가 Flash의 추론 인프라 최적화에 참여했다고 밝혔다. 2주도 안 되어 엔드투엔드 처리량이 최초의 약 3배로 향상되었으며, 전체 서비스가 10만 장 이상의 중국산 AI 칩에서 운영되고 있다.