1M AI News에 따르면,3월 4일 구글이 Gemini 3.1 Flash-Lite 미리 보기 버전을 출시했습니다. 이 모델은 Gemini 3 시리즈 중 가장 빠르고 비용이 저렴한 모델로 position되어 있습니다. 이 모델은 Gemini 3 Pro 아키텍처를 기반으로 하며 혼합 전문가(MoE) 디자인을 사용하여 推론 비용을 낮추기 위해 일부 매개변수만 활성화합니다. API 가격은 입력 당 $0.25/백만 토큰, 출력 당 $1.50/백만 토큰이며, 각각 Gemini 3.1 Pro($2/$18)의 약 1/8입니다.
성능적으로는, Gemini 2.5 Flash 대비 첫 번째 토큰 지연이 2.5배 단축되었으며, 출력 속도가 45% 향상되어 초당 363토큰에 이르렀습니다. 최대 입력 100만 토큰 및 출력 6.4만 토큰을 지원하며 텍스트, 이미지, 오디오 및 비디오 입력을 지원합니다. 내부 벤치마크 테스트 11항목 중, Flash-Lite는 GPT-5 mini 및 Claude 4.5 Haiku를 넘어선 6항목에서 GPQA Diamond(박사급과학 질의응답) 86.9%, MMMU-Pro(다중모달 推론) 76.8%, LiveCodeBench(코드 생성) 72.0%를 달성했습니다.
이 모델에는 조정 가능한 "사고 수준"(thinking levels)이 내장되어 있으며, 개발자는 AI Studio 및 Vertex AI에서 모델 推론 깊이를 제어하여 고품질과 비용을 균형 있게 유지할 수 있습니다. 현재 Gemini API(Google AI Studio) 및 Vertex AI를 통해 미리 보기 액세스가 제공 중입니다.