동차 Beating 모니터링에 따르면, MiniMax H3 팀은 Reddit AMA에서 전용 이미지 모델을 개발 중이며 오픈 웨이트를 계획하고 있다고 밝혔습니다. 이 모델은 텍스트-이미지 생성과 일반 이미지 편집을 하나의 모델에 통합할 예정이며, 현재 후처리 최적화 단계에 진입했습니다.
이 모델은 H3와 동일한 아키텍처 접근 방식을 공유합니다. H3의 VAE 인코더를 사용하고, 이미지 생성을 위해 별도의 VAE 디코더를 설계할 예정입니다. MiniMax가 구상하는 워크플로우는 먼저 이미지 모델로 첫 프레임을 생성한 후, H3에 넘겨 비디오 생성을 계속하는 것입니다.
팀은 또한 H3 자체가 이미 이미지 생성 및 수정 잠재력을 보여주고 있다고 언급했습니다. 이전에는 '첫 프레임 + 텍스트 설명'을 기반으로 마지막 프레임을 예측하도록 모델을 훈련했을 뿐, 이미지 편집 전용 훈련은 하지 않았지만, 모델은 여러 이미지 편집 평가에서 강력한 제로샷 능력을 보여주었습니다. 이것이 MiniMax가 이 아키텍처를 이미지 모델로 확장하는 중요한 근거입니다.
