동차 Beating AI 속보, OpenAI가 이제 유료 고속 모드 'Ultra Fast'를 도입했습니다. 돈을 지불하면 모델이 더 빠르게 응답할 수 있습니다. 활성화하면 GPT-5.6 Sol은 최대 초당 750개 토큰을 처리할 수 있으며, 이는 일반 모드의 약 14배 속도입니다. Codex 책임자 Tibo Sottiaux는 1~2년 후에는 오늘날의 이 속도가 기본 수준에 가까워질 것으로 예상했습니다.
하지만 14배는 모델 자체의 최대 출력 속도일 뿐입니다. 실제로 코드를 작성할 때, 대부분의 시간이 코드 생성에 소요된다면 전체적으로 약 10배 빨라질 수 있습니다. 에이전트가 웹 검색, 도구 실행, 네트워크 응답 대기를 해야 한다면 전체 작업은 보통 3~4배만 빨라집니다. 모델의 출력 속도가 점점 빨라지면서 병목 현상은 모델에서 네트워크, CPU, 도구 호출로 이동하게 됩니다.
Ultra Fast는 OpenAI 내부에서도 아껴서 사용해야 합니다. 중대한 장애, 핵심 프로토타입 등의 작업은 우선적으로 사용할 수 있지만, 대부분의 컴퓨팅 자원은 여전히 외부 고객에게 할당됩니다. 그렇지 않으면 OpenAI 직원들이 용량을 모두 소진할 수 있기 때문입니다.