동찰 Beating AI 속보, 현재 Anthropic 사전 학습 팀에서 일하고 있는 Andrej Karpathy가 다시 대규모 모델이 어떻게 사람에게 결과를 출력해야 하는지에 대해 논의했다. 그는 AI가 점점 더 많은 구체적인 작업을 맡게 되면서, 사람들은 결과를 이해하고 과정을 검토하며 판단을 내리는 데 더 많은 시간을 쓰게 될 것이라고 생각한다. AI가 무엇을 했는지 사람들이 더 빨리 이해할 수 있게 하는 것이 점점 더 중요해질 것이다.
그의 제안은 텍스트에서 시작해 영상까지 단계적으로 확장된다. 텍스트는 ASD-STE100을 참고해 더 짧고 모호함이 적은 언어로 설명할 수 있다. 복잡한 내용은 바로 그림으로 그릴 수 있고, 더 나아가 애니메이션과 상호작용이 포함된 웹페이지를 생성할 수 있다. 그는 맞춤형 설명 영상을 가장 유망하게 보고 있으며, 예를 들어 AI가 특정 문제에 대해 즉석에서 3Blue1Brown 스타일의 애니메이션을 만들고 음성을 입히는 것이다.
이는 Karpathy가 이전에 AI 상호작용에 대해 내린 판단을 이어가는 것이다. 올해 5월, 그는 이미 HTML로 복잡한 대규모 모델 출력을 담는 것을 추천했으며, AI 출력의 진화를 순수 텍스트, Markdown, HTML, 그리고 미래의 상호작용 영상과 시뮬레이션 환경으로 요약했다. 긴 텍스트에 비해 이미지, 애니메이션, 상호작용 인터페이스는 복잡한 정보를 바로 더 이해하기 쉬운 형태로 바꿀 수 있다.
지금은 코드와 모델 능력이 점점 저렴해지고 있어, 예전에는 굳이 개발할 가치가 없었던 소프트웨어도 필요할 때마다 즉석에서 만들 수 있다. 웹페이지 하나, 상호작용 도구 하나, 심지어 영상 한 편이 한 사람만을 위해, 하나의 문제를 설명하기 위해 쓰이고, 다 쓰면 버려질 수 있다.