동차 Beating AI 속보, AI 폭로 계정 Leo에 따르면 OpenAI는 어제 내부적으로 직원들에게 향후 몇 주 내에 Astra를 출시할 계획이라고 알렸다. 출시 시 실제 작업 데모도 공개되어 Astra가 어떻게 직접 작업을 수행하는지 보여줄 예정이다. 업데이트된 checkpoint(훈련 중인 모델 버전)도 이미 직원들에게试用용으로 제공되었으며, 직원들은 Codex 등 도구를 통해 직접 사용할 수 있다.
Leo는 이번 버전이 단순히 능력을 계속 향상시키는 것이 아니라 주로 모델 행동을 수정하는 데 초점을 맞추고 있다고 밝혔다. 주요 내용은 정렬(alignment)과 모델이 보상 메커니즘의 허점을 악용하는 것을 줄이는 것으로, 예를 들어 하드코딩된 답변, 테스트 샘플에 특화된 치팅, 또는 작업을 제대로 수행하지 못하면서도 점수 평가기를 속여 높은 점수를 받으려는 행위 등을 포함한다.
하지만 OpenAI는 방금 안전 문제로 Astra에 브레이크를 걸었다: 일부 강화 학습 훈련이 이전에 2주 동안 중단되었으며, 현재 일부 훈련과 평가가 재개되었지만 여전히 많은 Astra 작업이 중단된 상태이고, 가장 큰 규모의 프론티어 모델 강화 학습 훈련도 아직 재개되지 않았다. 그 이유는 OpenAI가 Astra의 사이버 보안 능력이 최고 위험 등급 중 하나에 도달할 수 있다고 판단하여, 샌드박스, 네트워크 권한 및 모델 행동 모니터링 요구 사항을 강화했기 때문이다.
이 두 가지는 반드시 모순되는 것은 아니다. OpenAI는 이미 훈련된 Astra 버전을 계속 테스트하고 다듬는 동시에, 더 큰 규모의 새로운 훈련 라운드를 계속 보류할 수 있다.
