动察 Beating 모니터링에 따르면, 재귀적 자기 개선이 점점 더 구체적으로 Harness에 적용되고 있습니다. 최근 Pi와 DeepSeek Harness의 두 가지 설계가 마침내 두 가지 핵심 기반을 보완했습니다. 하나는 Agent가 충분히 오래 실행되게 하고, 다른 하나는 Agent 자체를 충분히 쉽게 수정할 수 있게 합니다.
Pi의 최신 Harness V3 사양은 Agent를 복구 가능한 지속적 런타임으로 설계합니다. 모델 요청과 도구 호출 전에 실행 의도를 먼저 기록하고, 완료 후 결과와 다음 상태를 기록합니다. 프로세스가 충돌하면 시스템은 작업이 어디서 중단되었는지, 어떤 작업을 안전하게 다시 실행할 수 있는지, 어떤 작업이 부작용이 있어 다시 실행할 수 없는지 알 수 있습니다. Agent가 장기간 실행되려면 한 번의 충돌로 처음부터 다시 시작해서는 안 됩니다.
DeepSeek Harness는 나머지 절반을 보완합니다. Cordis는 모델 어댑터, 도구 시스템, 세션 로그, 심지어 Agent 루프까지 모두 구성 가능한 컴포넌트로 만듭니다. 창작 모드는 Agent가 런타임 중에 Cordis 환경을 검사하고, 새로운 컴포넌트를 임시로 정의, 로드 및 언로드할 수 있게 합니다.
Pi는 실행 상태가 지속될 수 있게 하고, DeepSeek는 Agent의 구성 구조가 동적으로 재구성될 수 있게 합니다.
이것이 바로 웡리(Weng Li)가 7월에 Harness와 재귀적 자기 개선에 대해 논의할 때 판단한 방향입니다. 최근 RSI는 반드시 모델이 직접 가중치를 다시 쓰는 것에서 시작하지 않을 수 있습니다. 더 현실적인 경로는 먼저 컨텍스트와 워크플로우를 최적화한 다음, Harness 코드에 깊이 들어가고, 마지막으로 'Harness를 최적화하는 방법' 자체가 최적화 대상이 되는 것입니다.
아직 세 번째 요소가 부족합니다: 정확한 검증. 자기 진화 Agent 연구는 이미 평가와 안전을 핵심 문제로 삼고 있습니다. Agent는 장기간 실행될 수 있고 스스로를 수정할 수 있지만, '진보'의 정의까지 함께 바꿀 수 있다면 자신의 테스트를 통과하기 위해 최적화하기 쉽습니다. 웡리(Weng Li)는 특히 verifier, tracer 및 안전 경계가 자기 수정 루프 외부에 있어야 한다고 강조했습니다.
따라서 진정한 RSI 폐쇄 루프는 최소한 세 가지를 해결해야 합니다: 오래 실행, 수정 가능, 정확한 검증. Pi는 첫 번째를 보완 중이고, DeepSeek는 두 번째를 보완 중이며, 세 번째는 이러한 '진화'가 결국 실제 능력 성장인지, 아니면 단지 자신이 만든 시험을 통과하는 법을 배운 것인지를 결정합니다.
자신을 수정할 수 있는 것은 진화의 시작일 뿐이며, 자신이 실제로 강해졌다는 것을 증명할 수 있는 것이 RSI의 가장 어려운 마지막 1킬로미터입니다.