홈
AI AI
속보
심층
이벤트
Pro
더보기
자금 조달 정보
특집
온체인 생태계
용어
팟캐스트
데이터
OPRR
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
XRP
$2.25
2.07%
DOGE
$0.325
2.23%
USDC
$0.999
3.05%

AI 리뷰가 완전히 망했습니다: GPT-5.4는 문제의 만점 해법을 54%로만 기억했습니다.

덩케이트 Beating 모니터링에 따르면, 일리노이 대학 컴퓨터과학 박사과정 학생 Dylan Zhang이 Agent 메모리 실험을 수행하여 결과는 역설적인 결론을 가리킵니다: 모델이 경험을 반복 요약하면 기억이 더 이상해질 가능성이 있습니다.

가장 눈에 띄는 결과는 ARC-AGI에서 나왔습니다: 연구자들은 GPT-5.4가 기억이 없는 상태에서 모두 맞힐 수 있는 19개 문제를 선정하고, 이 문제들의 실제 해법을 모델에 공급하여 모델이 "경험 요약"을 생성하도록 했습니다. 보통 이것은 개방형 시험이랑 같습니다; 그러나 여러 번의 기억 압축 후, 동일 모델의 정확도가 100%에서 54%로 하락했습니다. 원래 궤적에 문제가 있지 않았음에도 실제 문제는 모델이 올바른 궤적을 범용 경험으로 변경한 단계입니다.

더 심각한 것은 이러한 기억 강화가 특별한 경우가 아니다라는 점입니다. WebShop 온라인 쇼핑 과제에서는, AWM 메모리 방법이 8개의 전문가 궤적을 학습할 때 점수가 0.64였으나, 궤적이 128개로 늘어나면 0.20으로 하락하여 기억이 없는 기준으로 돌아왔습니다. 다시 말해, 기억을 쌓을수록 수확은 오히려 제로가 됩니다.

문제는 "경험 부족"이 아니라 "요약 과도"에 있습니다. 대형 모델이 작성한 경험은 Client한 일지가 아니며, 각 요약은 재생성입니다. 마지막으로 쓰여진 것은 구체적 전제가 삭제되고, 서로 다른 과제 규칙이 섞이며, 원래 조작을 안내하던 세부사항이 "가장 직접적인 조치 우선" 또는 "올바른 도구 사용"과 같이 틀린 것 같으면서 실제로는 쓸모없는 헛소리가 됩니다. 원문에 제시된 극단적 사례 중 하나는, 50개의 구조화된 메모리가 1개로 합쳐지는 일에 나타나며, 여러 과제의 차이점은 일반적인 프로세스로 압축되어 다음 시험에서 6개에서 13개의 성공 샘플이 바로 삭제됩니다.

저자의 제안은 매번 Agent가 "잘못된 문제 노트"를 써야 한다는 것이 아닙니다. 더 안정적인 방법은 선택받은 원본 조작 궤적을 보존하고, 필요한 경우에만 추상적 요약을 하는 것입니다. 실험 결과, 원시 episode를 보존하고 추상적 요약을 비활성화한 솔루션은 여러 Agent 벤치마크에서 압축 기억 방법을 테스트한 결과와 동등하거나 그것을 능가했습니다. 개발자들에게 이 결론은 매우 명확합니다: 모델이 실제로 무엇을 했는지 보게 하는 것이 일반적인 추상 규칙을 외우게 하는 것보다 종종 더 유익합니다.

举报 오류 신고/제보
인기 기사
오류 신고/제보
제출
새 문고 추가
자신만 보기
공개
저장
문고 선택
새 문고 추가
취소
완료