홈
AI AI
속보
심층
이벤트
Pro
더보기
자금 조달 정보
특집
온체인 생태계
용어
팟캐스트
데이터
OPRR
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
XRP
$2.25
2.07%
DOGE
$0.325
2.23%
USDC
$0.999
3.05%

Claude Code가 AI 애플리케이션을 스스로 튜닝한다: 프롬프트를 수정하고, 모델을 교체하며, 성능이 나빠지면 롤백한다

동찰 Beating AI 속보, Anthropic이 Claude Code의 공식 claude-api Skill에 자동 튜닝 워크플로를 추가했다. build-eval은 먼저 실제 대화, 버그 또는 수동 사례에서 테스트 세트와 평가 방법을 만들고, hillclimb은 Claude Code가 시스템 Prompt, 도구 설명, 모델 및 추론 강도를 반복적으로 수정하도록 한다. 수정할 때마다 테스트를 다시 실행하여 효과가 좋아지면 유지하고, 나빠지면 롤백한다.


Claude가 테스트 문제에만 과도하게 최적화되는 것을 방지하기 위해, 모든 샘플을 한꺼번에 튜닝하지 않는다. 일부 사례는 문제를 찾고 구성을 수정하는 데 사용하고, 또 다른 사례 묶음은 수정이 보지 못한 문제에도 적용될 수 있는지 확인하는 데 남겨둔다. 앞부분의 점수가 올랐지만 남겨둔 테스트 결과가 개선되지 않으면, 이번 수정은 과적합으로 판정되어 철회될 수 있다.


Anthropic은 44건의 고객 서비스 티켓으로 이 프로세스를 시연했다. Claude Code는 순차적으로 Prompt를 정리하고, 비즈니스 규칙을 보충하고, 다양한 모델을 시도하고 추론 강도를 낮췄다. 최종적으로 Sonnet 5 저 effort 구성 한 세트를 찾아냈다. 튜닝에 참여하지 않은 14건의 티켓에서 정확도는 초기 구성의 78.6%에서 90.5%로 올랐고, 비용은 약 원래의 5분의 1로 줄었다.

举报 오류 신고/제보
오류 신고/제보
제출
새 문고 추가
자신만 보기
공개
저장
문고 선택
새 문고 추가
취소
완료