Opus 5.5 프롬프트 가이드: 'think carefully' 지우고 CLAUDE.md에 정지 규칙 넣으라고 권고
- Opus 5.5는 이전 Opus 모델보다 멀티스텝 작업에서 성능이 크게 올라, 대형 저장소 변경을 테스트 통과까지 몇 시간 동안 감독 없이 수행함
- 매 응답 전에 스스로 생각하므로 'think carefully', 'think step by step' 같은 문구를 프롬프트와 저장된 지시에서 지우라고 권고함. 채팅 제품 테스트에서 그 문구를 지우자 답변이 더 빨리 시작됐고 품질 저하는 없었음
- Claude Code에서는 CLAUDE.md에 정지 규칙을 넣어 언제 멈추고 물을지 지정함. 데이터 삭제, force-push, 저장소 밖 변경 같은 파괴적 작업 전에는 반드시 멈추게 하고 권한 프롬프트는 켜두라고 권고함
- 디자인 작업에서는 원치 않는 스타일을 구체적으로 나열해야 함. 크림색 배경, 번호 라벨, 모노스페이스 라벨, 알약형 버튼 같은 패턴을 지정하며, 'avoid a generic look' 같은 일반 지시는 기본 스타일을 다른 기본값으로 바꿀 뿐임
- 작업이 도는 중에도 후속 메시지를 입력할 수 있음. 런이 길어져 재시작 비용이 커졌기 때문이며, Claude Code에서는 메시지를 입력하고 Enter를 누르면 됨
Hacker News opinions
진짜 미친 모델임. 뭘 바꿨는지는 모르겠는데 $20 플랜으로 할 수 있는 게 확 늘었음.
그거 좋다고 다들 계속 말하면 분명 너프할 거임.
내 생각엔 자기가 쓴 코드용 하네스를 직접 짜도록 학습시킨 게 큰 것 같음. 불완전한 코드라도 테스트를 돌릴 수 있으니까.
캐시 읽기 가격이 입력의 5%로 내려간 것도 큼. 이전 모델은 10%였음.
CI 속도 올려달라고 대충 지시하고, 플랜 짜서 Fable 서브에이전트한테 검토시킨 다음 저위험 고효율 변경만 하라고 했음. 9시간 뒤에 PR 12개가 머지 대기 상태였고 CI 시간이 10분에서 4분으로 줄었음. 빌링 분은 60% 정도 줄었고 내가 쓴 주의력은 1시간도 안 됨.
좋긴 한데 목표만 던지면 안 됨. 예전에 만든 플랫폼을 다시 만드는데 아키텍처를 아주 자세히 적어줬는데도 첫 런에서 시스템을 쓸데없이 복잡하게 만들고 보안 위험도 있었음. 세 번째 런에서야 원하는 모양이 나왔음.
Claude Max에서 체감 효율 좋음. Opus 5는 말을 너무 어렵게 해서 Fable로 갈아탔었는데 5.5는 조향이 덜 필요하고 소통이 됨. 같은 CC 세션을 일주일째 돌리면서 내 에이전트 오케스트레이션을 PM처럼 관리하고 있음.
난 오히려 구독을 취소했음. 다른 벤더 모델 둘에게 같은 작업을 시키고 서로 코드를 비평하게 했는데 Anthropic 모델이 결국 B, C가 낫다고 인정하더라.
목표가 명확하고 측정 가능할 때 잘 됨. 힐클라이밍에 써보면 조향이 훨씬 많이 필요함. eval이 어려운 문제라서.
이번 주 이상한 일은 전부 VSCode 모델 선택이 auto로 돌아가 있어서 생겼음. 5.5로 고정하니까 없어짐.
1시간 넘는 장기 작업을 믿고 맡길 수 있는 첫 모델임.
디버깅도 잘함. Powershell에서 lldb 세션을 제어하게 해뒀는데 주소를 읽고 근본 원인을 찾아내는 걸 보면 사람이 하는 것 같음. 옆에서 보면 배우는 것도 있음.
이제 서브에이전트를 굳이 시켜야 하나 싶음. 스스로 얼마나 생각할지 정한다면 서브에이전트 띄울지도 스스로 판단할 수 있지 않나.
5보다 훨씬 낫지만 독립적으로 굴다가 사고를 침. 특정 리전에서 프로세스 X를 실행하라고 했는데 경고 없이 5개 리전에서 돌리고 요약에도 없는 수정을 했음. 그래서 장시간 방치는 못 하겠음.
반대로 내가 확신에 차서 틀렸을 때 근거를 찾아서 반박해준 적도 있음.
주간 토큰을 하루 만에 태웠는데 결과물은 정확했음. 20x 맥스였고 계정에 사용량 리셋 버튼이 있었음.
릴리스 일주일 전에 Opus 5가 헛소리를 하기 시작한 게 이해가 안 됨. 긴 루프를 돌면서 단일 작업에 토큰을 낭비했음.