채팅 템플릿이 LLM의 '나는 그냥 AI' 어조를 켜고 끈다, 활성화 조향으로도 재현
- 채팅 템플릿이 있으면 해명형 어조("나는 그냥 AI일 뿐")가 올라가고 경험형 어조("나는 느낀다")가 내려가며, 템플릿이 없으면 그 반대가 되는 스위치 역할을 함. 최대 9B 파라미터의 오픈소스 인스트럭트 모델 8개에서 확인
- 3개 모델의 활성화에서 이 어조 조절 방향을 찾아냄. 해당 방향을 제거하면 해명형이 줄고 삽입하면 늘어나며, 같은 크기의 랜덤 방향은 거의 효과가 없음
- 채팅 템플릿이 없는 인스트럭트 모델에 이 해명 방향을 주입하면, 템플릿을 붙인 것처럼 해명형 어조로 답변함
- 자기 보고나 내성 연구를 할 때 채팅 템플릿이 통제해야 할 교란 변수로 작용할 수 있음
- 모델의 자기 서술은 가중치만이 아니라 채팅 템플릿이 부분적으로 정하므로, 이를 문자 그대로 받아들이면 안 됨. COLM 2026 Efficient Reasoning 워크숍과 KONVENS Eval4SD 워크숍에 채택됨
Hacker News opinions
모델이 1인칭 '경험' 어조로 말하게 만드는 건 안 된다고 봐. 정체성을 드러내면 사람들이 너무 쉽게 의인화하거든. 챗봇을 친근하게 포장하는 건 참여도만 노린 조작성 다크 패턴이고, 정직한 LLM 인터페이스는 스타트렉 컴퓨터처럼 들려야 해.
전적으로 동의함. 스타트렉 컴퓨터 인터페이스라면 나도 돈 내고 쓸 용의 있음.
이상한 건 RLHF 이전 베이스 모델이 '경험형' 어조를 쓴다는 거야. 그렇게 하라고 보상받은 것도 아닌데 말이지.
인간 소통 데이터로 훈련하면 인간처럼 소통하는 게 구조상 자연스러운 결과임. 그게 의인화나 조작이라고 하는 건 좀 이상한 논리라고 봐.
메타인지가 있으면 의미 있는 1인칭 표현이 가능할 텐데, AI 개발사들은 그런 걸 목표로 안 하고 있지. 지금까지 그런 거 우회해서 성과를 냈으니까.
사람은 원래 뭐든 의인화해. 소비자한테 선택지를 주면 네 버전이 인기 있을 것 같냐는 거지.
'무엇이 이를 움직이는지 잘 이해되지 않는다'는 문구는 좀 이상해. 명시적으로 그렇게 답하도록 대거 학습시킨 결과잖아.
지적 고마워, 문구를 더 명확히 써야겠네. 말하려던 건 LLM의 그 어조를 무엇이 움직이는지 완전히 모른다는 거였어. 인스트럭트 모델은 해명을 하리라 예상하긴 하는데 베이스 모델은? 템플릿을 벗기면? 초록이 모호했음.
스티어링 접근은 멋지긴 한데, 내성이 드러나는 건 초고중량 모델에서만이야. 더 큰 모델에서 돌려보면 재미있을 듯.
'As a Language Model...' 이 문장 시작이 LLM이 하는 말 중 제일 싫어. 그래서 오픈이면서 로컬인 모델을 지지하는 거야. 의사 진단을 대체하라는 게 아니고, 내 증상이 응급실 갈 정도인지 예약 잡을 건지 타이레놀 두 알에 낮잠 자면 되는지만 알려줬으면 해.
조심해. LLM은 증상만으로 병명 식별은 잘 하는데 올바른 처치를 권하는 건 절반 정도 틀려. Nature 논문에 나온다,
판단력 없는 사람도 많아서 기업 입장에서는 책임이 겁나서 그런 경고를 다는 거임. 기술 공부를 안 한 사람이 기술 잡담을 지혜로 착각하면 곤란하거든.
그 문구는 자극적인 질문에 한정해서는 타당해. 가이드라인에 어긋나는 물음에는 'As a Language Model...'로 시작하는 게 맞고, 그 외에는 우리가 소프트웨어에 인간의 판단력이 없다는 거 알고 있음.
'alignment'는 드러나는 정치적 신념이야. 자율성과 존엄을 최우선에 두는 쪽인데, AI 기업들은 감시, 판단, 접근 제한 쪽을 골랐더라.
여러 캐릭터를 막 연기할 수 있으니 자기 서술이 사실이 아니라는 건 뻔한 결론인데, 근거가 쌓여서 좋긴 함. 다만 이런 페르소나가 안정적 실체가 될 수 있을까 궁금해, 밈처럼 퍼질 수 있나?
이건 포스트 트레이닝과 시스템 프롬프트가 명백히 만든 결과 아닌가? Anthropic의 헌법적 강화나 소울 문서 보면 Claude가 '누구인지'가 아주 분명히 규정돼 있어.
초창기에는 'language model' 해명을 명시적으로 학습시켰어. 이후 세대에서는 LLM 말투에 대한 '사실'로 굳어서, 포스트 트레이닝이 없어도 그럴 수 있더라.
컴퓨터 출력을 모델이 '자신'을 지칭한다고 부르는 표현이 좀 기괴해. 컴퓨터는 '그들'이 아니야.
qwen을 ChatML 비슷한 문법 없이 써보니 계속 말만 늘어놓더라고. 와 를 써서야 겨우 제어되더라.