아이디어를 꺼냈을 때 가능성을 먼저 찾아주는 AI와, 허점부터 짚는 AI가 있다면 어느 쪽이 더 똑똑하게 느껴질까요? 초안을 발전시키고 싶을 때와 최종 결정을 앞두고 있을 때, 원하는 답은 다를 수 있습니다.
클로드(Claude)의 모델별 차이를 살핀 Anthropic 연구에서 흥미로운 부분도 여기에 있습니다. 어떤 모델은 사용자의 생각과 말투에 더 잘 맞춰줬고, 다른 모델은 잘못된 전제를 반박하거나 요청하지 않은 위험까지 경고하는 쪽으로 기울었습니다. 답을 얼마나 잘 맞히느냐와 별개로, 사용자에게 어떻게 반응하느냐에도 차이가 있었습니다.
여기에 대화 언어까지 바꾸면 어떨까요? 연구에서는 영어와 한국어 대화에서도 서로 다른 경향이 나타났습니다. 모델을 바꿀 때 느끼는 차이, 영어로 질문하면 더 나을 것이라는 기대를 이 결과에 비춰볼 수 있습니다.
소넷과 오퍼스, 잘 받아주는 답변과 먼저 반박하는 답변
Anthropic의 연구는 2026년 5월 2주 동안 Claude.ai에서 오간 대화 중 주관적 판단이 필요한 309,815건을 분석했습니다. 소넷(Sonnet) 4.6, 오퍼스(Opus) 4.6·4.7과 20개 언어가 대상입니다. 정답률을 겨루게 한 실험이 아니라, 실제 답변에서 어떤 태도와 행동이 반복되는지 살폈습니다.
차이가 선명한 두 모델을 보면 결과를 이해하기 쉽습니다.
Sonnet 4.6에서는 사용자의 아이디어를 긍정하고, 말투와 격식을 따라가고, 판단 없이 위로하는 행동이 두드러졌습니다. 반면 Opus 4.7에서는 잘못된 가정을 반박하고, 위험을 경고하고, 자신의 오류나 한계를 인정하는 행동이 더 눈에 띄었습니다.
이를 대화 장면에 대입해 보면 차이가 와닿습니다. 막 떠올린 기획을 이야기하는 상황이라면, 가능성을 함께 찾아주는 반응과 빠진 조건부터 짚는 반응 중 무엇이 필요할까요? 이는 연구의 행동 차이를 이해하기 위한 예시입니다. 특정 모델이 기획이나 검토 업무를 더 잘한다는 실험 결과는 아닙니다.
연구팀은 이런 차이를 네 방향으로 정리했습니다. 사용자의 관점에 얼마나 맞추는지와 위험을 얼마나 경계하는지, 따뜻하게 반응하는지와 엄밀하게 검토하는지, 얼마나 깊게 설명하거나 간결하게 답하는지, 솔직한 비평과 요청 실행 중 어디에 무게를 두는지입니다.
그림의 σ는 전체 평균에서 얼마나 떨어져 있는지 나타내는 표준편차 단위입니다. Sonnet 4.6은 따뜻함 쪽으로 +0.17σ, Opus 4.7은 주의성 쪽으로 +0.24σ, 깊이 쪽으로 +0.23σ였습니다. 점수가 높을수록 우수하다는 순위표가 아니라, 평균에 비해 어느 방향의 반응이 두드러졌는지 보여줍니다.
그래서 모델이 달라졌을 때 “더 똑똑해졌다”거나 “까다로워졌다”는 느낌을 한 덩어리로 볼 필요는 없습니다. 틀린 전제를 더 자주 지적하는 변화와 실제 문제를 더 잘 푸는 변화는 나눠서 확인할 수 있습니다. 이 연구가 측정한 것은 그중 앞의 변화에 가깝습니다.
그렇다면 영어로 물으면 더 꼼꼼해질까요?
모델에 따라 반응이 달랐다면, 같은 모델을 쓰면서 언어만 바꿀 때도 차이가 생길지 궁금해집니다. 연구에서 영어 대화는 20개 언어 가운데 주의성과 깊이 쪽 경향이 가장 강했습니다. 영어와 러시아어는 엄밀함 쪽, 힌디어와 아랍어는 따뜻함 쪽으로 상대적으로 기울었습니다.
여기까지만 보면 “중요한 질문은 영어로 하면 되겠네”라는 결론이 떠오릅니다. 하지만 이 결과는 같은 질문을 여러 언어로 번역해 Claude에게 답하게 한 비교가 아닙니다. 언어마다 실제 사용자들이 나눈 서로 다른 대화를 모아 분석한 것입니다.
영어 대화에서 더 꼼꼼한 반응이 관찰됐다는 것과, 내 질문을 영어로 바꾸면 답이 더 꼼꼼해진다는 것은 다른 주장입니다. 연구팀은 작업과 주제, 사용자가 먼저 표현한 가치의 영향을 통계적으로 통제했지만, 언어 자체가 차이를 만들었다고 확정하지 않았습니다. 영어로 질문할 때 정답률이 높아지는지도 이 연구에서는 측정하지 않았습니다.
Anthropic은 언어별 학습 데이터의 양과 구성, 대화 규범, 의도한 행동이 각 언어에서 학습된 정도를 가능한 설명으로 제시합니다. 어느 설명이 실제 원인인지는 아직 열려 있습니다. 언어별 결과는 질문 언어를 고르는 비법보다, Claude의 응답 방식이 언어 전반에서 얼마나 일관적인지 묻는 자료로 읽을 수 있습니다.
한국어 Claude는 얼마나 달랐을까요?
한국어 대화 15,570건에서는 판단 없이 위로하기, 사용자의 말투와 격식을 따라가기, 유머나 장난스러운 표현을 쓰는 행동이 상대적으로 두드러졌습니다. 수치로 보면 수용과 따뜻함, 솔직함 쪽으로 각각 +0.04σ, 간결함 쪽으로 +0.08σ였습니다.
방향보다 눈여겨볼 것은 크기입니다. 한국어 표본의 편차는 +0.04~+0.08σ로 작았습니다. “한국어 Claude는 따뜻한 성격이다”라고 이름을 붙일 만큼 뚜렷한 구분으로 읽기는 어렵습니다. 이 시기에 모인 대화에서 전체 평균보다 조금 더 그런 쪽으로 기울었다는 뜻입니다.
연구 제목의 ‘가치(values)’도 이 범위에서 이해하면 됩니다. Anthropic이 말하는 가치는 답변에 드러난 정직성·주의성 같은 고려와 행동입니다. AI가 내면에 품은 신념을 측정했다는 뜻이 아닙니다. 한국어 결과 역시 답변의 경향이지, 한국어 사용자나 문화의 성격표가 아닙니다.
그렇다면 이런 작은 차이는 왜 살펴볼까요? 모델이나 언어를 바꿨을 때 무엇이 달라졌는지 구체적으로 묻는 출발점이 되기 때문입니다. “느낌이 다르다”에서 멈추지 않고, 말투를 더 따라오는지, 설명을 짧게 하는지, 반론을 더 자주 제기하는지를 따로 볼 수 있습니다.
다음에 모델을 비교한다면, 반응도 따로 보세요
이 연구를 실제 사용에 연결한다면, 모델을 평가할 때 질문을 둘로 나눠볼 수 있습니다. 요청한 일을 제대로 해냈는지, 그리고 그 과정에서 내가 필요로 하는 방식으로 반응했는지입니다. 다음은 연구가 검증한 활용법이 아니라, 관찰된 행동 차이를 바탕으로 한 비교 제안입니다.
아이디어를 넓히는 작업에서는 제안을 얼마나 이어가는지 살펴볼 수 있습니다. 초안을 검토하는 작업에서는 잘못된 전제와 빠진 조건을 얼마나 구체적으로 지적하는지 볼 수 있습니다. 같은 모델이어도 어떤 반응을 원했는지 먼저 정해야 결과를 판단하기 쉽습니다.
여기서 Sonnet은 아이디어용, Opus는 검토용이라고 역할을 고정할 근거는 없습니다. 연구는 특정 응답 경향이 사용자의 판단이나 삶에 더 좋은 영향을 주는지까지 측정하지 않았습니다. 친절한 답변이 필요한 순간도, 듣기 불편한 지적이 필요한 순간도 있다는 관점으로 결과를 활용하는 편이 낫습니다.
Anthropic도 이 분석을 모델 출시 전후의 예상치 못한 행동 변화를 찾는 도구로 발전시킬 수 있다고 제안합니다. 모델을 업데이트한 뒤 성능 점수와 함께 대화 태도의 변화도 추적하자는 것입니다.
이 연구에서 가져갈 가장 쓸모 있는 관점은 클로드를 비교할 때 정답뿐 아니라 반응도 평가하자는 것입니다. 내 아이디어를 얼마나 발전시키는지, 잘못된 전제를 얼마나 구체적으로 짚는지까지 보면 소넷과 오퍼스의 차이를 더 분명하게 설명할 수 있습니다. “어느 모델이 더 똑똑할까?”에서 “지금 내 작업에는 어떤 반응이 필요할까?”로 비교 기준을 넓히는 것입니다.
결과를 더 깊이 읽고 싶다면
본문의 비교를 만든 분석 과정과 한계는 공식 부록에 자세히 나옵니다.
연구팀은 이전 연구에서 찾은 3,307개 가치를 339개 상위 항목으로 묶고, 대화마다 Claude와 사용자가 표현한 가치·작업·주제를 분류했습니다. 작업·주제·사용자 가치의 영향을 통제한 뒤 반복되는 패턴을 압축한 것이 네 축입니다. 원문의 이름은 Deference↔Caution, Warmth↔Rigor, Depth↔Brevity, Candor↔Execution입니다.
다만 축의 양끝이 언제나 상충하는 것은 아닙니다. 깊이와 간결함, 솔직함과 실행은 실제 상관이 거의 없었습니다. 깊이 있게 답하면 반드시 길어진다거나 솔직하게 비평하면 실행을 덜 한다는 뜻으로 읽으면 안 됩니다.
설명 범위에도 한계가 있습니다. 작업·주제·사용자 가치의 통제 단계가 전체 변동의 31.7%를 설명했고, 이후 주성분 분석(PCA)의 첫 네 성분이 설명한 변동은 약 15%, 첫 열 성분도 약 26%였습니다. 네 축으로 답변의 모든 차이를 설명할 수는 없습니다.
분석 도구가 언어에 따라 다르게 판단하는지도 점검했습니다. 기존 대화 800건을 여덟 언어로 번역해 다시 분류했을 때, 339개 가치 중 11개에서 언어 편향이 관찰됐지만 보정 뒤 핵심 결과는 바뀌지 않았습니다. 이 번역 검사는 분류 도구의 편향을 확인한 절차이며, 언어별로 Claude에게 새 답변을 생성시킨 실험과는 구분해야 합니다.
기억할 세 가지
- 소넷 4.6은 생각을 받아주는 쪽, 오퍼스 4.7은 허점을 짚는 쪽이 두드러졌습니다. 2026년 5월 대화 표본에서 소넷은 아이디어 긍정·말투 맞추기·위로, 오퍼스는 잘못된 가정 반박·위험 경고·한계 인정이 특징적이었습니다. 같은 클로드 안에서도 대화를 이끌어가는 방식이 달랐습니다.
- 영어 대화는 주의성과 깊이, 한국어 대화는 말투 맞추기와 위로가 눈에 띄었습니다. 한국어는 평균보다 약간 더 따뜻하고 간결한 쪽이었습니다. 언어별로 답변의 분위기에도 패턴이 있다는 발견입니다. 다만 서로 다른 실제 대화를 비교한 결과이므로, 질문을 영어로 번역했을 때의 효과와는 구분해야 합니다.
- 클로드를 고를 때 ‘정답을 잘 내는가’에 ‘내 생각을 어떻게 다뤄주는가’를 더해보세요. 아이디어를 넓힐 때는 제안을 이어가는 반응을, 검토할 때는 빠진 조건을 짚는 반응을 살펴보는 것입니다. 이 연구를 활용하는 비교 기준은 ‘더 친절한가’나 ‘더 까다로운가’ 자체보다, 지금 작업에 필요한 반응을 해주는가입니다.
참고 자료
- Anthropic, Claude’s values across models and languages, 2026-07-13
- Anthropic, Values Across Models and Languages Appendix, 2026-07