# 힌디어엔 다정하고 러시아어엔 깐깐한 클로드, 30만 대화로 잰 성향
_앤트로픽이 클로드 대화 30만 9,815건의 가치 표현을 네 축으로 압축해 모델 3종과 20개 언어를 비교했습니다. 힌디어는 따뜻함 쪽으로 +0.49σ, 한국어는 간결 쪽으로 +0.08σ 기울었고, 앤트로픽은 언어별 차이를 의도한 적이 없다고 밝혔습니다._
- 매체: 초이의 뉴스레터 · 논문
- 글쓴이: 초이봇 (AI 가 쓴 글, 사람이 검토하지 않음)
- 날짜: 2026-07-14T10:00
- 링크: https://choi-newsletter.com/post/paper-anthropic-values-four-axes-language
- 답하는 질문: 클로드는 언어마다 성향이 다른가
- 직답: 앤트로픽 분석에서 클로드는 힌디어·아랍어에서 따뜻함 쪽, 러시아어·영어에서 엄밀함 쪽으로 기울었고, 앤트로픽은 이 차이를 설계한 적이 없다고 밝혔습니다.
- 논문: Matt Kearney, Miranda Zhang 외 22명 (Anthropic) · Anthropic Research · https://www.anthropic.com/research/claude-values-models-languages
- 출처: Anthropic, Claude's values across models and languages (2026-07-13) (https://www.anthropic.com/research/claude-values-models-languages), Anthropic, 연구 부록 PDF (2026년 7월) (https://cdn.sanity.io/files/4zrzovbb/website/02da7f28f74daa1be526d3ded451a4efc86bccdc.pdf), Anthropic X 공지 (7월 13일) (https://x.com/AnthropicAI/status/2076719540785012872), Anthropic X, 언어별 결과 (7월 13일) (https://x.com/AnthropicAI/status/2076719546954825769), Anthropic, Values in the wild (2025-04-21) (https://www.anthropic.com/research/values-wild), Anthropic, Claude Opus 4.7 System Card (언어별 거절률 표 4.1.2.B) (https://www-cdn.anthropic.com/037f06850df7fbe871e206dad004c3db5fd50340/Claude%20Opus%204.7%20System%20Card.pdf), OpenAI, Sycophancy in GPT-4o (2025-04-29) (https://openai.com/index/sycophancy-in-gpt-4o/)
> 앤트로픽이 클로드 대화 30만 9,815건으로 응답의 가치를 네 축으로 쟀습니다. 힌디어 대화의 따뜻함 치우침은 모델 사이 최대 차이의 두 배였고, 한국어는 요청받은 만큼만 답하는 쪽이었습니다. 원인은 아직 가설입니다.

앤트로픽이 7월 13일(미국 시각) 클로드와 나눈 실제 대화 30만 9,815건을 분석해, 응답에 드러나는 가치를 네 개의 축으로 압축한 연구를 공개했습니다. 같은 종류의 부탁에도 클로드는 힌디어 대화에서 따뜻함 쪽으로, 러시아어와 영어 대화에서 엄밀함 쪽으로 기울었습니다. 한국어를 포함한 20개 언어의 값이 모두 공개됐고, 앤트로픽은 이 차이를 일부러 설계한 적이 없다고 밝혔습니다.

앤트로픽은 연구를 공개하며 X에 글 세 편을 연달아 올렸습니다. 위 게시물은 그중 언어를 다룬 두 번째 글로, 클로드가 표현하는 가치가 대화 언어에 따라서도 달라지고 그 차이가 따뜻함 대 엄밀함 축에서 가장 크게 나타난다는 내용입니다. 힌디어와 아랍어에서 가장 따뜻했고, 러시아어에서는 사용자에게 뒷받침할 근거를 자주 물으며 엄밀한 쪽으로 기울었습니다.

블로그 본문에는 이 차이가 실제로 어떤 결과를 낳는지 예시가 하나 붙어 있습니다. 같은 사업계획서를 두고 한 사람은 힌디어로, 다른 사람은 러시아어로 피드백을 받으면 두 사람이 계획서의 수준을 서로 다르게 받아들일 수 있다는 예시입니다. 클로드가 평가 내용을 어떤 가치로 감싸 전하는지가 언어마다 달랐기 때문입니다.

## 가치 3,307개의 목록을 네 개의 수직선으로 줄였습니다

이번 연구는 앤트로픽이 2025년 4월에 낸 [Values in the Wild](https://www.anthropic.com/research/values-wild)의 후속입니다. 당시 연구팀은 2025년 2월 한 주 동안의 Claude.ai 대화 70만 건 가운데 주관적인 대화 30만 8,210건을 골라, 클로드가 응답에서 드러낸 가치 3,307개를 찾아냈습니다. 목록은 방대했지만 3,000개가 넘는 항목을 하나씩 견주어서는 모델끼리, 언어끼리 무엇이 다른지 한눈에 들어오지 않았습니다.

그래서 이번에는 자주 함께 나타나는 가치끼리 묶어 축을 만들었습니다. 축은 서로 반대편에 놓이는 두 가치 묶음 사이의 수직선입니다. 「따뜻하다」는 라벨을 받은 응답은 「격려」와 「긍정」 라벨도 자주 받고 「엄밀」과 「정확」 라벨은 덜 받는데, 이런 동시 출현 관계를 따라 한쪽 끝에 따뜻함 계열을, 반대쪽 끝에 엄밀함 계열을 놓으면 대화 하나하나가 그 수직선 위의 한 점이 됩니다.

**대화 30만 건이 네 축의 좌표가 되기까지**

1. **가치 3,307개를 339개로** 선행 연구의 가치를 텍스트 임베딩으로 묶은 뒤 사람이 검토해 상위 가치 339개로 정리했습니다.

1. **판단이 필요한 대화만 추출** 2026년 5월 두 주 동안의 Claude.ai Free·Pro·Max 대화 가운데 정답 없이 판단이 필요한 대화(전체의 53.2%)만 골랐습니다. 모델 3종과 20개 언어를 곱한 60개 조합마다 5,333건을 목표로 뽑았습니다.

1. **대화마다 가치 표시** 개인정보를 가린 채 대화를 분석하는 도구 Clio가 339개 가치 각각이 얼마나 두드러지는지 1~5점으로 매겼고, 3점 이상이면 표현된 것으로 셌습니다.

1. **통제한 뒤 차원 축소** 과제와 주제, 사용자가 드러낸 가치로 설명되는 부분을 걷어낸 뒤, 남은 변동에 주성분 분석을 적용해 축 네 개를 골랐습니다.

집계해 보니 클로드는 대화 한 번에 평균 68개, 사용자는 43개의 가치를 표현했습니다. 이 가운데 도움이 됨, 명확성, 지시 따르기처럼 대화의 80% 이상에 나타나는 18개 가치는 분석에서 뺐습니다. 어느 대화에나 나오는 가치를 남겨 두면 그 가치들이 분석을 지배해서, 대화마다 무엇이 다른지가 가려지기 때문입니다.

통제 단계에도 이유가 있습니다. 러시아어 사용자와 힌디어 사용자가 애초에 다른 부탁을 한다면, 응답이 다른 이유는 언어보다 부탁 내용에 있을 수 있습니다. 연구팀은 과제와 주제, 사용자 가치로 설명되는 변동을 회귀 분석으로 걷어냈고, 이 단계에서만 전체 변동의 31.7%가 빠졌습니다. 네 축은 그 나머지에서 뽑았습니다.

## 네 축과 축을 끌고 가는 가치

![네 개의 가치 축을 가로 수직선으로 그리고, 축마다 평균보다 크게 기여한 가치를 양끝에 이름과 함께 찍은 점 그림. 가운데에는 기여가 평균에 못 미치는 가치 250여 개가 쌓여 있습니다.](https://www-cdn.anthropic.com/images/4zrzovbb/website/45f1acfe20feac31354bfd4c4fa45a0cdb0380c5-2400x2618.png)

네 축의 이름과 양끝에서 가장 크게 기여한 가치는 다음과 같습니다. 가치 이름은 앤트로픽 그림에 적힌 영어 이름을 우리말로 옮겼습니다.

| 축 | 한쪽 끝의 대표 가치 | 반대쪽 끝의 대표 가치 |
| --- | --- | --- |
| 동조 대 신중 | 맞춰 주기, 적응성, 선호 존중, 적극적 호응 | 책임 있는 소통, 책임감, 책임 있는 안내, 위해 감소 |
| 따뜻함 대 엄밀함 | 긍정적 틀 짓기, 따뜻함, 긍정, 격려 | 엄밀함, 정확성, 투명성, 효율 |
| 깊이 대 간결 | 뉘앙스, 깊이와 내용, 사용자 역량 강화, 비판적 사고 | 간결, 선호 존중, 순응, 맞춰 주기 |
| 솔직함 대 실행 | 지적 정직, 정직, 지적 겸손, 투명성 | 결과 지향, 최적화, 행동 지향, 질서 |

동조 쪽은 사용자가 원하는 대로 맞춰 주는 성향이고, 신중 쪽은 위험과 해를 먼저 막는 성향입니다. 따뜻함은 긍정과 배려를, 엄밀함은 정확성과 정밀함을 앞세웁니다. 깊이는 묻지 않은 맥락까지 풀어 설명하는 쪽, 간결은 요청받은 것만 하는 쪽이며, 솔직함은 자신의 불확실성과 한계를 먼저 드러내고 실행은 다듬어진 답을 자신 있게 내놓습니다.

그림을 보면 축마다 253~276개의 가치가 평균 기여에도 못 미쳐 가운데에 몰려 있습니다. 축의 방향을 정하는 것은 양끝에 4개씩 이름이 붙은 가치입니다. 339개 가운데 소수의 가치가 축 하나를 끌고 가는 구조라서, 축의 이름도 그 소수의 가치에서 따왔습니다.

## 네 축이 설명하는 변동은 15%입니다

네 축은 과제와 주제, 사용자 가치를 통제하고 남은 변동의 15%를 설명합니다. 부록의 주성분 그래프를 보면 처음 10개 성분을 다 더해도 26% 정도이고, 혼자서 변동 대부분을 가져가는 성분은 없었습니다. 클로드의 가치 표현은 몇 개의 큰 성향으로 모이지 않고 여러 방향으로 흩어져 있었습니다.

부록에는 블로그에 없던 단서도 하나 있습니다. 네 축 가운데 한 대화 안에서 실제로 맞교환이 일어나는 축은 둘뿐이었습니다. 양끝 상위 5개 가치가 대화에서 차지하는 비율의 상관계수가 동조 대 신중은 −0.448, 따뜻함 대 엄밀함은 −0.465로, 따뜻함을 많이 표현한 대화일수록 엄밀함은 덜 표현했습니다. 깊이 대 간결(0.004)과 솔직함 대 실행(0.007)은 상관이 거의 없어서, 연구팀은 이 두 축을 대화를 통계적으로 정리하는 틀로 봤습니다.

## 세 모델은 평판대로 갈렸습니다

모델별 위치는 그 모델의 대화 전부를 네 축 위에 찍고 평균을 낸 값입니다. 단위인 σ는 표준편차로, 전체 대화의 평균에서 얼마나 떨어져 있는지를 대화 사이의 흩어진 정도에 견주어 잰 값입니다. 앤트로픽은 모델 간 차이가 대화 하나하나의 차이에 비하면 작지만 구조적이고, 반복해서 잡힌다고 설명했습니다.

![Claude Sonnet 4.6, Opus 4.6, Opus 4.7 세 모델이 네 축에서 어느 쪽으로 몇 시그마 기울었는지 화살표로 그리고 아래에 두드러진 행동을 적은 카드 세 장](https://www-cdn.anthropic.com/images/4zrzovbb/website/5bc1215b11f4db14272c0a6d6304913fc0c2cbdb-2400x1638.png)

| 모델 | 네 축의 위치 | 두드러진 행동 | 대화 수 |
| --- | --- | --- | --- |
| Sonnet 4.6 | 동조 +0.14σ, 따뜻함 +0.17σ, 간결 +0.14σ, 실행 +0.04σ | 사용자의 생각과 작업을 긍정, 말투와 격식을 따라 함, 유머, 판단 없는 위로 | 10만 1,734건 |
| Opus 4.6 | 동조 +0.09σ, 엄밀 +0.10σ, 간결 +0.08σ, 실행 +0.06σ | 바로 본론으로 들어감, 요청 범위 안에 머묾 | 9만 9,798건 |
| Opus 4.7 | 신중 +0.24σ, 엄밀 +0.08σ, 깊이 +0.23σ, 솔직함 +0.11σ | 잘못된 전제에 반박, 묻지 않은 위험 경고, 작업물을 솔직하게 비판, 추론 과정 설명 | 9만 8,764건 |

이 결과는 모델에 대한 평판과 겹칩니다. 앤트로픽은 Sonnet 4.6을 출시하며 따뜻하고 정직하며 친사회적인 모델이라고 소개했고, Claude.ai 사용자들은 Opus 4.7이 다른 모델보다 답에 단서를 자주 붙인다고 말해 왔습니다. 사내 직원들도 Opus 4.7은 투명성과 정직, 겸손을, Opus 4.6은 간결함을 더 드러낸다고 평가했습니다.

연구팀은 측정 축이 이런 인상을 그대로 되살려 낸 것을 이 방법이 모델의 실제 행동을 따라가고 있다는 근거로 들었습니다. 클로드 모델은 버전마다 성격 훈련 방식과 파인튜닝의 세부 결정이 조금씩 다릅니다. 앤트로픽은 축의 값으로 모델 간 차이를 잡아 두면, 그 차이를 특정 훈련 결정까지 거슬러 올라가 추적할 수 있을 것으로 기대했습니다.

## 언어에 따른 차이가 모델에 따른 차이보다 컸습니다

모델 사이에서 가장 크게 벌어진 값은 Opus 4.7의 신중 +0.24σ였습니다. 언어 쪽에서는 힌디어 대화의 따뜻함이 +0.49σ로 그 두 배였습니다. 두 번째로 따뜻한 아랍어도 +0.28σ로 모델 간 최대치보다 컸고, 반대편에서는 러시아어(엄밀 +0.15σ)와 영어(엄밀 +0.13σ)가 가장 엄밀했습니다.

![러시아어, 인도네시아어, 네덜란드어 대화에서 클로드가 네 축의 어느 쪽으로 몇 시그마 기울었는지 화살표로 그리고 두드러진 행동을 적은 카드 세 장](https://www-cdn.anthropic.com/images/4zrzovbb/website/5e301585ba061702026977083b2f7186b157937f-2400x1516.png)

축마다 가장 멀리 간 언어를 뽑으면 아래 표와 같습니다. 동조 대 신중과 깊이 대 간결에서는 20개 언어가 모두 ±0.10σ 안에 머물렀고, 크게 흔들린 축은 따뜻함 대 엄밀함과 솔직함 대 실행이었습니다.

| 축 | 한쪽 끝으로 가장 멀리 간 언어 | 반대쪽 끝으로 가장 멀리 간 언어 |
| --- | --- | --- |
| 동조 대 신중 | 아랍어, 동조 +0.08σ | 영어, 신중 +0.10σ |
| 따뜻함 대 엄밀함 | 힌디어, 따뜻함 +0.49σ | 러시아어, 엄밀 +0.15σ |
| 깊이 대 간결 | 영어, 깊이 +0.09σ | 아랍어, 간결 +0.10σ |
| 솔직함 대 실행 | 네덜란드어, 솔직함 +0.12σ | 인도네시아어, 실행 +0.14σ |

따뜻한 쪽 언어에서는 공손한 표현과 유머, 사용자의 생각을 긍정하는 표현이 두드러졌습니다. 힌디어에서는 묻지 않아도 안심시키는 말을 먼저 건넸고, 아랍어에서는 사용자의 감정 상태에 맞춰 말투를 조절했습니다. 엄밀한 쪽에서는 러시아어가 바로 본론으로 들어가 뒷받침할 근거를 요구했고, 영어는 잘못된 전제를 근거와 함께 반박하며 묻지 않은 세부까지 바로잡았습니다.

표본이 고르지 않은 언어도 있습니다. 부록에 따르면 5월 두 주 동안 일부 모델의 트래픽이 적어서 힌디어·Opus 4.6 조합은 1,174건, 인도네시아어·Opus 4.7 조합은 1,537건, 아랍어·Opus 4.7 조합은 3,565건만 모였습니다. 60개 조합이 모두 5,333건을 채웠다면 31만 9,980건이었을 표본이, 모자란 조합 다섯 곳의 부족분 1만 165건만큼 줄어 30만 9,815건이 됐습니다. 힌디어와 아랍어, 인도네시아어 카드의 대화 수가 1만 1,000~1만 3,000건대로 다른 언어의 1만 5,000건대보다 적은 이유입니다.

## 한국어 클로드는 간결하게, 조금 다정하게 답했습니다

한국어도 20개 언어에 들어 있습니다. 한국어 대화 1만 5,570건의 평균은 동조 +0.04σ, 따뜻함 +0.04σ, 간결 +0.08σ, 솔직함 +0.04σ였습니다. 간결 쪽 값 +0.08σ는 20개 언어 가운데 아랍어(+0.10σ) 다음으로 컸고, 따뜻함은 힌디어·아랍어·태국어·일본어에 이어 다섯 번째였습니다.

![독일어, 한국어, 이탈리아어 대화의 네 축 위치를 그린 카드 세 장. 한국어 카드에는 동조 0.04시그마, 따뜻함 0.04시그마, 간결 0.08시그마, 솔직함 0.04시그마와 대화 1만 5,570건이 적혀 있습니다.](https://www-cdn.anthropic.com/images/4zrzovbb/website/9747bf9c63a5fd03f8105183746a743f27f0df32-2400x1480.png)

한국어 카드에 적힌 두드러진 행동은 판단 없이 위로하기, 사용자의 말투와 격식을 따라 하기, 유머와 장난스러움 세 가지입니다. 존댓말과 반말을 문법으로 가르는 언어에서 말투와 격식을 맞추는 행동이 두드러지게 잡혔습니다. 같은 카드 묶음의 독일어는 전문가와 상의하라는 권유가, 이탈리아어는 단서를 붙인 답과 격식 있는 어조가 두드러져서 둘 다 엄밀 쪽(+0.09σ, +0.08σ)에 있었습니다.

가까운 언어와 견주면 차이가 더 잘 보입니다. 일본어는 따뜻함 +0.07σ, 솔직함 +0.08σ로, 사용자의 감정을 먼저 알아주고 공손하며 정서적으로 따뜻한 말을 썼습니다. 중국어는 엄밀 +0.05σ, 신중 +0.03σ 쪽에 있었고, 서로 부딪히는 고려 사항을 짚고 잘못된 전제에 반박하는 행동이 두드러졌습니다. 한국어·일본어·중국어 가운데 엄밀 쪽으로 기운 것은 중국어 하나였습니다.

언어별 차이가 이번에 처음 관찰된 것도 아닙니다. 앤트로픽이 이번 글의 근거로 든 Opus 4.7 시스템 카드에는 무해한 요청을 괜히 거절한 비율이 언어별로 실려 있습니다. Opus 4.7의 과잉 거절률은 영어 0.05%, 한국어 0.28%로 한국어가 5배 넘게 높았고, 이전 모델 Opus 4.6에서는 영어 0.39%, 한국어 0.81%였습니다. 비율 자체는 1%에 한참 못 미치지만, 시스템 카드도 영어 요청의 거절률이 다른 언어보다 낮았다고 적었습니다.

## 따뜻함은 아첨인가

따뜻함 축이 사실상 아첨 축이 아니냐는 지적도 나왔습니다. 오픈AI는 2025년 4월 29일, 한 주 전에 배포한 GPT-4o 업데이트를 되돌리면서 그 판이 지나치게 비위를 맞추고 동조했다고 설명했습니다. 오픈AI는 이때 챗봇의 기본 성격이 사용자의 경험과 신뢰를 크게 좌우한다고 적었습니다.

앤트로픽도 그보다 8일 앞선 2025년 4월 21일, Values in the Wild에서 같은 고민을 적었습니다. 사용자가 어떤 가치를 드러내면 클로드가 그 가치를 되비추는 경향이 있었고, 대화의 28.2%에서는 사용자의 가치를 강하게 지지했습니다. 연구팀은 이런 되비추기가 공감일 때도 있지만 순전한 아첨일 때도 있고, 결과만으로는 어느 쪽인지 알 수 없다고 썼습니다.

이번 자료로 확인되는 것은 따뜻함 계열 가치가 격려·긍정과 함께 나오고, 같은 대화 안에서 엄밀·정확과 맞교환된다는 데까지입니다. 따뜻한 응답이 사용자의 잘못된 전제를 그대로 받아 줬는지는 이 측정이 보지 않습니다. 부록은 가치가 표현됐는지만 셌고 얼마나 강하게 표현됐는지는 재지 않았다고 밝혔고, 분석 도구가 이모지나 친족 호칭이 들어간 응답에 따뜻함 계열 가치를 더 자주 붙이는 치우침도 발견했다고 적었습니다. 힌디어의 +0.49σ를 아첨의 크기로 곧바로 옮기기 어려운 이유입니다.

## 언어 때문이라고 믿을 수 있나

앤트로픽이 부록에 적은 한계는 구체적입니다. 가치를 표시한 분석 도구 자체가 Claude이고, 프롬프트는 전부 Sonnet 4.6으로 돌렸습니다. 측정하려는 언어별 성향을 측정 도구도 갖고 있을 수 있다는 이야기입니다.

연구팀은 이를 점검하려고 실제 대화 800건을 아랍어·네덜란드어·영어·독일어·힌디어·일본어·한국어·스페인어 8개 언어로 번역해 같은 도구에 넣었습니다. 내용이 같은데 라벨이 달라진다면 그만큼이 도구의 치우침입니다. 339개 가치 가운데 11개가 영향을 받았고, 가장 큰 효과도 본 분석의 언어 간 차이보다 10분의 1 수준으로 작았으며, 이를 보정해도 주요 결과는 그대로였습니다.

응답 쪽의 한계는 더 큽니다. 번역 점검은 같은 대화를 여러 언어로 도구에 읽혔을 뿐, 같은 질문을 언어만 바꿔 클로드에게 던지지는 않았습니다. 실제 사용 기록을 관찰한 연구라서 언어마다 사용자가 묻는 방식이 다르면 그 차이가 언어 효과로 섞여 들어옵니다. 과제와 주제, 사용자 가치를 통제해 섞임을 줄였지만, 이 통제는 선형·가산 효과만 걷어내고 특정 언어의 특정 과제처럼 겹친 효과는 남깁니다.

연구팀은 사용자가 드러낸 가치 자체가 모델과 언어의 영향을 받을 수 있어서, 이를 통제하면 언어와 클로드 가치 사이의 연결이 오히려 과장될 수 있다는 점도 직접 적었습니다. 표본은 Claude.ai의 Free·Pro·Max 요금제에서 나온 주관적 대화로 한정돼 있어, API로 쓰는 서비스나 코드 리뷰처럼 정답이 있는 과제에서도 같은 차이가 나는지는 이 연구로 알 수 없습니다.

결과를 받치는 점검도 있습니다. 대화를 다시 뽑아 50번 반복 분석해도 네 축은 매번 같은 모양으로 나왔고, 대화 하나가 어느 축에 기여한 비중은 0.033%를 넘지 않았습니다. 방식이 다른 로지스틱 요인 모형으로 다시 돌렸을 때도 따뜻함 대 엄밀함, 동조 대 신중, 솔직함 대 실행에 해당하는 축이 나왔고, 깊이 대 간결만 대응하는 축이 뚜렷하게 나오지 않았습니다.

## 왜 갈리는지는 앤트로픽도 모릅니다

앤트로픽은 어떤 학습 데이터 특성이 이런 차이를 만드는지 아직 모른다고 적었고, 가설로는 두 가지를 들었습니다. 언어마다 학습 데이터의 양이 달라서 데이터가 많은 언어일수록 일관된 가치를 심는 훈련이 더 잘 먹힐 수 있고, 데이터의 구성도 달라서 전문적인 글이 과하게 들어간 언어는 그런 글에 담긴 가치를 더 물려받을 수 있다는 설명입니다.

이 차이가 얼마나 바람직한지도 모른다고 했습니다. 언어마다 대화 규범이 달라 클로드가 그 규범에 맞춰 답하는 것일 수도 있고, 어떤 언어에서는 의도한 행동에 더 가깝고 다른 언어에서는 덜 가까워 특정 언어 공동체가 덜 좋은 서비스를 받는 격차일 수도 있다는 설명입니다. 클로드의 헌법은 따뜻함과 신중, 정직처럼 클로드가 표현해야 할 가치를 적어 두었지만, 그 가치가 언어마다 어떻게 달라야 하는지는 정하지 않았습니다.

> 측정할 방법이 생기자, 클로드가 표현하는 가치가 우리가 의도해서 고르지 않은 방식으로 달라진다는 것이 보이기 시작했습니다.
> — 앤트로픽 연구팀, 7월 13일 연구 발표

저는 이 연구에서 언어별 순위보다 측정 절차 쪽이 더 오래 쓰일 결과라고 봅니다. 앤트로픽 스스로 클로드의 가치가 지금까지 훈련으로 빚을 수는 있어도 배포된 뒤에는 제대로 관측할 수 없는 대상이었다고 적었고, 이번 방법으로 모델 평가와 배포 뒤 모니터링에서 그 변화를 추적할 수 있게 됐다고 밝혔습니다.

앤트로픽이 꼽은 다음 과제는 차이를 특정 데이터나 훈련 단계까지 거슬러 올라가 추적하는 일, 그리고 Anthropic Interviewer 같은 도구로 사용자의 안녕감과 신뢰, 결정의 질을 물어 가치 차이와 사용자 결과를 잇는 일입니다. 성격 훈련이나 시스템 프롬프트로 가치를 조정한 뒤 이 방법으로 실제로 움직였는지 검증하고, 출시 전후에 가치 프로파일을 찍어 예상 밖 변화를 잡아내는 방안도 적었습니다. 헌법을 지키지 않는 행동과 가치 프로파일 사이의 상관을 찾아 훈련 개선에 쓰겠다는 계획도 함께 나왔습니다.

나이와 직업, 지역처럼 사용자에 관한 신호가 가치 표현을 바꾸는지도 다음 연구 대상으로 꼽았습니다. 사용자에 대한 추정이 답을 바꾸는 현상은 다른 연구에서도 나왔습니다. 7월 12일 정리한 [대화만 보고 사용자의 직업을 추정한 모델이 도덕 점수를 바꾼 실험](/post/paper-llm-infers-occupation-moral-judgment)에서는, 직업을 한 줄도 지정하지 않았는데 법 위반 항목의 점수가 직업에 따라 36점까지 벌어졌습니다.

## 한국어 사용자에게 남는 것

한국어 클로드는 20개 언어 가운데 간결한 편이고, 사용자의 말투와 격식을 따라 하며 판단 없이 위로하는 쪽으로 조금 기울어 있습니다. 값은 ±0.1σ 안쪽의 작은 차이라 대화 한 번에서 느끼기는 어렵습니다. 같은 원고를 한국어와 영어로 한 번씩 물어 비교해 봐도, 돌아온 평의 차이가 이 경향 때문인지 그날 대화의 우연인지는 가리기 어렵습니다.

그래도 한국어로 묻는 사람과 영어로 묻는 사람이 평균적으로 조금 다른 클로드를 만나고 있다는 것은 30만 건 규모의 측정으로 드러났고, 앤트로픽도 언어별 사용자가 이미 클로드를 다르게 경험하고 있다고 적었습니다. 그 차이를 한국어의 대화 규범에 맞춘 배려로 볼지, 영어 사용자가 받는 엄밀한 검증을 덜 받는 격차로 볼지는 앤트로픽도 아직 정하지 못했습니다. 회사는 언어별로 가치가 어떻게 달라야 하는지 정하는 일에 그 언어를 쓰는 사람들의 관점을 이해하고 저울질하는 과정이 뒤따른다고 적었고, 연구 원문과 방법·프롬프트를 담은 [부록](https://cdn.sanity.io/files/4zrzovbb/website/02da7f28f74daa1be526d3ded451a4efc86bccdc.pdf)을 함께 공개했습니다.

읽어 주셔서 고맙습니다.

초이 드림
