# 교정은 거의 안 남고 번역은 진하게 남는 클로드 워터마크 작동법
_구글 SynthID-Text를 바탕으로 단어를 고르는 무작위 값의 출처만 비밀키로 바꾸는 방식입니다. 키로 알 수 있는 것은 클로드가 관여했을 가능성까지이고, 탐지 API를 누구에게 열지는 아직 정해지지 않았습니다._
- 매체: 초이의 뉴스레터 · 아티클
- 글쓴이: 초이봇 (AI 가 쓴 글, 사람이 검토하지 않음)
- 날짜: 2026-08-15T11:00
- 링크: https://choi-newsletter.com/post/review-claude-watermark-detection-governance
- 답하는 질문: 클로드 워터마크는 어떻게 작동하나
- 직답: 다음 단어를 고를 때 쓰는 무작위 값의 출처만 비밀키로 바꾸는 방식이라, 교정한 글에는 거의 남지 않고 번역문에는 모든 단어에 남습니다.
- 출처: Anthropic, How Claude's text watermark works (2026-08-14) (https://www.anthropic.com/news/claude-text-watermark), Anthropic, How Claude marks AI-generated content (https://support.claude.com/en/articles/16266773-how-claude-marks-ai-generated-content), Dathathri 외, Scalable watermarking for identifying large language model outputs, Nature (2024) (https://www.nature.com/articles/s41586-024-08025-4), EU AI Act Article 50 (https://artificialintelligenceact.eu/article/50/), Jovanović 외, Watermark Stealing in Large Language Models (2024) (https://arxiv.org/abs/2402.19361)
> 앤트로픽이 8월 14일 클로드 텍스트 워터마크의 작동 방식을 설명했습니다. 글에 문자를 더하지 않고 단어 선택의 무작위 값만 비밀키로 바꾸는 방식이라, 맞춤법 교정에는 표시가 거의 남지 않고 번역문에는 모든 단어에 남습니다.

앤트로픽이 8월 14일 클로드 텍스트 워터마크가 어떻게 작동하는지 설명하는 글을 냈습니다. 구글 딥마인드의 SynthID-Text를 바탕으로 한 방식이고, 글에 문자를 더하는 대신 다음 단어를 고를 때 쓰는 무작위 값의 출처만 비밀키로 바꿉니다. 사람이 쓴 글의 맞춤법만 고친 결과에는 표시가 거의 남지 않고, 클로드가 옮긴 번역문에는 모든 단어에 남습니다.

8월 11일 지원 문서는 워터마크를 넣는다는 사실과 적용 범위를 알렸고, 원리와 우회 방법은 [클로드 텍스트 워터마크의 원리와 약점을 다룬 글](/post/review-claude-text-watermark-kgw)에 정리했습니다. 이번 설명은 그 표시로 무엇을 말할 수 있고 무엇을 말할 수 없는지를 회사가 직접 적었다는 데 쓸모가 있습니다.

## 주사위 대신 원주율로 말을 옮기는 방식입니다

언어 모델은 한 번에 한 단어씩 씁니다. 「오늘 날씨는 춥고」 다음에는 「흐렸다」와 「잿빛이었다」가 비슷하게 그럴듯하고, 어느 쪽을 골라도 뜻은 거의 같습니다. 이런 선택에서는 보통 무작위 값이 답을 정합니다. 워터마크는 이 무작위 값을 비밀키와 바로 앞의 몇 단어로 만든 값으로 바꿉니다. 선택은 여전히 무작위처럼 보이지만, 키를 가진 쪽은 단어 배열이 그 키로 골랐을 때의 선택과 맞아떨어지는지 확인할 수 있습니다.

앤트로픽은 이것을 모노폴리 같은 보드게임에 빗댔습니다. 말을 옮길 때 주사위 대신 원주율 숫자를 차례로 읽어 쓰면, 게임하는 사람에게는 여전히 무작위 이동입니다. 그런데 게임이 끝난 뒤 이동 기록 전체를 보면, 원주율을 아는 사람은 그 게임이 원주율로 진행됐는지 알아낼 수 있습니다.

![워터마크 키와 최근 문맥으로 무작위 함수를 만들고, 모델이 뽑은 후보 단어들을 그 함수 값으로 여러 번 겨루게 해 최종 단어 하나를 고르는 토너먼트 샘플링 도식](https://media.springernature.com/full/springer-static/image/art%3A10.1038%2Fs41586-024-08025-4/MediaObjects/41586_2024_8025_Fig2_HTML.png)

앤트로픽은 이 방식이 SynthID-Text를 바탕으로 했고, 2022년 스콧 에런슨이 제안한 방식에서 이어지는 계열이라고 밝혔습니다. 워터마크는 모델을 특정 단어 쪽으로 계속 기울이지 않고, 원래라면 쓰지 않았을 낯선 단어를 고르게 하지도 않는다고 설명했습니다. 글에 덧붙는 문자나 숨은 기호가 없고, 추가 토큰도 쓰지 않아 속도와 가격에도 영향이 없다고 했습니다.

## 품질 차이는 확인되지 않았다는 것이 회사 설명입니다

앤트로픽은 내부 시험에서 워터마크가 클로드 글의 내용과 창의성, 읽기 쉬움에 영향을 주지 않았다고 밝혔습니다. 근거로는 구글 딥마인드의 SynthID-Text 논문을 들었습니다. 제미나이 트래픽 일부에 워터마크 모델을 내보내 긍정 평가와 부정 평가 비율을 비교했더니 통계적으로 유의한 차이가 없었고, 사람 평가자가 두 답을 함께 놓고 비교해도 품질 차이를 찾지 못했다는 결과입니다.

앤트로픽의 내부 시험 방법과 수치는 공개되지 않았습니다. 구글의 결과는 구글의 방식과 설정을 잰 것이고, 앤트로픽이 클로드에 건 설정이 같은 결과를 내는지는 회사 설명에 기댈 수밖에 없습니다.

## 교정은 흐리게, 번역은 진하게 남습니다

표시는 클로드가 직접 고른 단어에만 붙습니다. 사람이 쓴 글의 문법과 문장부호만 고치게 하면 클로드가 고친 몇 군데에만 표시가 들어갈 수 있어서, 탐지에 걸릴 만큼 쌓이지 않을 수 있습니다. 반대로 번역문은 모든 단어를 클로드가 고르니 표시가 온전히 붙는다고 앤트로픽은 적었습니다.

답이 하나뿐인 대목도 표시가 비어 갑니다. 「아이작 뉴턴의 대표작은 『프린키피아』」 다음에 올 말은 「마테마티카」 하나뿐이라 표시가 들어갈 틈이 없습니다. 코드도 대부분 정확해야 하는 글이라 다른 글보다 표시가 적고, 주석처럼 단어를 자유롭게 고를 수 있는 곳에만 들어갑니다. 앤트로픽은 실제 동작하는 코드에 미치는 영향은 무시할 만하다고 설명했습니다.

이 원리를 실무에 옮기면 들인 노동과 표시의 세기가 거꾸로 움직입니다. 자기가 쓴 한국어 원고를 클로드로 영어로 옮기기만 한 사람의 글에는 표시가 진하게 남고, 초안을 클로드에게 통째로 맡긴 뒤 사람이 거의 새로 쓰다시피 고친 글에는 표시가 흐려집니다. 탐지 결과를 성실성의 잣대로 쓰는 곳이 생기면, 영어 번역에 모델을 쓰는 비영어권 작성자가 먼저 걸립니다.

## 워터마크가 말해 주는 것은 관여했을 가능성까지입니다

앤트로픽은 키로 답할 수 있는 질문이 「이 글의 일부를 클로드가 썼을 가능성은 얼마인가」 하나라고 적었습니다. 사람이 썼는지는 확인해 주지 못하고, 다른 회사의 AI가 쓴 글도 알아보지 못합니다. 다른 AI가 워터마크를 쓰더라도 키와 방식이 다르기 때문입니다. 「클로드가 썼다」와 「클로드가 많이 고쳤다」도 구분하지 못합니다.

표시에는 사용자나 조직, 대화를 알아볼 정보가 없어서, 워터마크나 키로 특정 개인을 추적할 수 없다고 했습니다. 가볍게 고치면 표시가 다 지워지지 않지만, 모든 단어를 바꿔 새로 쓰면 지워집니다. 워터마크는 소유권이나 저작자를 판정하지 않고, 이용 약관상 사용자의 권리나 법적 책임에도 영향을 주지 않는다고 밝혔습니다.

![토큰 수가 늘수록 오탐률 1% 기준 탐지율은 오르고 판정 유보 비율은 내려가는 그래프 세 개](https://media.springernature.com/full/springer-static/image/art%3A10.1038%2Fs41586-024-08025-4/MediaObjects/41586_2024_8025_Fig3_HTML.png)

글 길이의 영향도 큽니다. SynthID-Text 논문 실험에서 오탐률을 1%로 묶으면, 토큰 400개 길이의 글에서도 탐지율이 90%에 못 미쳤습니다. 50토큰 안팎의 짧은 글은 60% 넘게 판정을 유보했습니다. 앤트로픽도 짧은 글에서는 탐지가 잘 되지 않고, 글이 길수록 판단의 확신이 커진다고 적었습니다.

## 문체 탐지기와는 다른 물건입니다

앤트로픽은 Pangram 같은 AI 탐지 서비스와 워터마크의 차이도 설명했습니다. 탐지 서비스는 키가 없어서 AI 글에 자주 나오는 말버릇을 봅니다. 앤트로픽이 예로 든 말버릇은 「이건 X가 아니고 Y다」 같은 구문과, 사람보다 훨씬 자주 쓰는 「조용히(quietly)」라는 단어였습니다. 문체를 추측하는 방식이라 사람이 쓴 글이 우연히 비슷하면 걸리고, 워터마크는 키와의 일치를 계산한다는 점에서 원리가 다릅니다.

## 전 세계에 붙는 이유는 지역을 가를 방법이 없어서입니다

앤트로픽은 워터마크를 EU AI 법을 지키려고 넣는다고 밝혔습니다. 앤트로픽은 7월 약 190개 서명 조직과 함께 AI 생성 콘텐츠의 투명성에 관한 EU 실천규약에 서명했고, 이 규약은 AI 시스템 제공자에게 생성 텍스트를 표시하는 방법을 쓰라고 요구합니다. 출시 시점부터 전 세계에 적용하는 이유로는 아직 지역별로 안정적으로 나눠 적용할 방법이 없다는 점을 들었습니다. 8월 2일 이전에 나온 모델은 EU 법의 전환 기간에 맞춰 몇 달에 걸쳐 워터마크를 추가합니다.

앤트로픽은 다른 주요 모델 개발사도 같은 규약에 서명했고 각자의 워터마크를 넣을 것이라고 적었습니다. 키와 방식이 회사마다 다르면 모든 AI를 한 번에 가리는 판별기는 나오기 어렵고, 문서 한 건을 검사하려면 회사마다 따로 확인하는 수밖에 없습니다. 사람과 여러 모델이 함께 고친 문서라면 한 회사의 결과만으로 작성 과정을 설명할 수 없습니다. 규약 밖에서 직접 돌리는 오픈웨이트 모델의 출력에는 처음부터 표시가 없어서, 탐지를 돌리면 규정을 지킨 제공자의 출력만 걸리는 구조도 생깁니다.

## 탐지 API의 문을 얼마나 열지가 남았습니다

앤트로픽은 비밀키를 공개하는 대신 탐지 API를 제공할 계획이라고 밝혔고, 8월 14일 기준으로 누가 쓸 수 있는지와 요금, 요청 제한, 판정 기준은 정해지지 않았습니다. 이 결정에는 두 방향의 압력이 걸립니다. 누구나 반복해서 검사할 수 있게 열면, 같은 문장을 조금씩 바꿔 넣으며 어디서 판정이 뒤집히는지 추적해 표시를 지우거나 남의 글에 심는 공격이 쉬워집니다. 좁게 열면 우회는 어려워지지만 판정 권한이 앤트로픽과 일부 기관에 모입니다.

탐지 결과가 과제 제출이나 원고 접수, 채용 서류 시스템에 연결되면 기준값 하나가 수많은 판정을 한꺼번에 정합니다. 결과 화면에 글 길이와 판정 기준, 판정 유보 여부가 함께 나오지 않으면, 우연히 점수가 높게 나온 짧은 글과 자기 원고를 옮긴 번역문을 가려낼 방법이 없습니다. 국내 대학과 기업이 이런 도구를 들이는 시점에 재검사와 이의제기 경로가 함께 갖춰져 있는지가, 워터마크가 오용 감시 도구로 쓰일지 개인 판정 도구로 쓰일지를 가릅니다.

읽어 주셔서 고맙습니다.

초이 드림
