이 글 어땠어요?
결과가 나오면 맞았는지 그대로 적어요.
앤트로픽이 워터마크 탐지를 누구나 쓰게 열지 않고 자격을 갖춘 기관부터 연다
9월 기준 지원 문서는 워터마크 탐지를 비공개 프리뷰로 두고, EU 법이 정한 규제·수사 기관과 언론, 팩트체커, 연구자, 교육기관, 준수 의무가 있는 기업에 먼저 열었습니다.
알아볼 수 없습니다. 단어 선택에 통계적 치우침을 심는 방식이라 비밀키를 가진 탐지 도구로만 확인할 수 있고, 글이 짧으면 판정이 서지 않습니다.
앤트로픽 문서는 사람이 쓴 글을 교정·번역·요약시킨 결과물에도 표시가 붙을 수 있고, 표시가 검출돼도 클로드를 원저자로 단정할 수 없다고 적었습니다.
강한 패러프레이징에는 버티지 못한다는 분석이 있고, 취리히 연방공대 연구에서는 50달러 미만으로 규칙을 근사 복원해 표시를 지우거나 가짜 표시를 심는 공격이 평균 80% 넘게 성공했습니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
앤트로픽이 10월 1일 공개한 로봇 노출 지수에서 로봇은 미국 물리 과업의 74%, 전체 노동시간의 34%를 해낼 수 있었습니다. 사람보다 싼 일은 0.3%였고, 로봇 가격이 지금 추세로 내리면 10%까지 40년이 걸립니다.

로이터가 9월 28일 입수해 보도한 앤트로픽 투자설명서 초안에 따르면 2025년 매출은 45억 9,000만 달러로 12배, 영업손실은 80억 6,000만 달러였습니다. 앞으로 낼 연산 약정 5,180억 달러의 약 80%는 무를 수 없습니다.
앤트로픽이 8월 14일 클로드 텍스트 워터마크의 작동 방식을 설명했습니다. 글에 문자를 더하지 않고 단어 선택의 무작위 값만 비밀키로 바꾸는 방식이라, 맞춤법 교정에는 표시가 거의 남지 않고 번역문에는 모든 단어에 남습니다.
앤트로픽이 10월 1일 공개한 로봇 노출 지수에서 로봇은 미국 물리 과업의 74%, 전체 노동시간의 34%를 해낼 수 있었습니다. 사람보다 싼 일은 0.3%였고, 로봇 가격이 지금 추세로 내리면 10%까지 40년이 걸립니다.

로이터가 9월 28일 입수해 보도한 앤트로픽 투자설명서 초안에 따르면 2025년 매출은 45억 9,000만 달러로 12배, 영업손실은 80억 6,000만 달러였습니다. 앞으로 낼 연산 약정 5,180억 달러의 약 80%는 무를 수 없습니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
앤트로픽이 쓰는 표시는 두 가지입니다. 텍스트에는 눈에 보이지 않는 워터마크를 글 자체에 짜 넣고, 그림 같은 파일에는 C2PA 표준을 따르는 서명된 출처 메타데이터를 붙입니다. 앞의 것은 단어 선택에 섞여 들어가고, 뒤의 것은 파일에 따로 붙어 다닙니다.
적용 범위는 Claude Platform API와 Claude, Claude Code, Claude Cowork, Claude Tag 전부이고, AWS와 구글 클라우드, 마이크로소프트 Foundry를 거쳐 클로드를 불러도 텍스트 워터마크가 붙습니다. 8월 2일 이후 EU에 출시되는 모델은 출시 시점부터 표시를 지원하고, 그 전에 나온 모델에는 전환 기간을 거쳐 차례로 추가됩니다. 표시가 있는지 확인하는 탐지 수단도 함께 제공하겠다고 밝혔습니다.
규제는 EU에서 시작했는데 표시는 전 세계에 붙습니다. 문서는 이유를 따로 적지 않았지만, 표시를 모델이 단어를 고르는 단계에 넣으면 지역마다 켜고 끄는 편이 더 번거롭습니다. 요청마다 관할을 판정하고 샘플러를 두 벌 운영하는 비용이 들기 때문입니다. 한 시장의 규칙이 가장 싼 구현을 타고 나머지 시장까지 번지는 구조이고, 한국 개발자의 저장소에 들어가는 클로드 코드에도 같은 표시가 붙습니다.
EU AI 법 50조는 생성형 AI 출력물에 인공적으로 만들어졌다는 사실을 기계가 읽을 수 있는 형태로 표시하라고 요구하고, 2026년 8월 2일부터 적용됩니다. 눈으로 보는 라벨은 캡션 한 줄로 해결되지만, 기계가 읽는 표시는 모델이 글을 만드는 과정 자체를 고치는 일입니다. 집행위가 만든 투명성 실천규약도 메타데이터와 워터마크처럼 표시를 여러 겹 걸고, 제3자가 확인할 수 있는 탐지 수단을 두라고 권고합니다.
한국 AI 기본법도 생성형 AI 결과물을 표시하게 하는 의무를 두고 있습니다. 다만 표시를 눈에 보이는 고지로 충분히 볼지, 기계가 읽는 워터마크까지 요구할지는 하위 규정이 정합니다. 국내 파운데이션 모델을 만드는 팀에게 뒤쪽은 곧바로 샘플러를 고치는 엔지니어링 일감이 됩니다.
앤트로픽은 어떤 방식의 워터마크를 쓰는지 밝히지 않았습니다. AI 탐지 회사 GPTZero의 CTO 알렉스 추이는 발표 다음 날 올린 설명글에서, 프런티어 연구소가 감당할 만큼 빠르고 값싼 텍스트 워터마크는 거의 모두 KGW라는 같은 공식을 따른다고 적었습니다. KGW는 2023년 메릴랜드대 연구진이 낸 논문 「A Watermark for Large Language Models」의 앞선 저자 세 명(Kirchenbauer, Geiping, Wen)의 성에서 딴 이름입니다.
생성은 두 걸음으로 이뤄집니다. 지금까지 만든 토큰과 비밀키로 해시값을 하나 뽑고, 그 값으로 다음에 올 단어 목록을 초록 집합과 빨강 집합으로 나눕니다. 그런 다음 초록 쪽 단어가 뽑힐 확률을 조금 올립니다. 앞 문맥이 바뀔 때마다 초록 집합도 새로 정해집니다.
같은 문단을 쓰는 방법은 무수히 많아서, 초록 쪽으로 살짝 기울여도 문장은 자연스럽게 나옵니다. 확률을 얼마나 올릴지는 조절값이고, 세게 밀수록 탐지는 쉬워지는 대신 문장이 어색해집니다.
탐지는 이 과정을 거꾸로 밟습니다. 검사할 글을 받아 토큰마다 같은 해시로 초록 집합을 복원하고, 초록에 속한 토큰의 비율을 셉니다. 우연히 나올 수준인 절반을 통계적으로 넘어서면 워터마크가 있다고 판정하고, 결과는 참·거짓 대신 확률 값으로 나옵니다. 글이 길수록 판정이 단단해지고, 한두 문장짜리 답은 신호가 모자라 판정이 서지 않습니다. 모델 가중치도 API도 필요 없이 비밀키 하나만 있으면 검사할 수 있어서, 그 키를 누구에게 주느냐가 곧 정책이 됩니다.
워터마크가 글의 질을 떨어뜨리느냐는 물음에는 구글의 실측이 있습니다. 구글 딥마인드는 2024년 네이처에 SynthID-Text 논문을 내며, 제미나이 사용자에게 실제로 나간 응답 약 2,000만 건에서 워터마크가 든 답과 들지 않은 답 사이에 사용자 평가 차이가 없었다고 밝혔습니다. 여러 후보를 겨루게 해 고르는 샘플링으로 분포를 크게 흔들지 않도록 만든 설계입니다.
대신 고를 단어가 거의 없는 문장에서는 표시가 들어갈 여지도 없습니다. 2 더하기 2가 4라는 식의 짧고 답이 정해진 문장이 그렇습니다. 이 실측은 구글이 자기 방식을 잰 결과이고, 앤트로픽이 어떤 세기로 표시를 거는지는 공개되지 않았습니다.
코드는 사정이 다릅니다. 문법이 정해 둔 위치가 많아서 단어를 억지로 기울이면 프로그램이 깨집니다. 서울대와 네이버 연구진이 2023년 공개하고 ACL 2024에 실은 SWEET 논문은 코드 생성 모델 StarCoder로 이 차이를 쟀습니다. KGW식 워터마크를 탐지 성능(AUROC) 0.9 이상이 나오게 걸자 한 번에 통과하는 비율이 크게 떨어졌고, 불확실성이 높은 위치에만 표시를 넣는 SWEET 방식은 하락 폭을 줄였습니다.
| 평가 (pass@1) | 워터마크 없음 | KGW식 | SWEET |
|---|---|---|---|
| HumanEval | 33.4 | 25.3 | 32.6 |
| MBPP | 37.8 | 24.2 | 33.2 |
| DS-1000 | 26.3 | 8.6 | 18.8 |
같은 논문은 워터마크 없이 글만 보고 판별하는 사후 탐지기도 코드에 돌려 봤습니다. DetectGPT와 OpenAI 분류기, GPTZero 모두 AUROC가 0.43~0.61로 동전 던지기에 가까웠습니다. 생성 단계에서 표시를 심는 방식이 나온 이유가 여기 있습니다. 개발자들이 먼저 반발한 것도 자기 저장소에 들어가는 코드에까지 표시가 붙는다는 점이었고, 앤트로픽은 코드 출력에 어떤 방식을 쓰는지와 정확도에 미치는 영향을 아직 밝히지 않았습니다.
워터마크의 약점은 원리에서 바로 나옵니다. 초록 집합은 앞 단어로 정해지니, 문장을 바꿔 쓰면 복원되는 초록 집합도 달라집니다. KGW 논문 스스로 이 약점을 보여 주는 사례를 실었습니다. 모델에게 단어마다 이모지를 붙여 쓰게 한 뒤 이모지만 지우면, 해시의 재료가 된 앞 토큰이 사라져 표시가 흩어집니다.

표현을 바꿔도 표시가 남게 하려고 의미가 비슷하면 비슷한 해시가 나오도록 만드는 방식도 연구됐지만, 여기서부터는 두 오류가 서로를 깎습니다. 의미를 넓게 잡으면 사람이 쓴 글까지 걸리고, 좁게 잡으면 단어 몇 개만 바꿔도 지워집니다. 알렉스 추이는 단어 선택과 문장 구조를 함께 바꾸는 강한 패러프레이징에는 워터마크가 버티지 못했다고 적었습니다.
이론 연구도 같은 결론을 냈습니다. 하버드대 등 연구진의 「Watermarks in the Sand」(ICML 2024)는 몇 가지 가정 아래에서, 계산 자원이 제한된 공격자도 품질을 크게 해치지 않고 워터마크를 지울 수 있다는 것을 증명했습니다. 공격자가 비밀키를 몰라도 결론은 유지됩니다.
더 곤란한 공격은 규칙을 훔치는 쪽입니다. 취리히 연방공대 연구진은 2024년 논문에서 워터마크가 걸린 모델의 API에 질문을 반복해 규칙을 근사 복원했고, 50달러 미만의 비용으로 최신 방식들의 표시를 지우는 공격과 가짜 표시를 심는 공격 모두 평균 80%가 넘는 성공률을 냈습니다.
지우는 공격은 자기 글에서 표시를 없애는 데서 끝나지만, 심는 공격은 남이 직접 쓴 글을 AI가 쓴 글로 몰아갑니다. 탐지기는 초록 단어의 치우침만 보고 누가 왜 그렇게 썼는지는 보지 않으니, 표시가 심어진 글의 작성자는 자기 글이라는 것을 증명할 방법이 마땅치 않습니다. 워터마크 논의가 주로 학생의 과제 숨기기에 쏠려 있는 동안, 피해가 더 큰 쪽은 심는 공격입니다.
앤트로픽 문서는 탐지 결과의 한계를 두 방향으로 먼저 적었습니다. 표시가 검출돼도 클로드가 원저자라는 결론으로 이어지지 않습니다. 사람이 쓴 글을 교정하거나 번역하거나 요약시켜도 결과물에 표시가 붙을 수 있기 때문입니다. 반대로 표시가 없다고 AI가 쓰지 않았다는 증거도 되지 않습니다. 글이 아주 짧거나, 크게 고쳐 썼거나, 번역되거나 다른 글과 섞이면 표시가 사라질 수 있습니다.
이 한계를 한국에 옮기면 문제가 구체적으로 보입니다. 영어로 논문을 쓰는 국내 연구자는 초고를 쓴 뒤 모델에게 문장을 다듬게 하는 경우가 많고, 영문 이력서와 해외 고객사용 제안서도 같은 과정을 거칩니다. 논증과 실험은 본인이 했어도 단어 선택을 모델이 했으니 표시가 남습니다. 영어가 모국어인 연구자는 다듬을 필요가 적어 표시가 덜 붙고, 비영어권 연구자는 같은 연구를 하고도 더 자주 붙습니다. 연구 현장에 모델이 들어가는 속도는 오픈AI가 연구자 계정 10만 개를 푼 일에서도 보입니다.
학술지나 채용 심사가 이 표시를 판정 자료로 쓰기 시작하면 불이익은 모국어를 따라 쌓입니다. 워터마크는 대량으로 스팸을 뿌리거나 여론을 조작하는 쪽의 비용을 올리는 데는 효과가 있지만, 한 사람의 글을 판정하는 데 쓰이면 교정과 작성을 구분하지 못하는 한계가 그대로 판정에 옮겨집니다.
탐지 키를 누구에게 주느냐는 아직 정해지지 않은 문제로 남았습니다. 알렉스 추이는 앤트로픽이 탐지기를 누구나 쓰게 공개하면, 사람들이 그 탐지기에 대고 계속 시험하면서 제거 방법을 찾아낼 것이라고 봤습니다. 반대로 일부 기관에만 주면 더 안전하지만, 공개된 탐지기가 실전에서 공격받으며 단단해지는 과정은 포기하게 됩니다.
앤트로픽은 탐지 수단을 제공하겠다고만 밝혔고, 누구에게 어떤 조건으로 줄지는 적지 않았습니다. 표시를 넣었다는 사실보다 탐지 권한을 누가 어떤 목적으로 쓰게 하는지가 이 워터마크의 실제 쓰임새를 정할 가능성이 큽니다. 키를 받은 곳이 규제 기관인지, 대학인지, 채용과 시험을 운영하는 민간인지에 따라 같은 기술이 오용 감시 도구가 되기도 하고 개인 판정 도구가 되기도 합니다.
읽어 주셔서 고맙습니다.
초이 드림