Back to Articles

SynthID-Text는 Gemini와 Claude에서 돌아갑니다. 그런데도 탐지 API는 없습니다

dictionary page showing the entries credible and credibility

3대 언어모델 제공사 중 두 곳이 이제 자신이 생성한 텍스트에 워터마크를 넣습니다. 구글은 2024년부터 Gemini에서 그렇게 해왔습니다. Anthropic은 2026년 8월 14일 Claude에서 이를 켰습니다. 두 곳 모두 같은 방법, 구글 딥마인드가 네이처에 발표한 SynthID-Text를 씁니다.

어떤 문단이 둘 중 하나의 워터마크를 지니고 있는지 확인하고 싶어도 할 수 없습니다. API로도, 포털로도, 오픈소스 도구로도 안 됩니다. 표시는 분명히 거기 있고 원리상 기계가 읽을 수 있지만, 그것을 읽을 수 있는 기계는 그 표시를 넣은 두 회사의 것뿐입니다.

이 간극은 1년 전보다 더 무겁습니다. EU AI법에 날짜가 박힌 표시 기한이 생겼고, 이 간극을 메워준다고 주장하면서 실제로는 메우지 못하는 도구를 사기 시작한 사람이 꽤 많기 때문입니다.

SynthID-Text가 실제로 하는 일

여기서는 정확할 가치가 있습니다. AI 텍스트 워터마크에 관해 쓰인 글 대부분이 똑같은 방식으로 틀렸기 때문입니다.

SynthID-Text는 텍스트에 아무것도 더하지 않습니다. 폭이 0인 문자도, 낯선 유니코드도, 보이지 않는 표식도, 티가 나는 문장부호도, 여분의 토큰도 없습니다. Anthropic이 그대로 명시했고, 이 방법 전반에 대해서도 사실입니다. AI 워터마크를 피하려면 보이지 않는 문자를 지우라는 조언을 본 적이 있다면, 그 조언은 여기 존재하지 않는 것을 겨냥하고 있습니다.

대신 이 방법이 하는 일은 모델이 단어를 고르는 방식을 바꾸는 것입니다.

언어모델이 텍스트를 생성할 때는 다음 토큰에 대한 확률분포를 만들고 거기서 표본을 뽑습니다. SynthID-Text는 바로 그 표본 추출 단계에 개입합니다. 최근 토큰들, 보통 네 개의 슬라이딩 윈도를 비밀 워터마크 키와 함께 해싱해 시드를 만듭니다. 이 시드가 의사난수 점수 함수들, 곧 g 함수를 구동합니다. 알고리즘은 후보 토큰을 뽑아 여러 토너먼트 층에 통과시킵니다. 각 층은 g 함수로 경쟁하는 후보들에 점수를 매기고 승자가 올라갑니다. 토너먼트에서 이긴 토큰이 출력되는 토큰입니다.

그 결과 충분히 긴 구절에서는 출력된 토큰들이 g 값과 상관관계를 갖습니다. 사람의 단어 선택으로는 생기지 않을 상관입니다. 탐지는 그때 통계 검정이 됩니다. 텍스트 전체에서 g 값을 다시 계산하고, 평균이 우연이 허용하는 수준보다 높은지 묻는 것입니다. 공개된 탐지기는 세 가지로, 단순 평균, 가중 평균, 그리고 워터마크가 있는 표본과 없는 표본으로 학습시킨 베이즈 탐지기이며 셋 중 가장 강력한 것은 마지막입니다.

이 설계에서 두 가지 성질이 따라 나오고, 그것이 나머지 거의 전부를 설명합니다.

첫째, 탐지에는 모델이 필요 없습니다. Gemini 텍스트를 확인하려고 Gemini를 돌릴 필요가 없습니다. 이 점이 이 방식을 운영에 올릴 만큼 저렴하게 만들며, 사후 분류기에 비해 진짜 진전입니다.

둘째, 탐지에는 키가 필요합니다. g 함수가 키로 시드되기 때문입니다. 워터마크 키 없이 계산한 g 값은 생성 시에 쓰인 값과 아무 관계가 없고, 검정은 잡음을 돌려줍니다. 이것은 언젠가 누군가 메울 구현상의 구멍이 아닙니다. 구글이 쓰지 않은 텍스트에 구글의 워터마크를 위조하지 못하게 막는 보안 성질 그 자체입니다.

탐지 문제 전체가 이 두 번째 성질 안에 들어 있습니다.

오늘 누가 텍스트에 워터마크를 넣는가

2026년 8월 기준으로, 제공사가 스스로 확인한 내용만 정리하면 이렇습니다.

구글 Gemini. 대규모 배포를 처음 기술한 네이처 논문 이래 Gemini와 Gemini Advanced에서 워터마크가 들어갑니다. 구글 직원은 공식 개발자 포럼에서 Gemini API, Google AI Studio, Antigravity를 통해 생성된 텍스트에도 워터마크가 들어간다고 확인했습니다. 이 답변은 앞서 나온 정반대의 잘못된 답변에 대한 정정으로 나왔는데, 이 사안이 얼마나 얄팍하게 문서화되어 있는지를 보여주는 꽤 정직한 지표입니다.

Anthropic Claude. 2026년 8월 14일부터 전 세계에서 적용되며, 대상은 2026년 8월 2일 이후 출시된 Claude 모델이고 이전 모델은 순차 적용 예정입니다. Anthropic은 이를 SynthID-Text 접근법의 한 버전이라고 설명하며 아이디어를 2022년 스콧 애런슨의 제안까지 거슬러 올립니다. 이와 별개로 Anthropic은 생성된 이미지 파일에 서명된 C2PA 자격증명을 붙입니다.

OpenAI. 텍스트 워터마크 없음. OpenAI는 하나를 만들었고 월스트리트저널의 2024년 보도에 따르면 정확도가 높았지만 그대로 서랍에 넣어두었습니다. 밝힌 우려는 번역과 전면 재작성에 취약하다는 점, 그리고 영어가 모국어가 아닌 사람을 불균형하게 표시할 수 있다는 점이었습니다. 생성 이미지에는 C2PA Content Credentials를 붙입니다.

그 밖의 모두. 가중치가 공개된 모델은 이를 돌리는 쪽이 넣지 않는 한 아무 표시도 지니지 않으며, 그가 표시를 제거하는 것을 막을 방법도 없습니다. 이것이 네이처 논문 자신이 지목한 구조적 구멍입니다. 워터마크는 제공사가 협조하는 곳에서만 작동하고, 공개 모델에 협조를 강제할 수는 없습니다.

두 배포가 모두 2026년 8월 2일에 맞춰진 것은 우연이 아닙니다. EU AI법 제50조가 적용되기 시작한 날입니다.

실제로 존재하는 도구와 각각의 쓸모

이 부분은 정확하게 쓸 가치가 있습니다. 이 주제의 검색 결과가 심하게 오염돼 있기 때문입니다.

깃허브의 google-deepmind/synthid-text. 네이처 논문의 참조 구현이며 Apache 2.0입니다. 워터마크를 넣고 탐지하며, 베이즈 탐지기 학습 코드도 포함합니다. mixin 클래스를 통해 Gemma와 GPT-2를 지원합니다. README는 이것이 연구 재현성을 위한 것이고, mixin은 운영 환경용으로 설계되지 않았으며, 해시 함수가 어떤 암호학적 보안도 보장하지 않는다고 분명히 밝힙니다. 유용하고 정직하며, 남의 텍스트를 위한 탐지기는 아닙니다.

Hugging Face Transformers. 구글이 가리키는 운영용 경로입니다. SynthIDTextWatermarkingConfigSynthIDTextWatermarkLogitsProcessor에 키 목록과 n-gram 길이를 넘기면, 직접 통제하는 모델에서 워터마크가 들어간 텍스트를 생성할 수 있습니다. 키를 가지고 있으면 탐지할 수 있습니다. 평범한 엔지니어링 팀이 오늘 끝에서 끝까지 동작하는 텍스트 워터마크를 손에 넣는 유일한 경로이며, 대상은 자기 시스템이 생성한 텍스트뿐입니다.

MarkLLM. THU-BPM의 학술 툴킷으로, 하나의 인터페이스 뒤에 여러 워터마크 알고리즘을 구현했습니다. KGW, Unigram, EXP, 그리고 평균, 가중 평균, 베이즈 탐지기를 갖춘 SynthID-Text가 포함됩니다. 하나를 배포하는 대신 방식들을 평가하는 중이라면 여기서 시작합니다.

SynthID Detector 포털. 올려서 확인하는 구글의 도구로, 2026년 5월 I/O에서 기자, 연구자, 미디어 종사자를 위한 대기자 명단을 통해 초기 테스터에게 열렸습니다. 검증에 관한 구글 자체 도움말 문서가 열거하는 것은 이미지, 동영상, 오디오입니다. 텍스트는 그 목록에 없으며, API 워터마크에 관한 개발자 포럼 스레드도 포털이 텍스트를 받지 않는다고 분명히 말합니다.

구글의 Content Detection API. 2026년 Gemini Enterprise 플랫폼에서 Shutterstock, Snap, Canva, Fox Sports 등 지명된 파트너에게 프리뷰로 제공됩니다. 이미지 전용이며 JPEG, PNG, WebP입니다. 텍스트 없음, 정식 출시일 없음, 공개 가격 없음.

Anthropic의 탐지 API. 곧 나온다고 발표됐지만 일정도 구현 세부도 없습니다. 나온다 해도 아마 Claude 텍스트에 대해서만 답할 것입니다.

C2PA Content Credentials. 이것은 워터마크가 전혀 아니며, 경쟁이라기보다 보완입니다. 암호학적으로 서명된 출처 메타데이터로, 누가 무엇으로 언제 만들었는지, AI 시스템이 관여했는지를 digitalSourceType 필드에 기록합니다. 2.3 버전에서 일반 텍스트 문서용 매니페스트가 추가된 것은 새롭고 또 중요합니다. 약점은 워터마크 약점의 거울상입니다. 메타데이터는 복사해 붙여넣는 순간 사라지고, 텍스트는 정확히 그렇게 돌아다닙니다.

그리고 도구가 아닌 것들이 있습니다.

상당수의 사이트가 "SynthID detection API"로 상위에 올라, Google Cloud 콘솔에서 켠다는 제품을 요청당 과금과 1초 미만의 텍스트 지연까지 붙여 설명합니다. 그런 제품은 구글 클라우드 문서 어디에도 나오지 않습니다. 그중 최소 한 곳은 워터마크 제거 서비스의 콘텐츠 마케팅입니다. 별개로, 텍스트에서 SynthID를 확인해준다는 사이트들은 통계적 AI 탐지기를 돌립니다. 키가 없으니 워터마크를 읽지 못하고 읽을 수도 없습니다. 글을 예측 가능성과 리듬으로 채점할 뿐입니다. 같은 단어를 입은 다른 물건입니다.

얼마나 잘 작동하는가

정직한 답은, 길고 손대지 않은 고엔트로피 텍스트에서는 잘 작동하고 그 조건을 벗어나면 빠르게 나빠진다는 것입니다. 수치는 공개돼 있고 좋아 보이지 않습니다.

길이. 탐지는 통계 검정이므로 증거는 토큰과 함께 쌓입니다. 2026년에 공개된 SynthID-Text 이론 분석은 50토큰 텍스트에서 거짓 양성률 1퍼센트일 때 참 양성률을 약 0.3으로 잡고, 자체 실험은 100에서 400토큰 시퀀스로 진행합니다. 소셜 게시물, 제품 설명, 고객지원 답변은 텍스트가 충분하지 않습니다.

엔트로피. 워터마크는 모델의 선택 자유에 기대어 삽니다. 정답이 하나뿐인 곳에는 무언가를 부호화할 여지가 없습니다. Anthropic은 이를 직접 말합니다. 사실을 서술하는 대목, 그리고 문법과 산술이 정확해야 하는 코드에서는 표시가 성깁니다. 모델에게 문법을 고쳐달라고 하면 워터마크는 그 몇 안 되는 수정에만 머물 수 있고, 그것은 잡히기에 너무 적을 수 있습니다.

바꿔쓰기. 여기가 약점입니다. 한 견고성 평가에서 SynthID의 참 양성률은 깨끗한 텍스트의 0.998에서 적당한 수준의 바꿔쓰기 후 0.498로 떨어졌습니다. 취리히 연방공대 SRI Lab은 일반적인 바꿔쓰기로 제거에 성공한 비율이 90퍼센트를 넘고 워터마크 탈취를 곁들이면 100퍼센트에 가까워진다고 보고하면서, 보안 기능인 토너먼트 샘플링이 오히려 토큰 가중을 재작성에 더 민감하게 만들어 더 단순한 방식보다 덜 견고하게 한다고 지적합니다. 2026년 법과학 기준에 견준 평가는 의미를 보존하는 바꿔쓰기에서 98.3퍼센트의 제거율을 측정했고, 그때 의미 유사도는 0.83 안팎으로 유지됐습니다.

거짓 양성. 같은 법과학 평가는 사람이 쓴 깨끗한 텍스트에서 5.4퍼센트의 거짓 양성률을, 탐지 임계값을 조금만 흔들어도 판정이 93.6퍼센트 불안정해지는 현상을 측정했고, 타자 연습에 쓰이는 표준 문장 하나가 임계값을 넘는 것도 발견했습니다. 결론은, 검증한 세 방식인 KGW, Unigram, SynthID-Text 중 어느 것도 전문가 증거에 관한 다섯 개 도버트 요소 가운데 둘을 넘겨 충족하지 못한다는 것이었습니다.

위조. 이 항목에서는 SynthID-Text가 대안들보다 잘 버팁니다. SRI Lab의 연구는 기본 파라미터에서 위조 성공률을 4퍼센트로 보고하는데, 적록 방식의 80퍼센트 이상과 대비됩니다. 다만 공격자의 질의를 3만에서 9만으로 늘리자 성공률은 15퍼센트로 올랐습니다. 같은 연구는 워터마크의 존재 자체가 블랙박스 질의로 드러난다는 점도 보였으므로, 배포를 비밀로 유지하는 선택지는 없습니다.

종합하면, 긴 구절에서 나온 양성 결과는 의미 있는 증거입니다. 음성 결과는 거의 아무 뜻도 없습니다. 사람이 쓴 글, 워터마크가 없는 모델, 짧은 표본, 바꿔쓰기 어느 쪽과도 똑같이 들어맞기 때문입니다. 이 위에 업무 흐름을 짜는 사람은 화면을 그리기 전에 이 비대칭을 몸에 익혀야 합니다.

법이 요구하는 것

이 영역에서 지금 세 개의 제도가 무언가를 요구하고 있고, 어느 것도 실제 배포된 것과 딱 맞아떨어지지 않습니다.

EU AI법 제50조 제2항. 합성 오디오, 이미지, 영상, 텍스트를 생성하는 AI 시스템 제공자는 출력물이 인공적으로 생성된 것으로 탐지될 수 있도록 기계가 읽을 수 있는 형식으로 표시해야 합니다. 표시는 기술적으로 실행 가능한 범위에서 효과적이고, 상호운용 가능하며, 견고하고, 신뢰할 수 있어야 합니다. 제50조는 2026년 8월 2일 적용되기 시작했고, 표시 및 라벨링 요건은 2026년 12월 2일에 발효되며, 같은 날 2026년 8월 2일 이전에 이미 시장에 나와 있던 시스템의 유예기간도 끝납니다. 실무 규범은 메타데이터, 워터마크, 로깅을 결합한 계층적 접근을 가리킵니다. C2PA를 지명하지는 않지만 그 특성을 아주 가깝게 묘사해, 현재 조건에 맞는 배포된 기술은 C2PA뿐이라는 지적이 나옵니다. 제50조의 전체 그림은 AI법 투명성 의무 안내에서 다뤘습니다.

상호운용 가능이라는 낱말에 주목하십시오. 만든 당사자만 읽을 수 있는 워터마크가 이 요건에 어떻게 들어맞는지는 기묘하고, 이 긴장은 풀리지 않았습니다.

중국. 인공지능 생성 합성 콘텐츠 표시 방법은 2025년 9월 1일 시행됐고 셋 중 가장 구체적입니다. 사용자에게 보이는 명시적 라벨과 파일 메타데이터에 넣는 암묵적 라벨을 모두 요구합니다. 텍스트도 적용 대상입니다. 플랫폼은 표시 기능을 제공해야 하고, AI 생성 콘텐츠를 게시하는 이용자는 이를 스스로 신고해야 합니다.

캘리포니아. AI Transparency Act, 곧 AB 853으로 개정된 SB 942는 월간 이용자 100만 명이 넘는 제공자에게 2026년 8월 2일부터 시행됐습니다. 무료 탐지 도구, 눈에 보이는 고지, 그리고 제공자 이름, 시스템 이름과 버전, 타임스탬프, 고유 식별자를 담은 내장형 잠재 고지를 요구합니다. 적용 범위를 꼼꼼히 읽으십시오. 잠재 고지 의무가 미치는 것은 이미지, 영상, 오디오입니다. 텍스트는 들어 있지 않습니다. 2027년 1월 1일부터 대형 온라인 플랫폼은 출처 데이터를 보여줘야 하고 고의로 제거해서는 안 됩니다.

세 곳의 양상은 같습니다. 법은 탐지할 수 있는 표시를 요구하는데, 배포된 텍스트 표시는 그 작성자만 탐지할 수 있습니다. 탐지가 열리거나, 아니면 텍스트 관련 의무는 복사해 붙여넣기를 사실상 견디지 못하는 C2PA식 메타데이터로 충족되게 될 것입니다.

소프트웨어를 만든다면 이것이 뜻하는 바

이 대부분은 컴플라이언스 프로젝트가 아닙니다. 지금은 값싸고 나중에 끼워 넣으려면 비싼 몇 가지 엔지니어링 결정입니다.

탐지기를 판정으로 사지 마십시오. 임의의 텍스트에서 SynthID를 탐지한다고 주장하는 공급업체가 있다면 그것은 불가능하며, 키를 달라고 하십시오. 이미 이용자 제출물에 AI 탐지를 돌리고 있다면 점수는 사람 검토로 넘기는 분류 신호로 다루고 결코 확정으로 다루지 마십시오. 결과가 따르는 용도에 반대하는 증거는 강력합니다. 스탠퍼드 연구는 탐지기가 영어가 모국어가 아닌 필자의 TOEFL 에세이 절반 이상을 AI 생성으로 잘못 분류했음을 밝혔고, 이 도구들이 사람의 작업을 100퍼센트 확신으로 표시한 뒤 이를 꺼버린 대학의 명단은 계속 늘고 있습니다. 그 위에 정책을 세우는 것은 통제가 아니라 책임 위험입니다.

출처 메타데이터를 벗겨내는 일을 멈추십시오. 가장 흔한 자해입니다. 이미지 파이프라인은 일상적으로 재인코딩하고 크기를 바꾸고 정규화하며, 대부분 그 과정에서 C2PA 매니페스트와 XMP를 버립니다. 제50조 제2항 아래에서 그것은 법이 보존하기를 바라는 표시를 여러분이 제거하는 일이고, 2027년 1월부터 캘리포니아에서는 플랫폼의 의무입니다. 파이프라인을 점검해 매니페스트를 보존하거나 변환 후 다시 서명하십시오. C2PA 2.3이 일반 텍스트 문서를 지원하게 된 지금, 같은 규율이 텍스트에도 곧 적용됩니다.

자체 출처 기록을 남기십시오. 실제로 작동하는 부분이 이것입니다. 워터마크가 무엇을 하든, 여러분의 시스템은 어떤 모델이 무엇을 언제 어떤 프롬프트로 생성했고 누가 검토했는지 압니다. 그것을 레코드의 필드로 저장하십시오. 제50조의 사람 검토 예외를 뒷받침하는 증거이고, 규제기관이나 고객에게 내미는 것이며, 누가 API를 내놓느냐에 좌우되지 않습니다.

직접 호스팅한다면 고리 전체가 손에 있습니다. Hugging Face Transformers에서 자체 모델을 돌리는 팀은 키를 쥐고 있으므로 생성할 때 워터마크를 넣고 나중에 탐지할 수 있습니다. 콘텐츠를 대량으로 생성하고 나중에 자기 출력을 알아봐야 한다면, 이것은 오늘 가능하며 아무도 여러분에게 팔고 있지 않습니다.

공급업체에 올바른 질문을 하십시오. "워터마크를 넣습니까"가 아닙니다. 요즘 답은 대개 그렇다이고 아무것도 알려주지 않습니다. 그 표시를 내가 읽을 수 있는지 아니면 그들만 읽을 수 있는지, 편집과 번역을 거치면 어떻게 되는지, C2PA 메타데이터가 붙는지 그리고 어떤 형식에 붙는지, 2026년 12월 2일 이후 제50조 제2항에 관해 계약서에 무엇을 적어줄 수 있는지를 물으십시오.

이 일이 향하는 곳

기술은 진짜이고 네이처의 결과는 제대로 된 엔지니어링입니다. 지연 비용은 0.5퍼센트, 약 2천만 건의 실제 Gemini 응답에 걸친 평가에서 이용자 만족도를 측정 가능한 수준으로 바꾸지 않았고, 모델을 건드리지 않고 탐지됩니다. 작은 일이 아닙니다.

한편 배포는 지금으로서는 닫혀 있습니다. 두 제공사가 텍스트에 워터마크를 넣지만 어느 쪽도 다른 이가 표시를 읽게 하지 않고, 세 번째는 하나를 만들어 넣어두었으며, 공개 모델은 체계 바깥에 완전히 놓여 있습니다. 표시 규칙이 요구하는 것과, 그 회사들 바깥의 사람이 실제로 검증할 수 있는 것 사이의 간극이 여기서 흥미로운 문제이며, 그것은 기술적 문제가 아닙니다.

고객에게 드리는 조언은 탐지에는 한 푼도 쓰지 말고 출처에 얼마간 쓰라는 것입니다. 돌릴 수도 없고 믿을 수도 없는 탐지는 통제 수단이 아닙니다. 자사 시스템이 무엇을 생성했는지에 대한 깔끔한 기록과, 이미 붙어 있는 메타데이터를 파괴하기를 그만두는 자산 파이프라인은 여러분이 통제하는 작업이고, 2026년 12월 2일 기한이 실제로 건드리는 지점이기도 합니다. 2028년까지 오는 모든 것 가운데 이것이 어디쯤 놓이는지는 2026 EU 디지털 컴플라이언스 안내를 보십시오.

저희는 유럽에서 사업하는 기업의 제품에 AI 기능을 넣습니다. 그래서 출처 필드, 자격증명을 보존하는 자산 파이프라인, 감사 추적은 별도 과제가 아니라 통상적인 납품의 일부입니다. AI 생성 콘텐츠가 제품의 어디로 들어오고 나가는 길에 그 출처에 무슨 일이 일어나는지 살펴보고 싶으시면 office@c9group.dev로 연락 주십시오.

저희는 엔지니어이지 변호사가 아닙니다. 특정 의무가 제공자로서 여러분에게 미치는지 배포자로서 미치는지는 법률 자문의 영역입니다. 저희는 시스템이 그 답에 맞도록 만듭니다.