Anthropic روش واترمارک گذاری (Watermarking) متن Claude را به طور رسمی اعلام کرد. این واترمارک هیچ کاراکتر مخفی یا یونیکدی به متن اضافه نمی کند، بلکه الگوی تصادفی بودن در انتخاب کلمات را تغییر می دهد. ویرایش سبک متن این نشانه را از بین نمی برد، اما بازنویسی کامل می تواند آن را پاک کند.
واترمارک متنی Claude چگونه کار می کند؟
بر خلاف ادعای برخی کارشناسان هوش مصنوعی، این واترمارک هیچ کاراکتر یونیکد پنهانی در متن جای نمی دهد.
بنابراین نمی توان آن را با کپی و جای گذاری متن در یک فایل ساده شناسایی یا حذف کرد.
این فناوری همچنین ربطی به استفاده از خط تیره بلند (em dash) یا الگوهای رایج نگارشی مدل های زبانی مانند «این نه، آن است» ندارد. واترمارک به دنبال احتمال نوشته شدن متن توسط هوش مصنوعی نیست، بلکه یک الگوی مشخص را جست و جو می کند.
مدل های زبانی بزرگ (LLM) کلمه بعدی را بر اساس بیشترین احتمال پیش بینی می کنند، اما مقداری تصادفی بودن (Randomness) نیز در انتخاب کلمه دخیل است. فناوری SynthID از همین تصادفی بودن استفاده می کند تا با کمک یک کلید واترمارک (Watermark Key) و کلمات پیش از هر واژه، یک الگو بسازد.
چون این روش فقط منبع تصادفی بودن انتخاب کلمه را تغییر می دهد، متن تولیدشده هیچ تفاوت قابل تشخیصی با متن معمولی ندارد و کاربران بدون داشتن کلید نمی توانند واترمارک را شناسایی کنند.
به گفته Anthropic، این الگو برای خواننده قابل تشخیص نیست، اما هر کسی که کلید رمزگشایی آن را داشته باشد می تواند آن را تشخیص دهد. در حالت عادی انتخاب کلمات کاملا تصادفی است، اما در حالت واترمارک دار، منبع این تصادفی بودن تغییر می کند: به جای یک مولد عدد تصادفی معمولی، از کلید واترمارک و چند کلمه پیشین برای تعیین کلمه بعدی استفاده می شود. به این ترتیب کلماتی که Claude انتخاب می کند همچنان تصادفی هستند، اما می توان بررسی کرد که آیا این توالی کلمات با انتخاب هایی که Claude در صورت استفاده از آن کلید انجام می داد هم خوانی دارد یا نه.
این واترمارک نسخه ای از فناوری SynthID است
طبق اعلام Anthropic، این واترمارک نسخه ای از روش SynthID-Text است که توسط Google DeepMind در سال ۲۰۲۴ میلادی توسعه داده شد.
این فناوری دقیقا همان SynthID نیست، بلکه نسخه ای بر پایه آن است؛ چرا که این حوزه در دو سال گذشته پیشرفت چشمگیری داشته است.
Anthropic اعلام کرده که واترمارک متنی Claude به خانواده ای از روش ها تعلق دارد که ریشه آن ها به پیشنهاد Scott Aaronson در سال ۲۰۲۲ برمی گردد؛ روش هایی که همگی بر یک اصل طراحی مشترک استوارند: واترمارک فقط منبع تصادفی بودن در انتخاب کلمات را تغییر می دهد.
آیا واترمارک Anthropic قابل دور زدن است؟
بله، این واترمارک از طریق بازنویسی محتوا به شکل کامل قابل حذف است، اما ویرایش سطحی احتمالا آن را از بین نمی برد.
طبق توضیح Anthropic، ویرایش سبک متن به احتمال زیاد واترمارک را به طور کامل پاک نمی کند؛ اما اگر تمام کلمات متن جایگزین شوند، واترمارک از بین می رود. البته در چنین حالتی اساسا جای بحث دارد که آیا می توان همچنان آن متن را «تولیدشده توسط هوش مصنوعی» نامید یا نه.
SynthID به دنبال الگوی کلماتی است که در زمان تولید متن درج شده اند؛ بنابراین اگر سند به اندازه کافی بازنویسی یا ویرایش شود، همان کلماتی که نقش واترمارک را دارند از بین می روند.
تفاوت این فناوری با SynthID و MirrorMark
SynthID در سال ۲۰۲۴ توسعه یافت و از آن زمان تاکنون، فناوری های پیشرفته تری در این حوزه معرفی شده اند.
یکی از نسخه های جدیدتر SynthID با نام MirrorMark، این فناوری را با پخش واترمارک در سراسر متن تولیدشده توسعه می دهد و از کلمات اطراف به عنوان بافت (Context) برای تعیین محل قرارگیری هر بخش از واترمارک استفاده می کند؛ ویژگی ای که مقاومت آن را در برابر ویرایش افزایش می دهد.
SynthID یک واترمارک تک بیتی (Zero-bit Watermark) است؛ یعنی فقط تشخیص می دهد که واترمارک وجود دارد یا نه. اما MirrorMark می تواند چندین بیت اطلاعات را رمزگذاری کند و عملا واترمارک را در کل متن تولیدشده پخش می کند.
ویژگی های یک نسخه ۲۰۲۶ مانند MirrorMark عبارت اند از:
- افزودن رمزگذاری چندبیتی (Multi-bit Encoding)
- بازتاب تصادفی بودن فرایند تولید متن مدل زبانی
- استفاده از CABS یا زمان بند متوازن مبتنی بر بافت (Context-Anchored Balanced Scheduler) برای تعیین محل قرارگیری واترمارک ها
- طراحی اختصاصی برای مقاومت در برابر ویرایش، مشابه واترمارکی که Anthropic در برابر ویرایش های سبک از آن استفاده می کند
نویسنده مقاله تاکید می کند که ادعا نمی کند Anthropic دقیقا از MirrorMark استفاده می کند؛ اما پیش از تکیه کامل بر فناوری دو ساله SynthID، بررسی قابلیت های نسخه های جدیدتر آن در سال ۲۰۲۶ می تواند مفید باشد.
مهم ترین یافته های افشاگری Anthropic درباره واترمارک Claude
- Claude از این پس خروجی های متنی خود را واترمارک دار تولید می کند؛ Anthropic این کار را بخشی از هماهنگی با قانون هوش مصنوعی اتحادیه اروپا (EU AI Act) عنوان کرده است.
- واترمارک الگویی است که در حین تولید متن ساخته می شود، نه یک کد یونیکد، متادیتا یا کاراکتر پنهان؛ این الگو از طریق خود فرایند انتخاب کلمه شکل می گیرد.
- واترمارک متنی Claude نسخه ای از فناوری SynthID-Text است که بر پایه روش Google DeepMind در سال ۲۰۲۴ ساخته شده است.
- این واترمارک منبع تصادفی بودن در انتخاب کلمات را تغییر می دهد؛ Claude همچنان از میان گزینه های محتمل به صورت تصادفی انتخاب می کند، اما این انتخاب اکنون بر اساس کلید واترمارک و کلمات پیشین تعیین می شود.
- این واترمارک الگویی قابل شناسایی در انتخاب کلمات Claude ایجاد می کند که فقط دارندگان کلید می توانند آن را بررسی و تایید کنند.
- هیچ چیزی به متن اضافه نمی شود؛ Anthropic تاکید کرده که هیچ کاراکتر پنهان، توکن اضافه یا الحاقی قابل مشاهده در متن وجود ندارد.
- متن واترمارک دار از نظر ظاهری هیچ تفاوتی با متن بدون واترمارک ندارد و به گفته Anthropic، این فناوری تاثیری بر کیفیت یا محتوای تولیدشده نمی گذارد.
- واترمارک باعث نمی شود Claude انتخاب های کلمه ای غیرعادی داشته باشد؛ Anthropic می گوید این فناوری Claude را به سمت کلمات خاصی هدایت نمی کند.
- هرچه متن کوتاه تر باشد، شناسایی واترمارک دشوارتر است؛ طبق اعلام Anthropic، دقت تشخیص واترمارک در نمونه های کوتاه پایین است و با افزایش تعداد کلمات بهتر عمل می کند.
- واترمارک در محتوای صرفا واقعیت محور (Factual Content) ضعیف تر عمل می کند، چون گزینه های کمتری برای اعمال تصادفی بودن در این نوع محتوا وجود دارد.
- در ویرایش های صرفا نگارشی نیز واترمارک ضعیف تر می شود. Anthropic توضیح می دهد که اگر فقط از مدل خواسته شود گرامر و نشانه گذاری را اصلاح کند و چیز دیگری تغییر نکند، واترمارک تنها در همان چند اصلاح باقی می ماند که ممکن است برای شناسایی کافی نباشد.
- Anthropic قصد دارد یک رابط برنامه نویسی (API) برای تشخیص واترمارک منتشر کند.
- برای فایل های تصویری مانند JPG، PNG و SVG، به جای واترمارک متنی از متادیتای C2PA استفاده خواهد شد.
- افزودن واترمارک تاثیر ناچیزی بر سرعت پردازش دارد و هیچ هزینه توکن اضافه ای ایجاد نمی کند.
این تحول برای فعالان حوزه محتوا و بهینه سازی موتور جست و جو اهمیت زیادی دارد، چون تشخیص محتوای تولیدشده با هوش مصنوعی مستقیما به بحث سئو و هوش مصنوعی مرتبط است.
منبع: Anthropic Reveals What The Watermark Is And How It Can Be Defeated
آدرس کوتاه این پست: https://backlinkiran.com/?p=18752
