طبق مستندات رسمی اوپن ای آی، ربات ChatGPT-User زمانی صفحه ای را باز می کند که یک کاربر واقعی از ChatGPT سوالی پرسیده باشد؛ و چون این عمل با درخواست انسان آغاز می شود، قوانین فایل robots.txt ممکن است برای آن اعمال نشود. داده های تازه نشان می دهد همین ربات، نسبت به هر ربات هوش مصنوعی دیگری، بیشترین دفعات ورود به صفحات مسدود شده را داشته است.
کجا این دور زدن ها اتفاق می افتد
در سایت های اروپایی بررسی شده، حدود ۱۵ درصد از ربات های فچ کننده صفحه که هویتشان شناسایی شده بود، به آدرس هایی وارد شدند که آن سایت ها به صراحت مسدود (Disallow) کرده بودند.
این موضوع بیشتر مربوط به چند ربات خاص است. برای مثال، سه ربات ChatGPT-User، Bytespider و Youbot هرکدام در نزدیک به نیمی از سایت های اروپایی که آن ها را به صورت مشخص در فهرست مسدودی خود آورده بودند، همچنان به صفحات ممنوعه دسترسی پیدا کردند. در میان این سه، ChatGPT-User بیشترین تعداد سایت را دور زده است.
سایت ها این ربات را مسدود کرده بودند
بسیاری از ربات های فچ کننده جدیدتر تقریبا هیچ مسدودیتی ندارند. تنها ۹ درصد از سایت های اروپایی، ربات Claude-User را مسدود کرده اند؛ در حالی که این رقم در آمریکای شمالی ۲۶ درصد است. برای Perplexity-User نیز این نسبت ۱۳ درصد در برابر ۲۶ درصد است.
بیشتر ربات های جدید در اروپا نرخ مسدودی تک رقمی دارند، اما ChatGPT-User یک استثنا محسوب می شود و نرخ مسدودی بالاتری را به خود اختصاص داده است.
اوپن ای آی درباره این قانون چه می گوید
طبق مستندات ربات های اوپن ای آی، ربات ChatGPT-User زمانی از یک صفحه بازدید می کند که کاربری در ChatGPT سوالی پرسیده باشد؛ و از آنجا که این کنش با اقدام کاربر آغاز شده، قوانین robots.txt ممکن است برای آن صدق نکند.
پرپلکسیتی (Perplexity) نیز می گوید ربات Perplexity-User معمولا این فایل را به همین دلیل نادیده می گیرد، اما آنتروپیک (Anthropic) دیدگاه متفاوتی دارد و اعلام کرده هر سه ربات آن به این فایل احترام می گذارند. شرکت TollBit نیز هر درخواستی به یک آدرس مسدود شده را، صرف نظر از توضیح اپراتور ربات، یک نقض (Bypass) در نظر می گیرد.
چرا این موضوع اهمیت دارد
خط Disallow برای ChatGPT-User در واقع یک درخواست است که طبق مستندات خود اوپن ای آی، ممکن است اجرا نشود.
نکته مهم دیگر این است که طبق همین مستندات، رباتی که تصمیم می گیرد سایت شما در نتایج جست و جوی ChatGPT نمایش داده شود یا نه، OAI-SearchBot نام دارد، نه ChatGPT-User. سایت هایی که هر دو ربات را مسدود می کنند تا از ترافیک هوش مصنوعی جلوگیری کنند، در واقع بخش دیده شدن (Visibility) خود را از دست داده اند، در حالی که کنترلی روی فچ نگه داشته اند که همچنان یک استثنا دارد.
لاگ های سرور یا رکوردهای CDN نشان می دهند واقعا چه چیزی دریافت شده است؛ فایل robots.txt فقط نشان می دهد چه چیزی درخواست شده بود.
نگاهی به آینده
کلادفلر (Cloudflare) در حال به روزرسانی نحوه مدیریت کنترل خزنده هاست و این تصمیم گیری را به لایه شبکه منتقل می کند. برای ربات های شناخته شده، دیگر تطابق با قوانین به خود خزنده واگذار نمی شود. از ۱۵ سپتامبر، دامنه های جدیدی که به کلادفلر اضافه شوند، به صورت پیش فرض خزنده های آموزشی (Training) و عامل (Agent) را در صفحات دارای تبلیغ مسدود خواهند کرد، در حالی که خزنده های جست و جو (Search) همچنان مجاز باقی می مانند.
سوال باز این است که آیا این راه گریز مبتنی بر «درخواست کاربر» باقی می ماند یا نه. این استدلال بر این پایه است که درخواست یک صفحه با خزیدن یک ربات فرق دارد، و اکنون همه دستیارهای هوش مصنوعی بزرگ صفحات را به همین شکل دریافت می کنند.
جمع بندی برای مدیران سایت
فایل robots.txt همچنان بخشی مهم از هر سئو فنی هر سایت است، اما دیگر یک ضمانت مطلق برای جلوگیری از دسترسی ربات ها محسوب نمی شود. با گسترش دستیارهای هوش مصنوعی که به نیابت از کاربر صفحات را باز می کنند، مرز میان سئو و هوش مصنوعی در حال تغییر است و مدیران سایت باید علاوه بر فایل robots.txt، به لاگ های سرور خود نیز اتکا کنند. بررسی منظم این تنظیمات، بخشی طبیعی از یک چک لیست سئو تکنیکال است.
منبع : OpenAI Says Robots.txt May Not Apply To ChatGPT’s Fetch Bot
آدرس کوتاه این پست: https://backlinkiran.com/?p=18755
