زواحف الذكاء الاصطناعي في robots.txt: بأيها تسمح ولماذا
حظر زواحف الذكاء الاصطناعي كلها يعني اختفاءك من الإجابات. بعضها يجلب الصفحة ليجيب الآن وبعضها يجمع بيانات تدريب، والفرق بينهما سطر في robots.txt.
أهم النقاط
- تنقسم زواحف الذكاء الاصطناعي إلى زواحف إجابة وزواحف تدريب وجالبات طلب من المستخدم، ولحجب كل منها أثر مختلف.
- حجب زواحف الإجابة يخرجك من الاستشهادات الحية؛ حجب زواحف التدريب لا يفعل.
- تحقق من robots.txt الحي بعد كل نشر، ومن حماية الروبوتات في شبكة التوصيل التي تحجب عند الحافة بلا أثر مرئي.
- الزاحف المحجوب لا يستطيع قراءة توجيه noindex، فالحجب ليس كالاستبعاد.
تنقسم زواحف الذكاء الاصطناعي إلى ثلاث مجموعات وظيفية، والتمييز بينها يحدد كلفة حجب أي منها. زواحف البحث والإجابة تجلب الصفحات ليستشهد بها المساعد في رد حي. وزواحف التدريب تجمع النصوص لتدريب النماذج. وجالبات الطلب من المستخدم تجلب صفحة بعينها لأن أحدهم سأل عنها. حجب الأولى يخرجك من الاستشهادات. وحجب الثانية قرار ترخيص محتوى. وحجب الثالثة يكسر طلبًا قدّمه إنسان حقيقي.
المجموعات الثلاث
- زواحف الإجابة والبحث، مثل OAI-SearchBot وPerplexityBot وGoogle-Extended بصفته الإجابية. تبني الفهرس الذي يستند إليه المساعد حين يستشهد بمصادر. إن كان الاستشهاد هو الهدف فيجب السماح لها.
- زواحف التدريب، مثل GPTBot وClaudeBot وCCBot وApplebot-Extended. السماح لها يسهم بمحتواك في تدريب النماذج المستقبلية. هذا قرار عمل حقيقي له إجابات معقولة في الاتجاهين، ولا يؤثر في كونك مُستشهدًا بك اليوم.
- جالبات الطلب من المستخدم، مثل ChatGPT-User وPerplexity-User. تعمل حين يلصق شخص رابطك أو يسأل عن صفحتك. وحجبها ينتج فشلًا مرئيًا لمن كان يحاول قراءتك فعلًا.
إعداد افتراضي يناسب أغلب الشركات
بالنسبة لشركة تريد أن تُوجد ويُستشهد بها، الافتراض المعقول هو السماح للمجموعات الثلاث على المحتوى التسويقي العام، ومنع كل شيء على المناطق المصادَق عليها ومسارات الإدارة وأي شيء خلف تسجيل دخول. أما الناشرون الذين منتجهم هو النص نفسه فحسابهم مختلف، وكثيرًا ما يسمحون لزواحف الإجابة ويمنعون زواحف التدريب، وهو موقف متماسك.
أما ما نادرًا ما يكون متماسكًا فهو حجب كل شيء بردة فعل. نجد بانتظام مواقع أضافت منعًا شاملًا أثناء مراجعة أمنية ثم قضت ربعًا تتساءل لماذا لا يذكرها أي مساعد.
كيف تتحقق مما تفعله فعلًا
اقرأ robots.txt الحي لا المقصود، فعمليات النشر تكتب فوقه. تأكد أن كل وكيل يهمك مذكور صراحة، فقاعدة لوكيل عام قد تُلغى بقاعدة أكثر تحديدًا، وقواعد الأسبقية تفاجئ الناس. ثم تحقق من الخارج: اطلب صفحة بسلسلة الوكيل المعنية وتأكد أنك تحصل على 200 بمحتوى حقيقي.
وخارج robots.txt، انتبه لقاعدة حماية روبوتات في جدار ناري أو شبكة توصيل تحجب هذه الوكلاء عند الحافة. هذا سبب شائع وغير مرئي، لأن robots.txt يبدو صحيحًا بينما لا يصل الطلب إلى الخادم أصلًا. تحقق من إعدادات إدارة الروبوتات في شبكة التوصيل صراحة.
فخ noindex
ثمة دقيقة توقع الفرق. إذا حجبت زاحفًا في robots.txt فلن يستطيع جلب الصفحة وبالتالي لن يرى توجيه noindex في الـ HTML. فإن أردت استبعاد صفحة من فهرس ذكاء اصطناعي، فاسمح بالزحف وقدّم الاستبعاد، بدل حجب الزحف وافتراض أن الاستبعاد يتبع.
حجب كل روبوتات الذكاء الاصطناعي بردة فعل قرار بأن تكون غائبًا عن سطح يستخدمه عملاؤك بالفعل.
المصادر