لقد شعرنا جميعًا بالشك الزاحف بأن شيئًا ما نقرأه قد كتبه نموذج لغوي كبير – ولكن من الصعب للغاية تحديده. لبضعة أشهر في العام الماضي، أصبح الجميع مقتنعين بأن كلمات محددة مثل “العمق” أو “الشرطة السفلية” يمكن أن تكشف عن النماذج، لكن الأدلة ضعيفة، ومع تطور النماذج أكثر تعقيدًا، أصبح من الصعب تتبع الكلمات المنبهة.
ولكن كما اتضح، أصبح الأشخاص في ويكيبيديا جيدًا جدًا في تحديد النثر المكتوب بالذكاء الاصطناعي – والدليل العام للمجموعة حول “علامات الكتابة بالذكاء الاصطناعي” هو أفضل مصدر وجدته لتحديد ما إذا كانت شكوكك مبررة. (الفضل للشاعر جيمسون فيتزباتريك، الذي أشار إلى الوثيقة المتعلقة بـ X.)
منذ عام 2023، يعمل محررو ويكيبيديا على التعامل مع عمليات إرسال الذكاء الاصطناعي، وهو مشروع يطلقون عليه اسم Project AI Cleanup. مع ملايين التعديلات التي تأتي كل يوم، هناك الكثير من المواد التي يمكن الاعتماد عليها، وبأسلوب محرر ويكيبيديا الكلاسيكي، أنتجت المجموعة دليلاً ميدانيًا مفصلاً ومليئًا بالأدلة.
في البداية، يؤكد الدليل ما نعرفه بالفعل: الأدوات الآلية عديمة الفائدة في الأساس. بدلاً من ذلك، يركز الدليل على العادات والعبارات النادرة في ويكيبيديا ولكنها شائعة على الإنترنت بشكل عام (وبالتالي، فهي شائعة في بيانات تدريب النموذج). وفقًا للدليل، ستقضي عمليات تقديم الذكاء الاصطناعي الكثير من الوقت في التأكيد على أهمية الموضوع، عادةً بعبارات عامة مثل “لحظة محورية” أو “حركة أوسع”. ستقضي نماذج الذكاء الاصطناعي أيضًا الكثير من الوقت في تفصيل نقاط إعلامية بسيطة لجعل الموضوع يبدو بارزًا – وهو الشيء الذي تتوقعه من السيرة الذاتية الشخصية، ولكن ليس من مصدر مستقل.
يشير الدليل إلى ميزة مثيرة للاهتمام بشكل خاص فيما يتعلق بالبنود التي تحتوي على ادعاءات غامضة ذات أهمية. ستقول النماذج أن بعض الأحداث أو التفاصيل “تؤكد أهمية” شيء ما أو آخر، أو “تعكس الأهمية المستمرة” لبعض الأفكار العامة. (سيعرف المهووسون بالقواعد هذا باسم “النعت المضارع”.) من الصعب بعض الشيء تحديده، ولكن بمجرد أن تتمكن من التعرف عليه، ستراه في كل مكان.
هناك أيضًا ميل نحو استخدام لغة تسويقية غامضة، وهو أمر شائع جدًا على الإنترنت. المناظر الطبيعية دائمًا خلابة، والمناظر دائمًا تخطف الأنفاس، وكل شيء نظيف وحديث. وعلى حد تعبير المحررين، “يبدو الأمر أشبه بنص إعلان تلفزيوني”.
الدليل يستحق القراءة بالكامل، لكنني أعجبت به كثيرًا. قبل ذلك، كنت سأقول إن نثر LLM كان يتطور بسرعة كبيرة بحيث لا يمكن تحديده. لكن العادات المذكورة هنا متجذرة بعمق في الطريقة التي يتم بها تدريب نماذج الذكاء الاصطناعي ونشرها. يمكن إخفاءها، لكن سيكون من الصعب التخلص منها تمامًا. وإذا أصبح عامة الناس أكثر ذكاءً في تحديد نثر الذكاء الاصطناعي، فقد يؤدي ذلك إلى جميع أنواع العواقب المثيرة للاهتمام.

