الغموض (Perplexity) والتفجر (Burstiness) بوضوح: أي كاشفات الذكاء الاصطناعي تستخدمهما فعلا
Perplexity وBurstiness مقياسان حقيقيان، لكن GPTZero تقول إنها لم تعد تستخدمهما في الكشف منذ خريف 2023، وTurnitin تقول إن نموذجها لم يُبرمَج صراحةً لتقييمهما. نعرّف المقياسين، ونبين ما الذي يبقى بين يديك عند مراجعة نصك.
فريق HumanPen
· مدة القراءة: 5 د
ما معنى Perplexity
Perplexity مقياس لمدى قابلية الكلمة للتوقع. فعندما يقرأ نموذج لغوي جملة، يخصص احتمالا لكل كلمة بناء على الكلمات التي سبقتها. فإذا كانت الكلمة التالية شديدة التوقع، كان الغموض منخفضا عند تلك الكلمة. وإذا جاءت الكلمة غير متوقعة، ارتفع الغموض. وغموض النص بأكمله هو في جوهره متوسط مدى قابلية اختيارات الكلمات للتوقع في النص كله.
تخيل الأمر على هذا النحو. إذا كتبت "أظهرت التجربة نتيجة،" فالكلمة التالية على الأرجح ستكون "مهمة" أو "واضحة" أو "كبيرة". هذه كلمات عالية الاحتمال. أما إذا كانت الكلمة التالية "أناناس،" فذلك احتمال ضعيف، وسيقفز الغموض عند ذلك الموضع. النص الذي يختار دائما الكلمة الأكثر توقعا يكون غموضه الكلي منخفضا. والنص الذي يتخذ خيارات غير متوقعة يكون غموضه أعلى.
تميل النصوص المنتجة بالذكاء الاصطناعي إلى انخفاض الغموض، لأن النماذج اللغوية مصممة لاختيار الكلمة التالية الأكثر احتمالا. فهي تحسّن الاحتمال السياقي، ما يعني أن اختياراتها للكلمات تقع في أنماط يمكن توقعها. أما الكتابة البشرية فكثيرا ما تتضمن خيارات أقل قابلية للتوقع، وأفعالا غير مألوفة، وأسماء متخصصة في مجال بعينه، أو صياغات ما كان نموذج لغوي ليختارها. وهذا الفرق حقيقي وقابل للقياس. والسؤال هو: هل يستخدم كل كاشف للذكاء الاصطناعي الغموض جزءا من خوارزميته الفعلية؟ والجواب: لا.
ما معنى Burstiness
Burstiness مقياس للتباين في بنية الجمل. فإذا كانت كل جملة في الفقرة متقاربة في الطول والبنية النحوية والإيقاع، كان التفجر منخفضا. وإذا تفاوتت الجمل تفاوتا كبيرا، فبعضها قصير وموجز، وبعضها طويل ومعقد يحوي جملا تابعة، كان التفجر مرتفعا.
تميل الكتابة البشرية إلى تفجر أعلى مما في النص المنتج بالذكاء الاصطناعي. فنحن نكتب على دفعات. نخلط جملة تقريرية قصيرة بأخرى أطول تتضمن جملة اعتراضية بين قوسين. ونكسر النمط حين نريد إبراز نقطة ما. أما نماذج الذكاء الاصطناعي فتميل إلى إنتاج بنى جمل أكثر تجانسا، لأنها تحسّن الاتساق الإحصائي. والنتيجة نص يقرأ بسلاسة ولكن تباينه البنيوي أقل.
اكتسب التفجر شهرته بوصفه مقياسا للكشف لأنه يلمس شيئا حقيقيا في الفرق بين الكتابة البشرية وكتابة الذكاء الاصطناعي. فالبشر غير منتظمين، ونماذج الذكاء الاصطناعي متسقة. والكاشف الذي يقيس التفجر ينظر فيما إذا كانت بنية جملك تتباين بما يكفي لتبدو بشرية. وكما هو الحال مع الغموض، يعد التفجر مفهوما مفيدا. وكما هو الحال مع الغموض أيضا، ليس مقياسا يحسبه كل كاشف.
أي الكاشفات تستخدم هذين المقياسين
GPTZero هي من أشاعت المصطلحين، وصفحتها اليوم تُقرأ على مستويين. فمقال 2023 ما زال منشوراً، وهو يصف Perplexity بأنه مقياس لمدى صعوبة توقع النص، وBurstiness بأنه مقياس للتباين على مستوى الجملة، ويصف الاثنين معاً بأنهما الطبقة الإحصائية في نموذج الكشف لديها. وفي أعلى الصفحة نفسها تذكر GPTZero أنها منذ خريف 2023 لم تعد تستخدم Perplexity وBurstiness في كشف الذكاء الاصطناعي، بعد انتقالها إلى بنية تعلّم عميق. ويبقى المصطلحان جديرين بالفهم، لأنهما يسميان شيئاً حقيقياً في النص. لكنهما لم يعودا وصفاً للطريقة التي يحسم بها هذا الكاشف أمره.
أما Turnitin فيسلك نهجا مختلفا. إذ تنص الأسئلة الشائعة الرسمية لديهم: "Our model is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions." (لم تتم برمجة نموذجنا بشكل صريح لتقييم إشارات محددة مثل «التفجر» أو «الغموض» أو غيرها من المقاييس الفردية التي يشار إليها أحيانا في النقاشات العامة.) وتقول الجملة التالية: "Instead, it learns statistical patterns from our training data." (بدلا من ذلك، يتعلم أنماطا إحصائية من بيانات تدريبنا.) وهذا نفي مباشر وصريح بأن Turnitin يحسب هذين المقياسين.
وسبب أهمية هذا التمييز أن الأداتين تصنفان النص نفسه أحيانا بشكل مختلف، غير أن السبب ليس ما يُقال عادة. فالكتابة المصممة بحيث يكون تفجرها وغموضها مرتفعين تستهدف شيئا لا تقول أيٌّ من الشركتين اليوم إنها تحسبه: فـ GPTZero تقول إنها أوقفت استخدام هذين المقياسين في خريف 2023، وTurnitin تقول إن مصنفها تعلّم أنماطا من بيانات التدريب دون أن يحسب أياً منهما. والنصائح التي تقول «زد من تفجرك» أو «قلل من غموضك» مضبوطة على مرحلة الكشف الإحصائي، ووثائق الشركتين المعلنة لا تتيح لك التحقق مما إذا كانت لا تزال تُحدث أثرا.
ما الذي يستخدمه Turnitin بدلا من ذلك
إذا كان Turnitin لا يحسب الغموض ولا التفجر، فما الذي يستخدمه؟ تصف الوثائق مصنفا يتعلم أنماطا إحصائية من بيانات التدريب، ثم يطبقها على مقاطع من نصك.
يقول Turnitin: "Our model is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions. Instead, it learns statistical patterns from our training data." (لم تتم برمجة نموذجنا بشكل صريح لتقييم إشارات محددة مثل «التفجر» أو «الغموض» أو غيرها من المقاييس الفردية التي يشار إليها أحيانا في النقاشات العامة. بدلا من ذلك، يتعلم أنماطا إحصائية من بيانات تدريبنا.) لا يشغّل المصنف صيغة للغموض ولا صيغة للتفجر. بل يطبق أنماطا استوعبها أثناء التدريب، أنماطا تتضمن احتمالية الكلمات ولكن لا يمكن ردها إلى درجة محددة واحدة بعينها.
وتؤكد صفحة الأسئلة الشائعة نفسها ما يركز عليه المصنف فعلا: "Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers." (دُربت مصنفاتنا على اكتشاف هذه الفروق في احتمالية الكلمات، وهي بارعة في متواليات احتمالية الكلمات التي تميز الكتاب من البشر.) احتمالية الكلمات في صميم ما تعلمه مصنف Turnitin، غير أن النموذج يعالجها من خلال أنماط متعلمة، لا من خلال حساب صريح للغموض.
والآلية قائمة على المقاطع. يصفها Turnitin قائلا: "When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated." (عند إرسال ورقة بحثية إلى Turnitin، تُستخرج الجمل من المادة المقدمة وتُقسم إلى أقسام متداخلة لغرض التحليل التنبؤي. ويصنف نموذج كشف الذكاء الاصطناعي كل قسم ويمنحه قيمة بين 0 و1، تدل على احتمال أن يكون النص من كتابة بشرية أو منتجا بالذكاء الاصطناعي.) تتداخل المقاطع، وترث الجمل الدرجات، وتجمع الدرجات المتعددة، وينتج من التجميع النهائي نسبة النص على مستوى المستند. ولا تتضمن هذه السلسلة خطوة تُحسب فيها قيمة الغموض أو التفجر.
ويلاحظ Turnitin أيضا: "As a result, its outputs are generated by many learned patterns working together rather than by a small set of transparent, human-readable rules. For that reason, individual predictions may not always be explainable in simple feature-by-feature terms." (ونتيجة لذلك، تتولد مخرجاته عن أنماط متعلمة كثيرة تعمل معا، لا عن مجموعة صغيرة من القواعد الشفافة القابلة للقراءة البشرية. ولهذا السبب، قد لا يكون بالإمكان دائما تفسير التنبؤات الفردية بعبارات بسيطة تشرح كل سمة على حدة.) عملية اتخاذ القرار في النموذج ليست مما يمكنك فك شفرته بتتبع حفنة من المقاييس.
الفارق العملي بالنسبة لكتابتك
الخلاصة العملية بسيطة. إذا قرأت نصيحة تقول «قلل من غموضك لتتفوق على Turnitin»، فتلك النصيحة مبنية على سوء فهم للأداة؛ إذ تقول Turnitin إن نموذجها لم يُبرمَج صراحةً لتقييم هذه الإشارة. أما النصائح المبنية على التفجر والغموض فتنتمي إلى مرحلة الكشف الإحصائي التي تقول GPTZero إنها غادرتها في خريف 2023، ولم تعد تطابق ما تقوله أيٌّ من الأداتين عن نفسها اليوم.
المشكلة أن مصنف Turnitin لا يستخدم هذين المفهومين بوصفهما مقياسين مسميين. لقد تعلم أنماطا إحصائية من بيانات التدريب، أنماطا تتضمن معلومات احتمالية الكلمات، ويطبقها على نصك. ولا يمكنك التحسين وفق مقياس لا يحسبه المصنف. وما يمكنك فعله هو أن تكتب بطرق تعبر عن تأليف بشري حقيقي، بتباين طبيعي في اختيار الكلمات وفي البنية، يختلف عن الأنماط التي تنتجها نماذج الذكاء الاصطناعي.
يمكن إعادة تشغيل المقاطع المستوفية للشروط مجاناً. جرّب ذلك من هنا.
تابع القراءة
هل تُصنَّف الترجمة من الصينية إلى الإنجليزية على أنها كتابة بالذكاء الاصطناعي في Turnitin؟
مدة القراءة: 5 د
تقارير الكشفدليل الطلاب الصينيين لخفض نسب اكتشاف الذكاء الاصطناعي في Turnitin
مدة القراءة: 5 د
تقارير الكشفأسطورة perplexity وburstiness: ما تستخدمه Turnitin في الحقيقة
مدة القراءة: 5 د