لماذا يقول Turnitin إن عملك مكتوب بالذكاء الاصطناعي بنسبة 100%

الـ 100% ليست نسخة أكثر ثقة من الـ 60%. ففي شرح Turnitin نفسه لكيفية تجميع هذا الرقم، تمثل القيم المتطرفة النقطة التي يملك عندها الحساب أقل قدر من العناصر لحساب متوسطها.

فريق HumanPen

· مدة القراءة: 11 د

ابدأ من هنا، قبل الشرح

ثمة ثلاث حالات تُنتج 100 بتواتر أكبر بكثير من فكرة أن كل جملة كتبتها تبدو كما لو أن آلة هي التي كتبتها، ويمكنك تأكيدها أو استبعادها في نحو عشر دقائق. تحقق أولاً من الرقم الذي تحمله: تقول Turnitin إن مؤشر الكتابة بالذكاء الاصطناعي غير مرئي للطلاب، لذا فإن النسبة المئوية التي وجدتها بنفسك داخل شاشتك هي نتيجة التشابه لا نتيجة الذكاء الاصطناعي. تحقق من مقدار النثر الذي يحتويه الملف: تقول Turnitin إن التوقع في المستندات التي لا تتجاوز بضع مئات من الكلمات يكون "mostly 'all or nothing'" (في معظمه إما كل شيء أو لا شيء)، لأنه يجري على مقطع واحد دون أي فرصة للتداخل. تحقق مما تمثله نسبة الـ 100: تُحسب النسبة المئوية على النص المؤهل، وتقول Turnitin إن هذا الرقم "is not necessarily the percentage of the entire submission" (ليس بالضرورة نسبة العمل المُقدَّم بأكمله). ولا يصبح السؤال عما رآه النموذج في الكتابة نفسها ذا معنى إلا بعد استبعاد هذه الاحتمالات الثلاثة كلها.

تستدعي الحالات الثلاث استجابات مختلفة تماماً، ولهذا يكون الترتيب أهم من الشرح. هذه الصفحة تتناول كيفية إنتاج رقم متطرف. إنها ليست نصاً جاهزاً لجلسة حول سوء السلوك، ولا شيء فيها يتنبأ بما سيقوله تقرير مستقبلي.

أولاً، تحقق من أي 100 تحمل

توضح Turnitin بصرامة من يمكنه رؤية رقم الذكاء الاصطناعي. تقول إرشاداتها إن "only instructors and administrators are able to see the indicator" (المدرسون والإداريون وحدهم يمكنهم رؤية المؤشر)، وفي موضع آخر إن "The AI writing detection indicator and report are not visible to students." (مؤشر وتقرير كشف الكتابة بالذكاء الاصطناعي غير مرئيين للطلاب). والجملة التي تأتي مباشرة بعد الثانية لا تقل أهمية: "However, with the PDF download feature, instructors can download and share the AI report with students." (ومع ذلك، بفضل ميزة تنزيل ملف PDF، يمكن للمدرسين تنزيل تقرير الذكاء الاصطناعي ومشاركته مع الطلاب). إذن كلا الطريقين قائم. وملف PDF أرسله إليك أحدهم قد يكون بالفعل تقرير الذكاء الاصطناعي. أما النسبة المئوية التي نقرت عليها بنفسك من شاشة عملك، فليست مؤشر الذكاء الاصطناعي.

يبقى إذن الرقم الآخر، وهناك يكون 100 قيمة أكثر شيوعاً بكثير. لنتيجة تشابه تبلغ 100% مسار موثق وبريء تماماً: مسوداتك السابقة، المحفوظة ضمن مهمة أخرى، تطابق نسختك النهائية كلمة بكلمة تقريباً. وقد تتبعنا كيف يحدث ذلك، ومتى لا يحدث، في هل ستتطابق مسودتي السابقة مع إعادة التقديم. والتقريران تحليلان منفصلان يمكن أن يختلفا في الاتجاهات الأربعة كلها، وهو موضوع تقرير الذكاء الاصطناعي مقابل تقرير التشابه.

إن 100 على جانب التشابه و100 على جانب الذكاء الاصطناعي نتيجتان مختلفتان، لهما أسباب مختلفة واستجابات مختلفة. وقضاء أمسية كاملة على الرقم الخطأ هو أكثر الطرق شيوعاً لسوء سير هذه الأمور.

المستندات القصيرة تُقيَّم على أساس كل شيء أو لا شيء

يتضمن الوصف المنشور من Turnitin لعملية الحساب ثلاث خطوات: تُستخرج الجمل وتُجمَّع في مقاطع متداخلة، ويحصل كل مقطع على احتمال بين 0 و1، وترث كل جملة مؤهلة درجة كل مقطع تقع فيه. ولأن المقاطع تتداخل، تحمل الجملة القريبة من الحد أكثر من درجة، ثم تُجمَّع هذه الدرجات. وهذه الدرجات المجمَّعة للجمل هي ما يُحتسب لتكوين رقم المستند. وحساب المتوسط هو السبب كله في أن مستنداً ما قد يعود بـ 43 بدلاً من أحد الطرفين.

الآن أزل ذلك. تقول الأسئلة الشائعة لدى Turnitin ما الذي يحدث حين لا يوجد شيء لحساب متوسطه:

"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap. This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (في المستندات الأقصر التي لا تتجاوز بضع مئات من الكلمات، سيكون التوقع في معظمه إما كل شيء أو لا شيء، لأننا نتوقع على مقطع واحد دون فرصة للتداخل. وهذا يعني أن نصاً يجمع بين محتوى مولَّد بالذكاء الاصطناعي ومحتوى أصلي قد يُوسم بأنه مولَّد بالذكاء الاصطناعي بالكامل.)

اقرأ هذا على أنه بيان عن دقة التفصيل لا عن دقة الإصابة. ففي مستند طويل، كان 100 سيعني أن عدداً كبيراً من التوقعات المنفصلة وقع كلها في الجانب نفسه. وفي مستند من بضع مئات من الكلمات قد يعني توقعاً واحداً، تعرضه الواجهة بعد ذلك كنسبة مئوية. ويُعرض كلاهما بالشكل نفسه، وليسا النوع نفسه من الأدلة؛ والجملة الثانية من ذلك الاقتباس تقول صراحةً إن المحتوى المختلط هو ما يُجرف.

ويوجد تحت هذا حد أدنى. فالعمل المُقدَّم يحتاج إلى 300 كلمة على الأقل من النثر بتنسيق النصوص الطويلة قبل أن يُنشأ أي تقرير للذكاء الاصطناعي. لذا فإن أقصر ملف يمكن أن ينال رقماً هو أيضاً الملف الذي يستند رقمه إلى أقل عدد من الملاحظات المستقلة، والنطاق الذي يقع مباشرة فوق الحد الأدنى هو حيث يتداخل هذان الأمران. مقال تأملي من 900 كلمة، تقرير قصير عن مجموعة تمارين، ملخص مؤتمر مُطوَّل للوصول إلى الطول المطلوب: كلها تقع في المنطقة التي تصفها Turnitin. أما ما يحدث في الطرف الآخر من النطاق، حين تتجاوز أطروحة ما ما يغطيه تقرير واحد، فقد استعرضناه في هل يمكن لـ Turnitin فحص أطروحة كاملة.

100% من ماذا، بالتحديد؟

النسبة المئوية لا تُحسب على مستندك. بل تُحسب على ما تسميه Turnitin النص المؤهل، والتعريف ضيق: "This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures." (هذا النص المؤهل لا يضم سوى جمل النثر، أي أننا نحلل فقط كتل النص المكتوبة بجمل نحوية قياسية، ولا نضم أنواعاً أخرى من الكتابة مثل القوائم أو النقاط (تراكيب قصيرة ليست جملاً) أو غيرها من التراكيب التي ليست جملاً.) والجملة التي تليها هي الجملة التي ينبغي أن تتذكرها: "This percentage is not necessarily the percentage of the entire submission." (هذه النسبة المئوية ليست بالضرورة نسبة العمل المُقدَّم بأكمله.)

بعض الاستبعادات مُعلَنة على حدة. تُسجِّل ملاحظات إصدار Turnitin إصلاح خلل كان يظلل الكتابة بالذكاء الاصطناعي داخل قوائم المراجع، وتقول إن "Bibliographies are now excluded when processing the AI writing report" (أصبحت قوائم المراجع مستبعدة عند معالجة تقرير الكتابة بالذكاء الاصطناعي)، وتقول في موضع آخر إن "We are now able to process long-form prose text in tables." (أصبحنا قادرين الآن على معالجة النص النثري الطويل في الجداول). وينتهي المدخلان بالطريقة نفسها، بتعليمات بعدم افتراض أن التغيير ينطبق على ما قدمته بالفعل: أعد التقديم لإعادة المعالجة. لذا فإن قائمة المراجع خارج الحساب، والفقرات الموجودة داخل جدول داخله، وهذا ليس الحدس الذي يحمله معظم الناس حول أي من الأمرين.

مرِّر ملفاً حقيقياً عبر ذلك. تقرير مخبري من 5,000 كلمة يتضمن جدولاً للمنهجية، وثلاث قوائم نقطية للبروتوكول، وملحقاً، و60 مرجعاً قد يحتوي على 2,000 كلمة مؤهلة. إن 100 في ذلك التقرير بيان عن تلك الـ 2,000 كلمة. وليس بياناً عن الـ 3,000 الأخرى، التي لم تُقيَّم قط ولا يمكن الدفاع عنها أو مهاجمتها بناءً على الرقم.

وهذا أيضاً سبب إمكانية تعايش 100 مع صفحات لا تحمل أي تظليل على الإطلاق. تقول Turnitin إن المستند الذي يحتوي على عدة أنواع مختلفة من الكتابة "would result in a disparity between the percentage and the highlights" (سيؤدي إلى تباين بين النسبة المئوية والتظليلات). وفي أعلى النطاق يبدو هذا التباين تناقضاً، وهو سلوك متوقع.

عدّ الأسطر المظللة ومقارنتها بالنسبة المئوية لن يحل الأمر، لأن كليهما يُحسب على أشياء مختلفة. وكيفية قراءة تقرير الكتابة بالذكاء الاصطناعي من Turnitin تستعرض حالات التقرير الأخرى للسبب نفسه.

حين يكون المستند طويلاً ومع ذلك يعود في الأعلى

إذا كان الملف 8,000 كلمة من النثر المتصل، فإن تفسير المقطع الواحد يزول. كثير من التوقعات المنفصلة وقعت بالفعل في الجانب نفسه، ويصبح السؤال: ما الذي يجعل مستنداً كاملاً يبدو متشابهاً للنموذج من أوله إلى آخره؟ وتنشر Turnitin إجابة جزئية، في صورة الخصائص التي تقول إنها تظهر في حالات الإيجابية الخاطئة لديها:

"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas. If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." (في بعض الأحيان يمكن أن تشمل الإيجابيات الخاطئة (وسم نص كتبه إنسان خطأً بأنه مولَّد بالذكاء الاصطناعي) محتوى لا تنوع بنيوياً كبيراً فيه، أو نصاً يكرر نفسه حرفياً، أو نصاً أُعيدت صياغته دون تطوير أفكار جديدة. وإذا أظهر مؤشرنا قدراً أكبر من الكتابة بالذكاء الاصطناعي في نص كهذا، فننصحك بأن تضع ذلك في الاعتبار عند النظر إلى النسبة المئوية المشار إليها.)

تلك الخصائص الثلاث جميعها خصائص لمستند كامل لا لجملة واحدة. هذه قراءتنا وليست شيئاً تدَّعيه Turnitin، لكنها الجزء الذي يتفق مع شكل السؤال: بحث مكتوب بترتيب أقسام مفروض، في تخصص له طريقة ثابتة في صياغة فقرة المنهجية، يعيد ذكر أهدافه في الملخص ثم في المقدمة ثم في المناقشة، يكون له الطابع نفسه تقريباً في كل مقطع. لا يوجد مقطع يختلف عن جيرانه بما يكفي لخفض القيمة الإجمالية. والتجانس ليس عيباً في الكتابة، وفي عدة أنواع من الكتابة هو المطلوب، وهذا بالضبط سبب صعوبة الاعتراض على النتيجة بالإشارة إلى فقرة بعينها.

الجملة الثانية من ذلك الاقتباس تعليمات من المورِّد إلى من يقرأ النتيجة، وليست دفاعاً تبنيه أنت. وما حرّك القرارات فعلياً موضوع آخر، وقد كتبناه استناداً إلى حالات منشورة في مُوسَّم، وقد كتبته أنت بنفسك. وإذا كان التحرير مناسباً ومسموحاً به، فإن الخصائص الواردة في تلك القائمة هي أيضاً أقرب شيء إلى مواصفات للقيام بذلك يدوياً، وهو النهج المتبع في كيفية جعل نص الذكاء الاصطناعي أقرب إلى كتابة البشر دون أداة.

ما لا يحسمه 100

ثمة أمر يستحق أن تعرفه قبل أن تبني أي حجة على أن الرقم مبالغ فيه: الضبط المنشور يعمل في الاتجاه المعاكس. تقول Turnitin إن "In order to maintain this low rate of 1% for false positives, there is a chance that we might miss some AI written text in a document" (من أجل الحفاظ على هذا المعدل المنخفض البالغ 1% للإيجابيات الخاطئة، ثمة احتمال بأن يفوتنا بعض النص المكتوب بالذكاء الاصطناعي في مستند ما)، وتحدد اتجاه الخطأ: "if we identify that 50% of a document is likely written by an AI tool, it could contain as much as 65% AI writing." (إذا تبين لنا أن 50% من مستند ما مكتوبة على الأرجح بأداة ذكاء اصطناعي، فقد يحتوي على ما يصل إلى 65% من الكتابة بالذكاء الاصطناعي.) ومهما يكن ما يجري أيضاً، فإن فكرة أن الأداة مصممة لتقديم تقارير أكثر من اللازم ليست التصميم الذي يصفه المورِّد.

لا يجعل هذا من 100 نتيجة مؤكدة. تذكر Turnitin في ثلاث صفحات مساعدة منفصلة أن نموذجها قد يخطئ في تحديد النص المكتوب بيد إنسان، أو المولَّد بالذكاء الاصطناعي، أو المعاد صياغته بالذكاء الاصطناعي، وأنه لا ينبغي أن يكون الأساس الوحيد لإجراء ضار بحق طالب. وادعاء الدقة الذي يتبادله الناس يحمل تحفظاً يُسقَط في الطريق، وقد فككناه في ما الذي يعنيه معدل إيجابيات خاطئة بنسبة 1%. ولا يوجد أيضاً أي حد منشور يصبح عنده الرقم سوء سلوك، في أي من الاتجاهين: هل 20% ذكاء اصطناعي مرتفع أكثر من اللازم يغطي سبب كون الرقم 20 في الواجهة قاعدة عرض لا قاعدة عنك.

إذا كنت قد كتبته بنفسك، فإن إعادة كتابته هي الخطوة الأولى الخاطئة. فهي تغيّر موضوع النقاش، وتجيب عن سؤال لم يطرحه أحد.

أين يكون لأداة إعادة الكتابة موضع، وأين يجعلها 100 بلا فائدة

يستحق أن يقال بصراحة، حتى وإن كان ضدنا: عند 100، لا يجد ما تجيده أداة HumanPen عادةً ما يمسك به. ترفع المستند مع تقرير Turnitin أو iThenticate ولا تُعاد كتابة سوى المقاطع التي طابقها التقرير، مع الحفاظ على الباقي كما هو كلمة بكلمة، ولا تُحتسب الفاتورة إلا بالكلمات التي أُعيدت كتابتها فعلياً. وهذا توفير حقيقي عند 30%، حيث لا يُمسك ثلثا الملف ولا يُحتسب لهما شيء. وعند 100% يكون التقرير قد وسَّم كل شيء، لذا فالنطاق هو المستند بأكمله والتكلفة هي معالجة كاملة. وإن كنت تأمل أن يضيّق التقرير نطاق العمل، فإن 100 هو الرقم الوحيد الذي لا يفعل ذلك.

إذا استمر تقرير جديد في توسيم مقاطع، فيمكن إعادة تشغيل المقاطع المستوفية للشروط مجاناً.

لا شيء من ذلك وعد بنتيجة كشف، ولن نقدّم وعداً من هذا النوع. لا أداة تستطيع أن تخبرك بما ستخرجه نسخة مستقبلية من النموذج على مستند لم تره، ومن يعرض نتيجة مضمونة إنما يصف شيئاً لا يملك التحكم فيه. وهناك أيضاً حالات تكون فيها الأداة هي الأداة الخطأ تماماً: إذا كان موقفك أن العمل لك، فالرقم ليس هو الشيء الذي ينبغي إصلاحه.

الأسئلة الشائعة

هل يعني 100% أن كل جملة كتبتها قد وُسِّمت؟ لا. تُحسب النسبة المئوية على النص المؤهل، الذي يستبعد القوائم والنقاط وغيرها من التراكيب التي ليست جملاً، وتقول Turnitin إن الرقم ليس بالضرورة نسبة العمل المُقدَّم بأكمله. ويمكن لملف يحتوي على جداول وقوائم وقسم مراجع كبير أن يظهر 100% في حين أن أجزاء كبيرة منه لم تُقيَّم قط.

مقالي لا يتجاوز 600 كلمة. هل هذا هو التفسير؟ إنه أول ما ينبغي التحقق منه. تصف Turnitin الأمر هكذا: في المستندات التي لا تتجاوز بضع مئات من الكلمات يكون التوقع في معظمه "all or nothing" (إما كل شيء أو لا شيء)، لأنه يعمل على مقطع واحد دون فرصة للتداخل، ولذا يمكن لمزيج من المحتوى المولَّد بالذكاء الاصطناعي والمحتوى الأصلي أن يُوسم بأنه مولَّد بالذكاء الاصطناعي بالكامل.

رأيت الرقم في شاشة Turnitin الخاصة بي. هل هي نتيجة الذكاء الاصطناعي؟ على الأرجح لا. تقول Turnitin إن المدرسين والإداريين وحدهم يمكنهم رؤية مؤشر الذكاء الاصطناعي وأنه غير مرئي للطلاب، مع أن المدرسين يمكنهم تنزيل تقرير الذكاء الاصطناعي بصيغة PDF ومشاركته. والنسبة المئوية التي وصلت إليها بنفسك هي نتيجة التشابه، ولها مساراتها المألوفة الخاصة للوصول إلى 100.

هل يمكن لأي أداة أن تضمن أن التقرير التالي سيكون أقل؟ لا، واعتبر هذا الادعاء علامة تحذير. تتغير إصدارات أدوات الكشف، ولا أحد خارج المورِّد يمكنه الالتزام بمخرجات نسخة من النموذج لم تعمل بعد. وما يمكن لخدمة تنقيح أن تحدده هو النطاق والتكلفة، لا النتيجة.

تابع القراءة