ما هو "النص المؤهل" في كشف الذكاء الاصطناعي في Turnitin؟ شرح مفصل
عندما يبلّغ Turnitin عن نسبة كتابة بالذكاء الاصطناعي، فإن هذا الرقم لا يغطي ما قدّمته بالكامل. فالنموذج لا يحلل سوى "النص المؤهل"، أي الجمل النثرية المصاغة صياغة نحوية قياسية. أما القوائم والنقاط والتراكيب التي ليست جملاً فمستبعدة. ولهذا لا يتطابق الرقم مع المقاطع المميّزة في بعض الأحيان. وإليك ما تقوله الوثائق عمّا يُحتسب وما لا يُحتسب، ولماذا يهمّك ذلك.
فريق HumanPen
· مدة القراءة: 5 د
ما معنى "النص المؤهل"
لا يحلل نموذج كشف الذكاء الاصطناعي في Turnitin كل كلمة في المستند، بل يعمل على مجموعة محددة من النص تُسمى "النص المؤهل"، وتُعرّفها الوثائق تعريفاً واضحاً.
"This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures." (لا يشمل هذا النص المؤهل سوى الجمل النثرية، أي أننا لا نحلل إلا كتل النص المكتوبة بجمل نحوية قياسية والتي لا تتضمن أنواعاً أخرى من الكتابة كالقوائم والنقاط (تراكيب قصيرة ليست جملاً) أو غيرها من التراكيب التي ليست جملاً.)
إذن فالنموذج يبحث عن النثر: كتل نصية مؤلّفة من جمل نحوية قياسية. وكل ما لا يبلغ هذا المستوى يخرج من التحليل. فالنقاط والقوائم المرقّمة وعناوين الجداول التي ليست جملاً تامّة وغيرها من التراكيب غير النثرية مستبعدة من نطاق كشف الذكاء الاصطناعي.
وتقرّ وثائق النموذج نفسها بهذا القصور: "The model does not reliably detect AI-generated text in the form of non-prose, or code, nor does it detect short-form/unconventional writing such as bullet points (short non-sentence structures)." (لا يكشف النموذج بشكل موثوق النص الناتج عن الذكاء الاصطناعي حين يكون في صورة غير نثرية أو في صورة شيفرة، كما لا يكشف الكتابة القصيرة أو غير المعتادة مثل النقاط (تراكيب قصيرة ليست جملاً).)
إذا كان المستند غنياً بالقوائم فقيراً بالنثر، كانت المادة المتاحة لنموذج كشف الذكاء الاصطناعي أقل، ولم تعكس النتيجة المعروضة سوى الأجزاء النثرية. وهناك حد أدنى أيضاً، إذ تشترط متطلبات الملفات ما لا يقل عن 300 كلمة من النثر قبل أن يُنشأ أي تقرير أصلاً، وهو ما يتناوله هل يمكن لـ Turnitin فحص رسالة كاملة.
التباين بين النسبة والمقاطع المميّزة
من أكثر جوانب تقرير كشف الذكاء الاصطناعي في Turnitin إرباكاً أن النسبة والمقاطع المميّزة قد يبدو أنهما ترويان قصتين مختلفتين. وتوضّح الوثائق السبب.
"This means that a document containing several different writing types would result in a disparity between the percentage and the highlights." (هذا يعني أن مستنداً يتضمن عدة أنواع مختلفة من الكتابة سيؤدي إلى تباين بين النسبة والمقاطع المميّزة.)
"This percentage is not necessarily the percentage of the entire submission." (هذه النسبة ليست بالضرورة نسبة الملف المقدَّم بأكمله.)
إذا كان مستندك يتكوّن من 50% نثراً و50% نقاطاً، وصنّف نموذج كشف الذكاء الاصطناعي 40% من النثر على أنه ناتج عن الذكاء الاصطناعي، فقد يُظهر التقرير نسبة 40%. لكن هذه الأربعين في المئة تتعلق بالنثر المؤهل لا بالمستند كلّه. ومن يقرأ التقرير دون أن يفهم ذلك قد يظن أن ما قدّمته كان 40% منه ناتجاً عن الذكاء الاصطناعي، في حين أن النسبة الفعلية في المستند بأكمله أقل من ذلك.
هذا التباين ليس خللاً، بل هو ناتج عن نطاق عمل النموذج. وفهمه يساعدك على قراءة التقرير قراءة دقيقة، وكيفية قراءة تقرير الكتابة بالذكاء الاصطناعي من Turnitin يشرح بقية الصفحة.
كيف يعالج النموذج النص
ولكي تفهم سبب أهمية النص المؤهل، من المفيد أن تعرف ما يفعله النموذج به. وتصف الوثائق هذه الآلية كما يلي:
"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated." (عند إرسال ورقة بحثية إلى Turnitin، تُستخرج الجمل من الملف المقدَّم وتُقسَّم إلى مقاطع متداخلة لتحليل التنبؤ. ويصنّف نموذج كشف الذكاء الاصطناعي كل مقطع ويعطيه قيمة بين 0 و1 تدل على احتمال أن يكون النص من كتابة بشر أو ناتجاً عن الذكاء الاصطناعي.)
إذن فالنموذج يستخرج الجمل ويقسّمها إلى مقاطع متداخلة ويصنّف كل مقطع، ويحصل كل مقطع على درجة احتمال بين 0 و1. ولا يمرّ بهذه العملية سوى الجمل النثرية المؤهلة. أما المحتوى غير النثري فلا يُقسَّم ولا يُقيَّم قط، لأن النموذج لا يعدّه نصاً قابلاً للتحليل.
ولهذا فإن نطاق "النص المؤهل" هو ما يحدّد مباشرة ما تمثّله النسبة. فالنتيجة حصيلة مجموع درجات الاحتمال على مستوى المقاطع، ولا يدخل في هذا المجموع سوى الجمل النثرية المؤهلة.
الجداول داخلة، وقوائم المراجع خارجة
هناك نوعان محدّدان من المحتوى، لكلّ منهما قواعده الخاصة.
الجداول: "We are now able to process long-form prose text in tables." (أصبحنا قادرين الآن على معالجة النص النثري الطويل داخل الجداول.) وبذلك فإن النثر الموجود في خلايا الجدول، إذا كان مكتوباً بجمل نحوية قياسية، أصبح جزءاً من النص المؤهل. أعد إرسال الملفات المقدَّمة سابقاً والتي تتضمن جداول لتُعالَج من جديد. وإذا كان لديك مستند يتضمن نثراً ذا معنى في جداول وقُدِّم قبل هذا التحديث، فقد لا تعكس نتيجة الذكاء الاصطناعي محتوى الجدول ما لم تُعد إرساله.
قوائم المراجع: "We have fixed a bug that was occasionally highlighting AI writing within references listed in a bibliography. Bibliographies are now excluded when processing the AI writing report." (أصلحنا خللاً كان يتسبب أحياناً في تمييز كتابة بالذكاء الاصطناعي داخل المراجع المدرجة في قائمة المراجع. وأصبحت قوائم المراجع مستبعدة عند معالجة تقرير الكتابة بالذكاء الاصطناعي.) أعد إرسال الملفات المقدَّمة سابقاً والتي تتضمن أقسام مراجع مميّزة لتُعالَج من جديد. وإذا كان تقريرك السابق يُظهر نصاً مميّزاً داخل قائمة المراجع، فذلك كان خللاً، وستُستبعد تلك الأقسام من التحليل عند إعادة الإرسال. ويتناول لماذا يميّز Turnitin مراجعي واقتباساتي مدى اتساع الاستبعادات على جانب التشابه.
هاتان القاعدتان تعنيان أن تعريف النص المؤهل ليس ثابتاً، فقد جرى تعديله ليشمل نثر الجداول ويستبعد قوائم المراجع، وهذا أحد أسباب أن نتيجتك في كشف الذكاء الاصطناعي في Turnitin قد تتغير عند إعادة الإرسال دون أن يتغير النص.
الإيجابيات الخاطئة في النثر المؤهل
حتى داخل النثر المؤهل، تكون بعض أنماط الكتابة أكثر عُرضة للإيجابيات الخاطئة. وتحدّد الوثائق أنماطاً بعينها.
"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas." (قد تشمل الإيجابيات الخاطئة (أي تمييز نص كتبه بشر على أنه ناتج عن الذكاء الاصطناعي عن طريق الخطأ) محتوى لا تنوّع بنيوياً كبيراً فيه، أو نصاً يكرّر نفسه حرفياً، أو نصاً أُعيدت صياغته دون تطوير أفكار جديدة.)
"If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." (إذا أظهر مؤشرنا قدراً أكبر من الكتابة بالذكاء الاصطناعي في مثل هذا النص، فننصحك بأن تأخذ ذلك في الاعتبار عند النظر إلى النسبة الموضّحة.)
لذلك، إذا كان نثرك رتيباً من حيث البنية، أو كان يكرّر العبارات نفسها، أو كان إعادة صياغة دون إضافة أفكار جديدة، فقد يميّزه النموذج على أنه ناتج عن الذكاء الاصطناعي حتى وإن كنت أنت من كتبه. وهذا ليس فشلاً في مرشّح النص المؤهل، بل هو ما تقيسه كواشف الذكاء الاصطناعي يفعل تماماً ما دُرِّب على فعله. إنها مسألة منفصلة داخل النثر الذي يدخل التحليل بالفعل.
ما يعنيه هذا لك
إذا كنت تحاول أن تفهم سبب ظهور تقرير الذكاء الاصطناعي من Turnitin على هذا النحو، فإليك الخلاصة:
- الجمل النثرية وحدها مؤهلة. القوائم والنقاط والتراكيب التي ليست جملاً مستبعدة من التحليل. ويركّز النموذج على الجمل النحوية القياسية.
- النسبة تغطي النثر المؤهل فقط. وليست نسبة الملف المقدَّم بأكمله. وهذا ما يخلق التباين بين الرقم والمقاطع المميّزة.
- نثر الجداول يُعالَج الآن. النص النثري الطويل في الجداول يُحتسَب نصاً مؤهلاً. أعد إرسال الملفات المقدَّمة سابقاً والتي تتضمن جداول لتُعالَج من جديد.
- قوائم المراجع مستبعدة. تم إصلاح الخلل الذي كان يميّز المراجع. أعد إرسال الملفات المقدَّمة سابقاً والتي تتضمن أقسام مراجع مميّزة لتُعالَج من جديد.
- احترس من الإيجابيات الخاطئة. النثر المسطّح بنيوياً أو المتكرّر أو المُعاد صياغته أكثر عُرضة للتمييز. ضع ذلك في اعتبارك عند قراءة النسبة.
يمكن إعادة تشغيل المقاطع المستوفية للشروط مجاناً.
تابع القراءة