الرئيسية / أبحاث و دراسات / من جامعة صنعاء.. نموذج لكشف الهجمات الإلكترونية ينتظر اختبار الواقع
submission_2270_2270_coverImage_ar_IQ

من جامعة صنعاء.. نموذج لكشف الهجمات الإلكترونية ينتظر اختبار الواقع

دراسة يمنية تعلن دقة تصنيف مرتفعة على بيانات مرجعية، بينما تبقى فاعلية النموذج داخل الشبكات الحقيقية وتفاصيل تقييمه بحاجة إلى اختبار وتوضيح.

عبدالرحمن أبوطالب

اختبر فريق بحثي من جامعة صنعاء نموذجًا للتعلم الآلي يهدف إلى كشف الهجمات الإلكترونية عبر تبسيط بيانات الاتصالات وتحليلها. وأعلنت الدراسة دقة تصنيف بلغت 99.27% ضمن تجربتها، لكن هذه النتيجة لا تعني اكتشاف النسبة نفسها من الهجمات، ولا تثبت وحدها قدرة النموذج على العمل بالكفاءة ذاتها داخل شبكة حقيقية.

نُشرت الدراسة في مجلة جامعة صنعاء للعلوم التطبيقية والتكنولوجيا في 28 فبراير 2026، وأعدّها ثلاثة باحثين من كلية الحاسوب وتكنولوجيا المعلومات بالجامعة هم إسراء وازكول، وعبدالرحمن الصبري، وسعاد عثمان. وتسعى إلى تقليل حجم المعلومات التي يعالجها النموذج مع الحفاظ على قدرته على التصنيف، بما قد يخفف العبء الحسابي لكشف الهجمات.

تقدم التجربة مساهمة بحثية من مؤسسة يمنية في مجال أمن الشبكات. أما بياناتها، فمأخوذة من مجموعة مرجعية لا تمثل هجمات رُصدت في اليمن. وبين النتيجة المعلنة وإمكان الاستخدام الفعلي، تبرز أسئلة عن معنى الدقة، وطريقة الاختبار، ومدى تمثيل البيانات لحركة الشبكات اليوم.

الباحثة إسراء وازكول Israa Wazkool
الباحثة إسراء وازكول Israa Wazkool

بيانات أقل للتحليل

استخدم الفريق أولًا «تحليل المكونات الرئيسية»، وهي طريقة تلخّص متغيرات كثيرة في عدد أصغر من المكونات الرقمية. ويجمع كل مكوّن معلومات من المتغيرات الأصلية؛ فلا تقتصر العملية على اختيار بعضها وحذف البقية.

تقول الدراسة إن 26 مكوّنًا احتفظت بأكثر من 95% من التباين في البيانات، أي بمعظم الاختلافات التي تقيسها هذه الطريقة داخلها. وهذه النسبة لا تعني الاحتفاظ بنسبة مماثلة من القدرة على اكتشاف الهجمات.

بعد ذلك، مرّر الباحثون البيانات إلى «آلة المتجهات الداعمة»، وهي خوارزمية تتعلم من أمثلة مصنفة مسبقًا كيف تميّز بين الفئات. ويصف النص مهمتها بأنها الفصل بين الاتصال الطبيعي والهجوم.

تذكر الورقة تخصيص 70% من البيانات للتدريب و30% للاختبار، وتشغيل التجربة على حاسوب بمعالج Core i7 وذاكرة سعتها 16 غيغابايت. لكنها لا تحدد بوضوح العدد النهائي للسجلات بعد تنظيف البيانات، أو توزيعها بين الفئات.

الرقم المرتفع لا يروي النتيجة كاملة

تعني الدقة الإجمالية نسبة التصنيفات الصحيحة من مجموع الحالات، بما فيها الاتصالات الطبيعية والهجمات. ولذلك تختلف عن نسبة الهجمات التي استطاع النموذج اكتشافها من جميع الهجمات الموجودة.

تعرض الدراسة أيضًا «الاستدعاء» بقيمة 94.4%، وهو مؤشر يقيس مقدار ما اكتشفه النموذج من الحالات الإيجابية الفعلية، ومؤشرًا لصحة التنبؤات الإيجابية بقيمة 94.31%. لكن تفسيرهما يتطلب معرفة الفئة المقصودة وكيف جُمعت النتائج.

ويظهر تعارض يحتاج إلى إيضاح، فالنص يصف مهمة تصنيف ثنائي، بينما يعرض رسم النتائج 23 فئة مرقمة. كذلك تحتاج طريقة حساب «F1»، الذي يجمع الإحكام والاستدعاء، إلى بيان؛ إذ لا تنتج قيمته المنشورة عند حسابه مباشرة من المؤشرين المعلنين بالطريقة المعتادة لفئة واحدة. وقد يفسر استخدام متوسطات عبر فئات متعددة هذا الفرق، لكن الورقة لا توضّح ذلك.

ولم يتسنَّ ليمن ساينس الوصول إلى الباحثين للحصول على إيضاحات بشأن هذه النقاط؛ لذا تبقى قراءتها محصورة فيما يتيحه النص المنشور، ولا تمثل حكمًا نهائيًا على سلامة التنفيذ أو الأداء الفعلي للنموذج.

ماذا تختبر البيانات المرجعية؟

استندت التجربة إلى مجموعة «NSL-KDD»، التي تؤرخها جامعة نيو برونزويك بعام 2009. وقد طُوّرت لمعالجة بعض مشكلات مجموعة أقدم، منها تكرار السجلات. لكن وصفها الرسمي يقر بأنها ما تزال تعاني حدودًا، وقد لا تمثل الشبكات الحقيقية تمثيلًا كاملًا، مع بقائها مفيدة للمقارنة البحثية.

وتوفر المجموعة ملفات منفصلة للتدريب والاختبار، بينما تذكر الدراسة تقسيمًا بنسبة 70 إلى 30. وهذا يجعل معرفة الملفات المستخدمة وكيفية تقسيمها ضرورية لفهم التجربة ومقارنتها بأبحاث أخرى.

كما أن الجمع بين تحليل المكونات الرئيسية وآلة المتجهات الداعمة له سوابق؛ فقد تناولته دراسة منشورة عام 2016 يستشهد بها الفريق. لذلك تتعلق الإضافة المحتملة بتفاصيل إعداد النموذج وتقييمه، ولا يمكن عدّ الجمع بين الطريقتين ابتكارًا جديدًا بذاته.

ما الذي يفصل التجربة عن التطبيق؟

يضع مخطط العمل معالجة البيانات واستخراج المكونات قبل تقسيمها إلى تدريب واختبار. وإذا تعلّمت هذه التحويلات من البيانات كاملة، فقد تتسرب معلومات من جزء الاختبار إلى إعداد النموذج، بما يجعل التقييم متفائلًا.

توصي وثائق المكتبة البرمجية المستخدمة بتعلّم هذه التحويلات من بيانات التدريب فقط. ومع ذلك، لا يكفي المخطط لإثبات حدوث تسرّب؛ إذ يتطلب الحسم مراجعة الشيفرة وتفاصيل التنفيذ.

وتقول الورقة إن تقليل أبعاد البيانات يحسّن الكفاءة ويسرّع الكشف، لكنها لا تعرض قياسات زمنية أو مقارنة مباشرة للنموذج مع هذه الخطوة وبدونها تثبت مقدار التحسن.

ويقرّ الباحثون بأن حركة الشبكات الحقيقية أكثر تغيرًا من البيانات المرجعية، وبالحاجة إلى إعادة تدريب النموذج مع ظهور أنواع جديدة من الهجمات. ويضعون استخدام بيانات سحابية حقيقية ضمن العمل المستقبلي.

هناك ستتضح فائدته العملية بدرجة أكبر: كم هجومًا يكتشف؟ وكم إنذارًا خاطئًا يصدر؟ وما الوقت والموارد اللذان يحتاج إليهما؟ الإجابة عن هذه الأسئلة، إلى جانب توضيح تفاصيل التقييم، هي ما سيحدد المسافة بين نتيجة الاختبار وأداة يمكن الاعتماد عليها في أمن الشبكات.

شاهد أيضاً

مصدر الصورة الشبكات الاجتماعية

من النزوح إلى الجوع: ماذا يحدث بعد الفرار من الحرب في اليمن؟

مع تجدد المواجهات في اليمن ونزوح عشرات الآلاف، تقدم الدراسات العلمية الحديثة والتقارير الأممية أدلة على ارتباط …