اكتشاف التصيّد المتطوّر: من سراب النتائج المثالية إلى معيار قياس نزيه
باختصار: على البيانات العامة أظهر كاشف التصيّد لدينا درجة F1 قدرها 0.99. كشف تدقيق التسرّب أن رُبع مجموعة الاختبار كان في الحقيقة محفوظًا أثناء التدريب, فكانت النتيجة سرابًا. وعند التقييم على معيار من الحالات الصعبة المحفوظة خارج التدريب (احتيال المدير التنفيذي، المحافظ الإلكترونية، التصيّد عبر رمز الاستجابة السريعة، بالفرنسية والإنجليزية) هبط النموذج الأساسي إلى مستوى الصدفة وحجب 37٪ من الرسائل المشروعة. وبإعادة بناء البيانات, التنوّع والحالات المشروعة الصعبة بدل الكمّ, يبلغ الأداء على هذا المعيار الداخلي مساحة تحت المنحنى تقارب 0.98. نعرض هذا الرقم على حقيقته: معيار داخلي مضبوط، وليس أداءً إنتاجيًا في الظروف الواقعية.
سراب النتائج المثالية
مجموعات بيانات التصيّد العامة قديمة، وغالبيتها بالإنجليزية، ومليئة برسائل شبه متطابقة: القالب نفسه يُعاد إرساله مئات المرات. والتقسيم العشوائي يوزّع هذه التوائم المتقاربة على الجانبين, التدريب والاختبار, فيتعرّف النموذج وقت الاختبار على ما حفظه أثناء التدريب. ودرجة F1 الناتجة، القريبة من الواحد، لا تقيس القدرة على التعميم إلى تصيّد غير مسبوق.
لذلك دقّقنا التسرّب قبل أي شيء آخر. النتيجة: 24٪ من مجموعة اختبارنا لها توأم متقارب في التدريب, تصل إلى 79٪ في بعض المصادر. لم تكن الـ0.99 أداءً، بل حفظًا. إنه القلق المنهجي نفسه كما في كشف الشبكة: الرقم الجميل أكثر من اللازم يخفي دائمًا تقريبًا بروتوكولًا متساهلًا أكثر من اللازم.
قاضٍ نزيه: معيار الحالات الصعبة
لقياس ما يهمّ فعلًا، أنشأنا معيارًا من الحالات الصعبة، مكتوبة يدويًا ومحفوظة بصرامة خارج التدريب: احتيال المدير التنفيذي دون رابط أو مرفق، والاحتيال بتحويل المدفوعات، والتصيّد عبر المحافظ الإلكترونية (Orange Money وWave)، والتصيّد برمز الاستجابة السريعة, بالفرنسية والإنجليزية, إلى جانب رسائل مشروعة مربكة عمدًا (طلبات دفع داخلية حقيقية، إشعارات أمنية، كشوف حساب).
كان الحكم قاسيًا ونافعًا. على هذه الحالات الواقعية، بقي النموذج الأساسي عند مستوى الصدفة (AUC ≈ 0.67) وحجب أكثر من رسالة مشروعة من كل ثلاث. تفوّق الكشف على تصيّد الأمس، لكنه ظلّ أعمى أمام التصيّد المتطوّر, وهو تحديدًا ما تنتجه أدوات الذكاء الاصطناعي اليوم.
بيانات سيادية، لا ملايين النسخ
الإغراء هو «توليد ملايين الأمثلة». رفضناه: مليون نسخة تعيد إنتاج السراب على نطاق أوسع. الرافعة الحقيقية هي التنوّع. بنينا مولّدًا تركيبيًا، سياديًا ويعمل دون اتصال، يجمّع كل رسالة من صيغ متنوّعة وسياقات محلية (المحافظ الإلكترونية، المصارف، الإدارة الضريبية) وعناوين واقعية, نصفها تصيّد ونصفها رسائل مشروعة صعبة، منزوعة التكرار، ومُرشّحة كي لا تتقاطع أبدًا مع معيار التقييم. الحالات المشروعة الصعبة هي التي تخفض الإيجابيات الكاذبة.
| المقياس (معيار داخلي) | الأساس | التكرار 3 | التكرار 4 |
|---|---|---|---|
| AUC, حالات صعبة | 0.67 | 0.98 | 0.98 |
| الاستدعاء, تصيّد مكتشَف | 0.61 | 0.87 | 0.91 |
| إيجابيات كاذبة, مشروع محجوب | 37٪ | 5٪ | 10٪ |
| الاستدعاء, الإنجليزية | n/a | 0.63 | 0.88 |
ما تقوله هذه الأرقام, وما لا تقوله
نرفض تحويل هذا المعيار إلى حجّة تسويقية. يعتمد التدريب على بيانات اصطناعية والتقييم على مجموعة كتبناها بأنفسنا: لذا فالرقم على الأرجح متفائل. ونسبة إيجابيات كاذبة بـ10٪ تبقى مرتفعة جدًا لحجب بريد الأعمال تلقائيًا؛ في الإنتاج يجب أن يُنبّه هذا المؤشر أولًا، لا أن يحذف وحده. الدليل الوحيد الذي يهمّ سيأتي من البريد الحقيقي.
التالي: البيانات الحقيقية
أتاحت لنا البيانات الاصطناعية الانطلاق والقياس بنزاهة, ولها سقف. الخطوة التالية تمرّ عبر البيانات الحقيقية، بموافقة ومجهّلة عند المصدر، وعبر حلقة توسيم يصحّح فيها المحلّل الأحكام. مئتا رسالة حقيقية موسومة أثمن من مئتي ألف رسالة اصطناعية إضافية. هكذا يصبح النموذج الأولي الجيّد منتَجًا جديرًا بالثقة.