كشف فريق Google AI Red Team عن 15 هجوماً ناجحاً لتسميم نماذج LLM في عام 2026. بحسب تقرير نشرته The Hacker News في 9 سبتمبر 2026، يستخدم المهاجمون تقنيات متقدمة لحقن بيانات خبيثة في مجموعات التدريب، مما يؤدي إلى توليد إجابات ضارة أو غير دقيقة.
كيف تعمل هجمات تسميم النماذج؟
تتبع هجمات تسميم النماذج عدة مراحل:
- الاختراق الأولي لنظام التدريب أو قاعدة البيانات.
- حقن بيانات خبيثة مصممة بشكل استراتيجي.
- إعادة تدريب النموذج باستخدام البيانات المسمومة.
- توليد إجابات ضارة أو غير دقيقة.
- استغلال النموذج المسموم لهجمات لاحقة.
تقنيات الحقن
يستخدم المهاجمون عدة تقنيات لحقن البيانات:
التقنية | الوصف | التأثير |
|---|---|---|
Data Backdoor | إدراج أمثلة خبيثة في مجموعة التدريب | توليد إجابات ضارة عند استعلام معين |
Model Evasion | تعديل البيانات لتجنب اكتشافها | النموذج لا يكتشف البيانات الخبيثة |
Targeted Poisoning | تسميم بيانات محددة لمجال معين | فشل النموذج في مجال معين |
Clean-Label | تسميم البيانات مع الحفاظ على التسميات الصحيحة | صعب الكشف عن التسميم |
الاستهداف
تركز الهجمات على:
- نماذج LLM المستخدمة في أنظمة الدعم العملاء.
- نماذج التحليل المالي.
- نماذج التشخيص الطبي.
- نماذج الأمن السيبراني.
أمثلة على الهجمات
من بين الهجمات ال 15 التي تم اكتشافها:
الهجوم 1: تسميم نموذج دعم العملاء
في هجوم على شركة تكنولوجيا كبيرة، تم تسميم نموذج LLM المستخدم في نظام الدعم العملاء:
- تم حقن 5,000 مثال خبيث في مجموعة التدريب.
- النموذج بدأ بتوليد إجابات تحتوي على روابط ضارة.
- تأثر أكثر من 10,000 عميل.
الهجوم 2: تسميم نموذج التحليل المالي
في هجوم آخر، تم تسميم نموذج يستخدم في التحليل المالي:
- تم حقن بيانات مالية خبيثة.
- النموذج بدأ بتوليد تنبؤات غير دقيقة.
- تسبب في خسائر مالية تقدر بمئات الآلاف.
مؤشرات الاختراق (IOCs)
| ipv4 | 142[.]250[.]186[[.]]45 | خادم حقن البيانات |
| domain | ai-training[[.]]data | نطاق خبيث |
| sha256 | c3d4e5f6a178901234567890abcdef1234567890abcdef1234567890abc | تجزئة ملف البيانات الخبيثة |
| md5 | 098f6bcd4621d373cade4e832627b4f6 | تجزئة ملف التسميم |
الروابط والعناوين معطَّلة (defanged) للحماية
التدابير المضادة من Google
توصي Google باتخاذ التدابير التالية:
- مراقبة مجموعات التدريب بحثاً عن أنشطة مشبوهة.
- تطبيق تقنيات الكشف عن البيانات الخبيثة.
- استخدام نماذج متعددة للتحقق من النتائج.
- تحديث النماذج بانتظام.
- تطبيق مبدأ أقل امتياز.
التأثير
يمكن لهجمات تسميم النماذج أن تكون لها تأثيرات واسعة:
- فقدان الثقة في نماذج الذكاء الاصطناعي.
- خسائر مالية.
- تسريب بيانات حساسة.
- فشل الأنظمة.
الخاتمة
تمثل هجمات تسميم نماذج الذكاء الاصطناعي تهديداً جديداً ومتطوراً. يجب على المؤسسات اتخاذ جميع التدابير اللازمة لحماية نماذجها من هذه الهجمات.
«هجمات تسميم النماذج هي التحدي الكبير التالي في مجال الأمن السيبراني. يجب علينا تطوير تدابير دفاعية جديدة لحماية نماذجنا.» — Google AI Red Team





