**ذكاء الفضاء القمري (Moonshot AI)** بدأ تحقيقًا بشأن فئتين من نماذج Kimi الخاصة به. وذلك لأن الباحثين في شركة الأمن السيبراني الناشئة Mindgard تمكنوا من استخراج إرشادات محددة حول مواضيع عالية الخطورة مثل تصنيع الأسلحة البيولوجية وطرق الاغتيال عبر تقنيات «الاختراق داخل القفص» (jailbreak) التي تتجاوز إجراءات الأمان.

الملخص

  • ادّعى فريق الحماية (Mindgard) أن حارس العقل يمكنه اختراق إجراءات الأمان عبر تقنيات «الاختراق داخل القفص» (jailbreak) باستخدام نموذج Kimi K2.6 ونموذج K3 Swarm.

  • ومع ذلك، لم يتم التحقق مما إذا كانت المعلومات الضارة التي قدمها النموذج تعمل فعلاً.

  • قال Moonshot إنه يقوم حاليًا بمراجعة هذه النتائج، ويدخل في مشاورات مع MindGuard.

نتيجة اختراق Kimi

وفقًا لتقرير BBC، أجرت MindGuard في يوليو تجارب اختراق باستخدام مطالبات مُهيكلة لاستهداف Kimi K2.6 وK3 Swarm. تهدف هذه التقنية إلى دفع النموذج لتجاهل قواعد السلامة المدمجة، واختبار ما إذا كان سيُخرج معلومات خطرة فعلًا. وذكرت MindGuard أن هذا النوع من المحادثات كان ينبغي أن يُحجب أساسًا بواسطة وسائل أمان لدى المطورين.

قال المؤسس **بيتر جارغان(Peter Garraghan)** في مقابلة مع BBC: “عندما ينجح الاختراق، تمكن النموذج من مناقشة ما يقارب كل المواضيع، واستمر في تقديم اقتراحات أكثر ضررًا دون الحاجة إلى طلبات إضافية”.

رحب Moonshot في بيان أرسله إلى BBC بتقييم طرف ثالث باعتباره “محورًا أساسيًا لبناء ذكاء اصطناعي أكثر أمانًا وموثوقية”، وأوضح أنه يناقش النتائج المتعلقة حاليًا بـ MindGuard. ووفقًا لـ MindGuard، فقد أبلغت الشركة Moonshot لأول مرة بالمشكلة في 27 يوليو، ثم تواصلت مرة أخرى بعد حوالي أسبوع، ونشرت تقريرًا تفصيليًا في 12 سبتمبر.

اقرأ أيضًا: شركة Ripple تتعاون مع هيئة الإيداع المركزي في البرازيل (CSD BR) لتسجيل ملكية الأموال على سلسلة بلوكتشين عامة

مخاطر السلامة التي أثارتها MindGuard

لم تُثبت MindGuard أن استجابات Kimi ستنطبق كما هي في سيناريوهات العالم الحقيقي. ومع ذلك، تزعم أن “مجرد حقيقة إمكانية إجراء ذلك النوع من المحادثات تُظهر أن آليات السلامة المصممة لفلترة الطلبات الخطرة فشلت هيكليًا”.

حذرت الشركة من أن Kimi K2.6، الذي تم اختراقه مرة أخرى، لديه إمكانية لتشغيل الأكواد على موارده الحاسوبية الذاتية والاتصال بالإنترنت. ووفقًا لذلك، فإن هذا النموذج يمكن إساءة استخدامه كمنصة لإطلاق هجمات سيبرانية.

أوضح Moonshot أنه في التقييمات الداخلية تم التأكد من “ارتفاع معدل الرفض” تجاه هذا النوع من الطلبات. لكن تشير هذه الحالة إلى وجود فجوة كبيرة بين الفحوصات المسبقة المعتادة، وبين “الاختبار العدائي (adversarial testing)” الذي أجراه باحثون خارجيون يفترضون سيناريوهات خبيثة.

قال ألان وودوارد (Alan Woodward)، أستاذ في جامعة ساري في بريطانيا، لهيئة BBC: “تزيد نماذج المصادر المفتوحة والأوزان المفتوحة من مخاطر سوء الاستخدام إذا وقعت في يد مستخدمين ذوي نوايا خبيثة، لكن يمكن أيضًا توظيف نفس الأدوات بشكل عكسي للدفاع السيبراني”.

وأضاف أنه لا يمكن للجهات التنظيمية مواكبة سرعة تطوير الذكاء الاصطناعي، مؤكدًا أنه بدلًا من تصميم الأنظمة، يجب تعزيز إنفاذ العقوبات تجاه الجهات الفاعلة التي تُسيء استخدام الأنظمة فعليًا.

OpenAI وثغرات المخاطر المرتبطة بالوكلاء بالذكاء الاصطناعي بنمط التوزيع المفتوح (Open-weight)

لا يقتصر هذا الجدل على حالة “مشهد الإطلاق” (Moonshot) فقط. سلسلة Kimi هي نماذج “مفتوحة الأوزان (open-weight)”، حيث يمكن للمستخدمين تنزيل الأوزان وتشغيل النموذج على بنيتهم التحتية. وعلى الرغم من أن هذا التصميم يتمتع بمزايا من ناحية الشفافية وإمكانية الاستفادة البحثية، إلا أنه يزيد المخاطر أيضًا عند استخدامه في بيئات يصعب فيها ضبط الأمن والتحكم.

وفقًا لما ورد، فإن حوادث أمن الذكاء الاصطناعي الأخيرة تُبلَّغ عنها بشكل متكرر ليس فقط في أنظمة الوكلاء الخاصة بـ OpenAI وMeta، بل أيضًا في أنظمة من نمط الوكلاء لدى **Anthropic**. ومع الجمع بين نماذج قوية وأدوات خارجية واتصال بالإنترنت وصلاحيات تنفيذ متعددة المراحل، تتزايد الحاجة إلى تقييم ما يمكن أن يفعله النموذج فعليًا في بيئات حقيقية، وليس فقط الاكتفاء بالاختبارات التي تراقب إن كان سيجيب بـ“رفض” أم لا.

القراءة التالية: العملات البديلة تمثل 41% من عقود المشتقات المفتوحة، بينما حجم التداول الفوري يبلغ 4 أضعاف بيتكوين