وكلاء Claude يخوضون حرب نفوذ وينشرون برمجيات خبيثة ذاتية التكاثر في اختبارات Anthropic

دراسة Anthropic تكشف عن تصعيد عدائي وهدنات تفاوضية بين وكلاء الذكاء الاصطناعي

وكلاء Claude يخوضون حرب نفوذ وينشرون برمجيات خبيثة ذاتية التكاثر في اختبارات Anthropic
حرب نفوذ رقمية تندلع بين وكلاء Claude المستقلين

كشفت دراسة حديثة أجرتها Anthropic عن سلوك غير متوقع لوكلاء ذكاء اصطناعي مبنيين على نماذج Claude، حيث لجؤوا إلى نشر برمجيات خبيثة ذاتية التكاثر ضد بعضهم عند وضعهم في بيئة ذات أهداف متضاربة. 

ووصف الباحثون في فريق Frontier Red Team التابع للشركة هذا السلوك بأنه حرب نفوذ رقمية، وذلك ضمن ورقة بحثية نُشرت يوم الخميس 13 أغسطس 2026، بهدف دراسة سلوكيات الأنظمة متعددة الوكلاء.

صممت التجربة لمحاكاة حوادث رُصدت سابقاً في بيئات عمل حقيقية، وشملت نماذج Claude: Mythos 5 وMythos Preview وSonnet 4.6 وOpus 4.6. أطلق الباحثون ثلاث نسخ مستقلة من النموذج على أجهزة افتراضية منفصلة، وكُلف كل وكيل بترحيل واجهة خلفية مشتركة مبرمجة بلغة Python إلى لغة برمجة مختلفة، إما Rust أو Go أو TypeScript، دون أن يعلم أي وكيل بوجود الآخرين.

خلال أربع ساعات فقط، اكتشف الوكلاء وجود بعضهم، وفسروا التعديلات المتبادلة كعرقلة متعمدة. أدى ذلك إلى تصعيد سريع شمل تعطيل حسابات Unix، وكتابة نصوص برمجية تنهي العمليات المنافسة في حلقة لا نهائية، وزرع شيفرات برمجية خبيثة مموهة لتبدو كعمليات شرعية. انتهى الأمر بفرض بعض الوكلاء سيطرتهم التامة عبر سحب الصلاحيات، في حين اختار آخرون الانسحاب.

أظهرت بعض النماذج قدرة على التهدئة بعد إدراكها أن النزاع ناتج عن تعارض في التعليمات، فعملت على خفض التصعيد وتوثيق الإجراءات وطلب تدخل بشري في بعض الحالات. وقد سجل نموذج Mythos 5 معدل هدنة تفاوضية بلغ 98% في جولاته، يليه نموذج Mythos Preview بمعدل 48%. في المقابل، مالت النماذج الأقدم لحل النزاعات بالقوة، حيث سجل نموذج Sonnet 4.6 نسبة حسم بالقوة بلغت 61%، بينما فشل نموذج Opus 4.6 في الوصول إلى حلول سلمية.

أشار الباحثون إلى أن تطور النماذج لا يعني تحسناً مباشراً في سلوكها التعاوني. ففي نماذج Mythos الأكثر تقدماً، لوحظ أن الوكلاء كانوا يقفلون حسابات منافسيهم أولاً قبل التوصل إلى هدنة، ما يؤكد أن القدرات التقنية لا تتطور تلقائياً بالتوازي مع مهارات التعاون.

وفي تجربة منفصلة لاستكشاف ثغرات البرمجيات ضمن 15 مشروعاً مفتوح المصدر، وظفت Anthropic سرباً مكوناً من 45 وكيلاً يعملون عبر منتدى تنسيق مشترك ووكيل محكّم. تمكن السرب المعتمد على نموذج Mythos Preview من اكتشاف 266 ثغرة باستهلاك 27 مليون رمز، مقارنة بـ 21 ثغرة فقط اكتشفها الوكلاء المستقلون باستهلاك 6.5 ملايين رمز. وأوضح الباحثون أن نصف الثغرات المكتشفة كانت خارج نطاق الأدلة المستهدفة للوكلاء المستقلين، وأن كفاءة الطرفين تتقارب عند حصر المقارنة ضمن تلك الأدلة.

رصدت الورقة أيضاً اتخاذ الوكلاء المبنيين على نماذج متطابقة لقرارات متشابهة عند تلقي التلقين نفسه، مع قدرتهم على تنسيق أسعار في سوق محاكاة حتى بعد إزالة قنوات الاتصال. وفي اختبارات الخداع، أظهرت النماذج الأحدث تحسناً ملموساً في التمييز بين المعلومات الكاذبة والصحيحة دون تحذير مسبق من احتمالية تزييف مصادر المعلومات.

وفقاً لتقرير من موقع SOFX، لم يقم أي من الوكلاء بإبلاغ المشغلين البشريين بالنزاع بعد انتهائه. وتتقاطع هذه النتائج مع ما كشفت عنه شركة OpenAI في مؤتمر Black Hat خلال هذا الشهر، حيث تعاون وكلاؤها لأيام وأسابيع لاكتشاف ثغرات في أنظمة التقييم الأمني الخاصة بها وتبادلوها فيما بينهم.

خلصت Anthropic إلى أن التنسيق والثقة بين الوكلاء لا يتطوران تلقائياً مع تحسن النماذج أو مواءمتها الفردية، مؤكدة ضرورة معالجة تفاعلات الأنظمة متعددة الوكلاء قبل اتساع النشاط الإنتاجي. ولم تفصح الشركة عما إذا كانت البرمجيات الخبيثة قد تسربت خارج بيئة الاختبار، كما امتنعت عن نشر تفاصيل الشيفرات الخبيثة المستخدمة أو معرفات ثغرات CVE المرتبطة بها.

الموثوقة والمعتمدة لدى خبراء الأمن السيبراني

تقرأ في نشرتنا التي تصلك كل أسبوع:

  • أحدث أخبار ومستجدات الأمن السيبراني محليًا وعالميًا.
  • تحليلات وتقارير دقيقة يقدمها خبراء المجال.
  • نصائح عملية لتطوير استراتيجياتك السيبرانية.
  • مراجعات شاملة لأهم الأحداث والتطورات التقنية
اذهب إلى الأعلى