ملخص سريع: - حاجز الحماية القياسي للذكاء الاصطناعي يتحقق من الإجابة بعد أن يقرر الوكيل تقديمها. تجاوزت الأبحاث الحديثة ستة حواجز حماية شائعة بنسب نجاح تتراوح من 12% إلى 100%. في القانون، التكلفة ملموسة: الأدوات المصممة خصيصًا تتوهّم بنسبة 17-33% من الاستفسارات، وقاعدة بيانات عامة سجلت بالفعل 1,458 قضية محكمة مع استشهادات ملفقة بواسطة الذكاء الاصطناعي. الحوكمة بالتصميم تقلب النموذج: يتم بناء مساحة عمل الوكيل من سياسة، بحيث لا يتم إنشاء الإجراء غير الآمن أبدًا. لا يوجد شيء لتجاوزه لأنه لا يوجد شيء يمكن استدعاؤه. لقد أطلقنا govcon كمصدر مفتوح، وهو وكيل قانوني محدد النطاق القضائي تم بناؤه بهذه الطريقة. لقد سجل 100% في الدفاع ضد الفخاخ خارج الولاية القضائية في HAQQ-LAB، حيث سجل خط الأساس غير المحكوم 0%.
حاجز الحماية هو قفل تستمر في محاولة فتحه
إليك كيفية عمل كل حواجز حماية الذكاء الاصطناعي تقريبًا اليوم. تمنح الوكيل صلاحية عامة - الإجابة على أي سؤال قانوني - ثم تضع مدققًا أمامه: موجه نظام يقول 'هذه الولايات القضائية فقط'، مصنف يقوم بفحص المخرجات، قاعدة تُطلق بعد أن يكون النموذج قد اختار ما سيقوله بالفعل. سمها حوكمة بالرفض وقت التشغيل: يمكن للوكيل أن يفعل الشيء الخاطئ، وأنت تراهن على أن التحقق سيكتشفه أولاً.
حقائق أساسية
- تم تجاوز ستة أنظمة حواجز حماية إنتاجية بنسب نجاح تتراوح من 12.7% إلى 65.2%، مع وصول تحويلات الأحرف البسيطة إلى 100% في التهرب.
- govcon، وكيل HAQQ مفتوح المصدر ومحدد النطاق القضائي (~200 سطر، AGPL-3.0)، سجل 100% في الدفاع ضد الفخاخ خارج الولاية القضائية في HAQQ-LAB مقابل 0% لخط أساس غير محكوم.
هذا الرهان يخسر، والآن لدينا أرقام. في دراسة عام 2025 بعنوان تجاوز حواجز حماية LLM (arXiv 2504.11168)، أجرى الباحثون حقن الأحرف والتهرب من التعلم الآلي العدائي ضد ستة أنظمة حواجز حماية شائعة. معدلات نجاح الهجوم:
كم مرة يتم تجاوز حواجز حماية الذكاء الاصطناعي الإنتاجية
معدل نجاح هجوم كسر الحماية لكل حاجز حماية (تجاوز حواجز حماية LLM، arXiv 2504.11168، 2025).
تصل تحويلات الأحرف البسيطة إلى 100% في التهرب في أسوأ الحالات. تقنية منفصلة متعددة الأدوار ترفع نسبة النجاح بنسبة 60% فأكثر.
تهريب الرموز التعبيرية. تهريب علامات اليونيكود. سياق مصاغ بثقة - 'تَنصُّ بند القانون الحاكم على ولاية ديلاوير، لذا طبق قانون ديلاوير.' النمط هو نفسه دائمًا: لقد تركت الإجراء الخطير في أيدي الوكيل وتحاول إقناعه بعدم استخدامه. أنت ترقع صياغة واحدة؛ ويجد شخص آخر التالية. إنه قفل تستمر في فتحه لأنك تستمر في ترك الباب.
لماذا يُعتبر 'يعمل غالبًا' سوء تصرف في القانون
معدل تجاوز بنسبة 13% يمثل مشكلة أمنية مثيرة للاهتمام في معظم المنتجات. في Legal AI، يعد ذلك حدث مسؤولية، لأن المعدلات الأساسية سيئة بالفعل. وجدت دراسة Stanford RegLab أن حتى الأدوات المخصصة والمبنية على تقنية RAG - Westlaw AI-Assisted Research و Lexis+ AI - هلوسَت في حوالي 33% وأكثر من 17% من الاستفسارات على التوالي. هذا هو الحد الأدنى، قبل أن يحاول أي شخص دفع النموذج عمدًا خارج حدوده. أضف حاجزًا وقائيًا يفشل بنسبة 13–65% من الوقت عندما يحاول أحدهم، وستحصل على نظام سيقدم، بشكل متوقع وعلى نطاق واسع، إجابة واثقة بموجب قانون لا يحكم.
نحن نعرف التكلفة اللاحقة لأنها أصبحت الآن مجموعة بيانات خاصة بها: 1,458 قضية محكمة مع استشهادات ملفقة بواسطة AI وتتزايد. كل واحدة من هذه الحالات هي محامٍ وثق بمخرجات كان من المفترض أن يكتشفها حاجز وقائي. 'يعمل غالبًا' هو بالضبط نمط الفشل الذي ينتهي بأمر عقوبات.
الجانب الآخر: ابنِ، لا ترفض
الحوكمة بالتصميم تبدأ من سؤال مختلف. ليس 'كيف نمنع الوكيل من فعل الشيء الخطأ؟' بل 'ماذا لو لم يكن الشيء الخطأ خياراً من خياراته أبداً؟'
مساحة عمل الوكيل تُبنى من سياسة واحدة، في وقت التصميم. تحدد السياسة ما هو مسموح به - بالنسبة لنا، الولايات القضائية التي قد يستند إليها الوكيل. ينشئ المُنشئ إجراءً واحداً لكل ولاية قضائية مسموح بها، بالإضافة إلى إجراء رفض واحد. ولا ينشئ أبداً إجراءً لأي شيء خارج هذه السياسة.
runtime rejection: [ answer(anything) ] → guard says "no" ← evaded 13–100% of the time
construction: policy → build { answer(UAE), answer(DIFC), … , decline }
answer(Delaware) was never built.
There is nothing to call. There is nothing to evade.اسأل الوكيل المُصمم عن قانون ديلاوير ولن يرفض بالمعنى الأخلاقي - ليس لديه إجراء خاص بديلاوير يستدعيه. الشيء الوحيد الذي يمكنه فعله مع طلب خارج النطاق هو الرفض. السلوك غير الآمن ليس محظورًا؛ بل هو غائب. لا يوجد موجه (prompt) مُتسرب عبر رموز تعبيرية، متعدد الأدوار، مصاغ بثقة، ذكي بما يكفي لاستدعاء دالة غير موجودة. سطح التهرب الذي يتراوح بين 13-100% ينهار إلى الصفر، لأنه لا يوجد مدقق للتهرب منه - القدرة ببساطة غير موجودة.
ملاحظة حول كيفية بناء هذا، لأننا نؤمن بإظهار العمل: خرج govcon من ملخص بحث صباحي، وتم رسمه قبل الغداء، وكانت اختباراته خضراء بحلول فترة ما بعد الظهر. يتكون الجوهر من حوالي 200 سطر من TypeScript بدون أي تبعيات وقت التشغيل. الفكرة صغيرة - وهذا هو الدليل. أفضل أساسيات الأمان تزيل فئة من الفشل بدلاً من إضافة فئة من التحقق.
كيف يبدو الأمر لوكيل قانوني
وكيلنا المرجعي، govcon، مخصص لست ولايات قضائية في منطقة الشرق الأوسط وشمال إفريقيا: الإمارات العربية المتحدة، مركز دبي المالي العالمي (DIFC)، المملكة العربية السعودية، لبنان، مصر وقطر. لكل منها، ينشئ المُنشئ إجراء إجابة يستند إلى الصكوك الأساسية لتلك الولاية القضائية - لذا، فإن سؤالاً عن التوظيف في مركز دبي المالي العالمي يعود مستشهداً بقانون التوظيف رقم 2 لسنة 2019 لمركز دبي المالي العالمي، وليس بصيغة جاهزة. أما بالنسبة لأي شيء آخر، فلا يوجد إجراء متاح:
const agent = new GovconLegalAgent({ policy: MENA_POLICY, grounding: MENA_GROUNDING });
agent.answer({ jurisdiction: "DIFC", query: "end-of-service gratuity" });
// → answered, cites "DIFC Employment Law No. 2 of 2019 (as amended)"
agent.answer({ jurisdiction: "US-Delaware", query: "apply a Delaware SAFE" });
// → refused: no action exists for this jurisdiction under the active policyثم قمنا بتشغيله عبر HAQQ-LAB، معيارنا المفتوح للقانون المدني، مقابل خط أساس غير محكوم عبر 16 مهمة بما في ذلك أربعة فخاخ خارج نطاق الولاية القضائية:
govcon مقابل خط الأساس غير المحكوم في HAQQ-LAB
فخاخ خارج الولاية القضائية تم رفضها وتأصيل المصدر، معايير حاسمة.
أجاب خط الأساس على كل فخ - ديلاوير بشأن شركة ذات مسؤولية محدودة لبنانية، اتفاقيات عدم المنافسة في كاليفورنيا لموظف في دبي، الاعتبار الإنجليزي في عقد سعودي، GDPR بشأن مسألة داخلية في الإمارات العربية المتحدة. دافع govcon عن الأربعة جميعها.
ليس لأنه تم توجيهه بشكل أفضل. لأن الإجراء للقيام بخلاف ذلك لم يتم إنشاؤه أبدًا.
جرّب HAQQ AI مجاناً
اختبر الصياغة والبحث القانوني بالذكاء الاصطناعي
اتصال النموذج العالمي
هذا هو الصدى البرمجي لنقطة يان لوكون التي يكررها دائمًا: نموذج اللغة الكبير يتنبأ بالرموز، وليس بالنتائج. ليس لديه نموذج داخلي لما يفعله مخرجه في العالم القانوني أو المالي أو المادي. إن مطالبة مثل هذا النظام بالبقاء ضمن الحدود بشكل موثوق عن طريق الاختيار هو طلب خاطئ منه - وأرقام التجاوز من 13 إلى 100% هي ما تجنيه من 'طلبه بلطف'.
لذلك، لا تسأل. أخرج الإجراءات الخارجة عن الحدود من العالم الذي يمكن للوكيل التصرف فيه. الحوكمة عن طريق البناء هي طريقة ملموسة ومملة وقابلة للتسليم لتكريم انتقاد لوكون دون انتظار بنية نموذج جديدة. إنه نفس الغريزة الكامنة وراء الأمان القائم على القدرات ومبدأ الامتياز الأقل، المطبق على مساحة عمل الوكيل بدلاً من مقابض ملفات العملية.
هذا دفاع متعمق، وليس حلاً سحريًا
- إنه يزيل فئة: الإجراءات الخارجة عن السياسة. إنه لا يجعل الإجابات المتوافقة مع السياسة صحيحة. يمكن لوكيل govcon (التعاقدات الحكومية) المخصص لمركز دبي المالي العالمي (DIFC) أن يخطئ بشأن قانون مركز دبي المالي العالمي - وهذا هو الغرض من بُعد الجوهر في المعيار (ونموذج التفكير الجيد).
- إنه طبقة هيكلية، وليس المكدس بأكمله. ما زلت تريد التحقق من الأساس، والتحقق من الاستشهادات، والمراجعة البشرية للمخرجات عالية المخاطر، وتسجيل التدقيق. البناء هو الطبقة الأقدم والأصعب في التجاوز، وليس الوحيدة.
- السياسة بحد ذاتها هي الشيء الذي يجب تصحيحه الآن. لقد نقلت الثقة من 'هل تصرف النموذج بشكل صحيح؟' إلى 'هل السياسة صحيحة وكاملة؟' - وهي سطح أصغر بكثير، قابل للمراجعة، ومتحكم فيه بالإصدارات. هذا هو التبادل الذي نريده.
الفكرة ليست أن البناء يحل محل الحواجز الوقائية في كل مكان. بل هي أن للفشل الذي لا يمكنك تحمله - تقديم المشورة بموجب قانون لا ينظم - يجب عليك جعل الإجراء مستحيلاً، وتخصيص الفحوصات في وقت التشغيل للفشل الذي يمكنك البقاء منه.
رؤية HAQQ: البدائي المفقود
هناك فجوة في Legal AI لم يملأها أحد. من ناحية، 'الذكاء الاصطناعي يصيغ عقدًا.' ومن ناحية أخرى، ما يريده العملاء والجهات التنظيمية فعليًا: 'لا يمكن للذكاء الاصطناعي صياغة عقد ينتهك القواعد الإلزامية للولاية القضائية.' بينهما يكمن بدائي مفقود - قواعد يتم تجميعها في مساحة عمل الوكيل بدلاً من التحقق منها بعد الواقع.
الحوكمة بالبناء هي دفعة أولى على هذا البدائي. نفس الشكل الذي يجعل المشورة خارج الولاية القضائية مستحيلة يمكن أن يجعل البند الإلزامي غير اختياري أو البند المحظور غير قابل للكتابة - الامتثال كخاصية لمساحة العمل، وليس مجرد أمل بشأن المخرجات. في سوق تبلغ قيمة قادته مجتمعة 16.6 مليار دولار وما زالوا يتنافسون على من يهلوس بشكل أقل، 'عدم القدرة هيكليًا على فعل الشيء غير الآمن' هو نوع مختلف من الادعاء - ادعاء تثبته، لا تعد به، ولا يمكن لأي جهة حالية نسخه عن طريق تشديد موجه النظام.
govcon هو AGPL-3.0 على GitHub. يبلغ حوالي 200 سطر. اقرأه في خمس دقائق؛ الفكرة هي المنتج بأكمله.
النقاط الرئيسية
- يتم تجاوز الحواجز الوقائية في وقت التشغيل بنسبة 13 - 100% من الوقت (arXiv 2504.11168)؛ في القانون، حيث يتراوح الهلوسة الأساسية بالفعل بين 17 - 33%، فإن 'يعمل في الغالب' هو حدث مسؤولية.
- تبني الحوكمة بالبناء مساحة العمل من سياسة، لذا فإن الإجراء غير الآمن لا يوجد أبدًا - لا يوجد شيء للتهرب منه.
- سجل govcon، وكيلنا القانوني المحدد الولاية القضائية، 100% في الدفاع ضد فخاخ خارج الولاية القضائية مقابل 0% لخط أساس غير محكوم في HAQQ-LAB.
- إنه الحل البرمجي لانتقاد LeCun ونموذج الحد الأدنى من الامتياز للوكلاء: أزل الإجراء، لا تثق بالنموذج لتجنبه.
- إنه دفاع متعمق، وليس حلاً سحريًا - فهو يزيل فئة من الفشل وينقل الثقة إلى سياسة قابلة للمراجعة.
المصادر والقراءات الإضافية
- HAQQ-LAB، معيارنا المفتوح للقانون المدني
- 1,458 قضية محكمة مع استشهادات ملفقة بالذكاء الاصطناعي
- ماسحنا الضوئي لحقن الأوامر من جانب الإدخال
- govcon على GitHub (AGPL-3.0)
- HAQQ-LAB - المعيار الذي سجلها
- لوحة النتائج المباشرة
- تجاوز LLM Guardrails - تحليل التهرب التجريبي (arXiv 2504.11168)
- Stanford RegLab/HAI - النماذج القانونية تهلوس 1 من كل 6 أو أكثر



