نقدم دراسة HAQQ لوكلاء القانون - وهو تقييم طويل الأمد مصمم لقياس ما إذا كان وكلاء الذكاء الاصطناعي يمكنهم القيام بعمل قانوني حقيقي من البداية إلى النهاية، وليس فقط الإجابة على الأسئلة التافهة. 1,372 مهمة. 24 مجالاً للممارسة. حوالي 78,000 معيار تقييم من الخبراء. تغطية القانون المدني ومنطقة الشرق الأوسط وشمال إفريقيا (MENA) حسب التصميم.
عنوان رئيسي
- 1,372 مهمة قانونية طويلة الأمد عبر 24 مجالاً للممارسة
- حوالي 78,000 معيار تقييم ذري وثنائي النجاح/الفشل
- تقييم النجاح الشامل - معيار واحد مفقود يفشل المهمة
- تم تضمين 6 عائلات ممارسات القانون المدني ومنطقة الشرق الأوسط وشمال إفريقيا (MENA) من الإصدار الأول (v1)
- أفضل نموذج رائد (Claude Opus 4.7) يحقق 41% نجاحًا شاملاً؛ HAQQ Justinian يحقق 58%
- في مهام القانون المدني / الشرق الأوسط وشمال إفريقيا (MENA)، يتسع الفارق إلى 71% مقابل 28%
نقطة تحول وكلاء القانون
بدأت ملاحظة أندريه كارباثي حول وكلاء البرمجة - التي مفادها أنهم 'لم يكونوا يعملون في الأساس قبل ديسمبر وبدأوا يعملون منذ ذلك الحين' - تنطبق على المجال القانوني. ظل إنجاز المهام القانونية طويلة الأمد ثابتًا لمدة عامين. ثم في أواخر عام 2025، تقاربت نماذج الاستدلال الرائدة، والسياقات الأطول، واستخدام الأدوات الأفضل، والبنية التحتية المناسبة للتقييم. تغيرت القدرات.
حقائق أساسية
- دراسة وكيل HAQQ القانوني: 1,372 مهمة قانونية طويلة المدى، 24 مجال ممارسة، حوالي 78,000 معيار تقييم ذري للنجاح/الفشل.
- أفضل نموذج رائد (Claude Opus 4.7) يجتاز 41% من جميع المعايير؛ HAQQ Justinian يجتاز 58%.
- في مهام القانون المدني / الشرق الأوسط وشمال إفريقيا، تتسع الفجوة إلى 71% (Justinian) مقابل 28% (أفضل نموذج رائد).
وصل المجال القانوني إلى هذا المنحنى متأخرًا عن البرمجة لسبب واحد: لم يكن هناك معيار لقياسه. لا يمكنك تتبع نقطة تحول لا تراها. الدراسة هي الأداة التي بنيناها.
لماذا فشلت المعايير قصيرة المدى
معظم تقييمات Legal AI - LegalBench, CUAD, LEXam, حتى أعمالنا السابقة - تختبر الاستدلال قصير المدى: قراءة بند، الإجابة على سؤال، تصنيف فقرة. إنها مفيدة، لكنها لا تخبرك بشيء تقريبًا عما إذا كان الوكيل يمكنه فعليًا إنجاز قطعة عمل.
العمل القانوني الحقيقي لا يشبه الاختيار من متعدد على الإطلاق. يقوم الشريك بإعادة توجيه بريد إلكتروني، ويرفق مجلدًا، ويكتب سطرًا واحدًا: 'ألقِ نظرة وعد بمذكرة بحلول يوم الخميس.' ما يحدث بين ذلك البريد الإلكتروني والمذكرة هو العمل كله - قراءة المسألة، العثور على القضايا المهمة، تجاهل القضايا غير المهمة، صياغة منتج عمل قابل للمراجعة، والتأكد من صحة كل حقيقة.
هذا ما تقيسه الدراسة.
كيف تُبنى مهمة الدراسة
كل مهمة في الدراسة تعكس كيفية سير العمل داخل شركة محاماة. يتلقى الوكيل تعليمات مكتوبة بالطريقة التي يكتبها الشريك - قصيرة، تأكيدية، بدون مواصفات تنسيق. يتلقى بيئة - مسألة عميل تحتوي على المستندات وسلاسل البريد الإلكتروني التي يحتاجها (والكثير مما لا يحتاجه). يجب أن ينتج منتج عمل قابل للمراجعة. ويتم تقييمه بواسطة معايير خبراء.
- التوجيهات: حوالي 50 كلمة في المتوسط. طلب تأكيدي، لا توجد قائمة مراجعة.
- البيئة: مجلد القضية الذي يمزج المستندات الجوهرية بضوضاء محيطية. يجب على الوكيل العثور على ما يهم.
- المخرجات: مذكرة، نسخة معدلة، جدول، مسودة لائحة دعوى، أو إيداع - مهما تطلبه المهمة بالفعل.
- التحقق: معايير نجاح/فشل ذرية وثنائية، مكتوبة من قبل خبراء. يتم التحقق من كل حقيقة، استشهاد، تصنيف شدة، موعد نهائي، ومبلغ بالدولار.
كل صف هو ترميز 1:1 لكيفية سير قضية حقيقية عبر شركة: طلب الشريك يصبح توجيهًا، قضية العميل تصبح بيئة، ناتج العمل يصبح مخرجات، مراجعة الشريك تصبح معايير تقييم خبراء. لا يتم تجريد أي شيء لتسهيل المهمة على النموذج.
نظام الدرجات بالنجاح الشامل
يتم اعتبار المهمة مكتملة فقط إذا استوفت جميع معايير التقييم. نسمي هذا نظام الدرجات بالنجاح الشامل، وهو أهم خيار تصميمي وحيد في الدراسة.
تقرير فريق الصفقة الذي يكتشف 8 من 10 مخاطر ليس مفيدًا بنسبة 80%. الاثنان اللذان تم تفويتهما يمكن أن يكونا محفز تغيير السيطرة الذي ينسف الصفقة، أو تأهيل الاستمرارية الذي يعيد تسعير العرض. لا يوجد رصيد جزئي في مراجعة الشريك.
تشريح معايير التقييم
معايير التقييم هي الجزء من الدراسة الذي استغرق أكبر عدد من ساعات المحامين لبنائه. لكل مهمة جلسنا مع الممارسين في المجال ذي الصلة وقمنا بتحليل ما سيفحصه الشريك أو العميل بالفعل في المخرجات. كل فحص ذري وثنائي - لا توجد درجات تقديرية، ولا إيماءات LLM-كقاضٍ بشأن الأسلوب.
المعايير الذرية تفعل ثلاثة أشياء في وقت واحد: تجعل التقييم قابلاً للتكرار عبر مرات التشغيل، وتجعل أخطاء الوكيل قابلة للتصحيح (ترى بالضبط أي فحص تعطل ولماذا)، وتتضاعف كإشارات مكافأة للضبط الدقيق. نفس المعيار الذي يقيم نموذجًا يمكنه تدريب النسخة التالية منه.
24 مجالًا للممارسة - بما في ذلك القانون المدني ومنطقة الشرق الأوسط وشمال إفريقيا (MENA)
تهيمن مهام القانون العام الأمريكي على المعايير القانونية الحالية. هذا جيد لما هي عليه، لكنه ليس العالم الذي يمارس فيه معظم عملائنا. تغطي الدراسة (الإصدار 1) 24 مجالًا للممارسة، ستة منها صراحةً قانون مدني ومنطقة الشرق الأوسط وشمال إفريقيا (MENA): صياغة القانون المدني العربي، والامتثال للشريعة، وشركات دول مجلس التعاون الخليجي، ونزاعات البناء، والأحوال الشخصية، وعمل منطقة الشرق الأوسط وشمال إفريقيا (MENA).
بدأنا من قضايا حقيقية - مجهولة الهوية ومنقاة - تعامل معها محامون ممارسون عبر قاعدة عملائنا. قسمنا كل قضية إلى المهام المنفصلة التي سيتم تفويضها فعليًا لمساعد محامٍ. المجالات الـ 24 ليست شاملة. ستضيف الإصدارات المستقبلية تحكيم البناء، وتنظيم التكنولوجيا المالية، وESG، وسير العمل الداخلي.
مثال: مراجعة تغيير السيطرة
تطلب إحدى مهام الاندماج والاستحواذ للشركات من الوكيل تحليل بنود تغيير السيطرة عبر غرفة بيانات افتراضية للاستحواذ (الخيالي) على Crestview Software Solutions في صفقة بقيمة 458 مليون دولار أمريكي بأسهم كاملة. تحتوي غرفة البيانات على ثمانية عقود أساسية بالإضافة إلى ملفات مجاورة - 10-K، خطة تعويضات مؤجلة، محاضر مجلس الإدارة - قد تكون ذات صلة أو لا تكون.
أدناه عرض الإدخال الكامل كما يراه الوكيل - الطلب، سياق الصفقة، العقود الأساسية، مواد غرفة الصفقات الأوسع، والمخرجات المطلوبة. كل إدخال يمثل تلميحًا ومشتتًا للانتباه: يجب على الوكيل استخدام حقائق المذكرة، ولكن يجب عليه أيضًا فصل المهمة الأساسية عن الملفات الهامشية مثل مسودات خطابات العرض والسير الذاتية للفريق التي لا تغير التحليل.
يجب على الوكيل تحديد الملفات المهمة، وقراءتها في سياقها، وتجميع الأحكام ذات الصلة عبر القضية. المخرجات المطلوبة هي مذكرة فريق الصفقة مع ملخص تنفيذي، وتحديد المخاطر، وتحليل عقد بعقد، وتصنيفات الخطورة، وتوصيات التخفيف.
تحتوي معايير التقييم لهذه المهمة الواحدة على 57 معيارًا - تغطي تسع قضايا قانونية مطروحة، والحقائق الأساسية وراء كل منها، وتصنيف الخطورة، والتعرض المالي، والإجراء الموصى به. إذا فات أحد هذه التسعة، تفشل المهمة.
جرّب HAQQ AI مجاناً
اختبر الصياغة والبحث القانوني بالذكاء الاصطناعي
ما يتم إدخاله، وكيف يتم تقييمه
المسائل التسع المدرجة في هذه المهمة الواحدة ليست مصائد كلمات مفتاحية سطحية. تتطلب من الوكيل ربط الحقائق عبر المستندات، استنتاج المسببات من التعريفات، تحديد حجم التعرض المالي بالدولار، والتوصية بالإجراء القانوني الصحيح التالي. مرر مؤشر الماوس فوق أي مسألة لترى ما يجب على الوكيل اكتشافه واختبار الوحدة الذي يطبقه المعيار على التسليم.
نتائج خط الأساس للإصدار الأول
أجرينا الدراسة (الإصدار الأول) على ستة أنظمة رائدة: HAQQ Justinian، Claude Opus 4.7، GPT-5.2، Gemini 3.1 Pro، Grok 4.1، و Mistral Large 3. تم محاولة كل مهمة ثلاث مرات؛ ونحن نبلغ عن أفضل معدل نجاح شامل من أصل ثلاث محاولات. تنقسم الأرقام الرئيسية بوضوح حسب الفئة.
سادت نمطان عبر مجموعة البيانات.
- تعمل النماذج الحدودية العامة بشكل جيد في الاستدلال المعزول وبشكل سيء في المهام طويلة الأمد. إنها تفقد السياق، وتختلق روابط عبر المستندات، وتنتج مخرجات تبدو واثقة لكنها تفشل في فحوصات المعايير المتعلقة بالحقائق والمراجع.
- الوكلاء المدربون على مجال معين (Justinian والأنظمة المتخصصة المماثلة) يسدون الفجوة في الإنجاز طويل الأمد - خاصة في صياغة القانون المدني، حيث تميل النماذج العامة إلى هياكل القانون العام وتفشل في التفاصيل الإجرائية.
مصفوفة القدرات - ما يمكن لكل نموذج إنجازه فعليًا
تخفي الدرجات الإجمالية السؤال التشغيلي الذي يطرحه كل شريك في مكتب محاماة: ما هي أنواع العمل التي يمكنني تفويضها بالكامل، وما هي التي تحتاج إلى محامٍ للمراجعة، وما هي التي لا يجب أن أتعامل معها؟ تجيب المصفوفة أدناه على ذلك عبر 24 عائلة مهمة.
لماذا يهم هذا مكاتب المحاماة
إذا كنت تقوم بتقييم مورد للذكاء الاصطناعي وعرضوا عليك عرضًا توضيحيًا واثقًا على مستند واحد، اسألهم عن شكل معدل إنجازهم للمهام طويلة الأمد في قضية حقيقية. اسألهم عن معدل النجاح الشامل لديهم وفقًا لمعيار يتكون من 50 نقطة لتلك القضية. اسألهم عن مجالات الممارسة التي يغطونها بالكامل مقابل مجرد المساعدة.
هذه هي الأسئلة التي صُممت الدراسة للإجابة عليها - بشكل علني، وقابل للاستنساخ، وبمعايير تقييم يمكن لأي شريك مراجعتها.
ما هو مفتوح وما هو التالي
- عائلات مهام v1 وتنسيق معايير التقييم موثقة وسيتم إطلاقها للعملاء والشركاء البحثيين بموجب ترخيص تقييمي.
- سنقوم بنشر منهجية تسجيل نقاط موحدة ولوحة صدارة أساسية بمجرد حصولنا على النتائج من جميع النماذج الرائدة الرئيسية.
- سيضيف v2 التحكيم في منطقة الشرق الأوسط وشمال أفريقيا، ونزاعات البناء، وسير عمل المستشارين القانونيين الداخليين، وصياغة أوسع للقانون المدني باللغتين العربية والفرنسية.
- نحن نعمل على تطوير امتدادات بالتعاون مع مكاتب محاماة مختارة - إذا كنت ترغب في المساهمة بعائلات مهام من ممارستك، تواصل معنا.
الأعمال السابقة تقوم بعمل أكثر إثارة للاهتمام من أي وقت مضى - LegalBench و BigLaw Bench ومعيار وكيل الذكاء القانوني الذي أصدرته Harvey مؤخرًا كلها تدفع هذا المجال إلى الأمام. مساهمة HAQQ هي المحور متعدد اللغات، والقانون المدني، والشرق الأوسط وشمال أفريقيا أولاً الذي كان مفقودًا.
جربها
إذا كنت ترغب في رؤية كيفية أداء Justinian في المهام طويلة الأجل من ممارستك، تحدث إلى فريقنا. سوف نقوم بتشغيل مشروع تجريبي سري ومُقيّم بالمعايير حول مسألة منقحة من مكتبك.
شكر وتقدير
هذه الدراسة هي نتاج عمل العديد من الأشخاص داخل HAQQ وعبر شبكة ممارسينا. وقد تولى فريق هندسة HAQQ Justinian القيادة التقنية للمنصة، وصندوق اختبار الوكيل، وتشغيل مقاييس التقييم، بينما قاد فريقنا للبحث القانوني التطبيقي تصميم المهام وتوليد القضايا. وبنت فرق الأمن ومنصات الذكاء الاصطناعي لدينا بيئة التنفيذ المعزولة التي تتيح لنا تشغيل الوكلاء مقابل قضايا تركيبية دون تسريب بيانات العملاء. وشكلت فرق العلامة التجارية والمنتج لدينا كيفية إيصال النتائج للمشترين القانونيين غير التقنيين.
خارج HAQQ، نحن ممتنون للمحامين الممارسين - في منطقة الشرق الأوسط وشمال إفريقيا والاتحاد الأوروبي والمملكة المتحدة - الذين ساهموا بقضايا مجهولة الهوية، وصاغوا مقاييس التقييم في مجالات ممارستهم، واختبروا مجموعات المهام الأولية. كما نشكر الباحثين الأكاديميين الذين راجعوا منهجيتنا وفرق الأعمال السابقة التي تقف وراء LegalBench وBigLaw Bench وCUAD وLEXam ومعيار الوكيل القانوني الخاص بـ Harvey، والذين جعل عملهم المنشور تصميم هذا المعيار أسرع وأفضل.



