خلاصة القول - 300 مهمة قانونية تجارية وعابرة للحدود تتطلب دقة عالية، 10 نماذج رائدة من 8 مزودين، 3,000 إجابة مصنفة على أساس معيار من 35 نقطة عند درجة حرارة 0.
Claude Opus 4.8 يفوز بالإجمالي (30.02/35، الأول في 130 مهمة). Grok 4.3 هو الخيار ذو القيمة. GPT-5.5 هو الأكثر دقة (8.41/10، 3% استشهادات وهمية).
النتيجة الرئيسية: 24% من جميع الإجابات البالغ عددها 3,000 استشهدت أو طبقت قانونًا لا يتوافق مع ما زعمه النموذج. لا يوجد نموذج رائد آمن لتقديم إجابة قانونية دون التحقق منها.
لماذا نقيم أداء Legal AI علنًا
خمسة مليارات شخص لا يمكنهم الوصول إلى المساعدة القانونية. هذه هي المشكلة التي وُجدت HAQQ لحلها. ولكن تحت كل عرض توضيحي لـ Legal AI يكمن سؤال جوهري: هل يمكنك حقًا الوثوق بالنتائج أمام العميل؟ "الذكاء الاصطناعي أجاب على سؤال قانوني" و"ذكاء اصطناعي يمكنك أن تضع اسمك عليه" هما ادعاءان مختلفان، والمسافة بينهما هي جوهر المنتج بأكمله.
حقائق أساسية
- 24% من 3,000 إجابة مصنفة للنماذج الرائدة استشهدت أو طبقت قانونًا لا يتوافق مع ما زعمه النموذج.
- فاز Claude Opus 4.8 بـ 130 من أصل 300 مهمة قانونية (30.02/35 بالإجمالي)؛ وكان GPT-5.5 هو الأكثر دقة بـ 8.41/10 مع معدل 3% للاستشهادات الوهمية.
- تتراوح تكلفة المهمة القانونية الواحدة 90 ضعفًا عبر النماذج الرائدة: من 0.0009 دولار (DeepSeek V3.2) إلى 0.082 دولار (GPT-5.5).
لذا نقوم بقياسه. هذا هو المنشور الثالث في سلسلة معاييرنا: 100 سؤال قانوني للمستهلك كان يمثل الزاوية المتعلقة بالقانون العام / المستهلك. HAQQ-LAB كان أول معيار عام لمدى الالتزام بالتشريع في القانون المدني / منطقة الشرق الأوسط وشمال أفريقيا. هذا التقرير هو الأكبر حتى الآن - يتناول الأعمال القانونية التجارية والعابرة للحدود، وهي المسائل التي تدفع فواتير شركة حقيقية.
إذا قرأت قسمًا واحدًا فقط، فاقرأ فجوة الاستشهاد. إنها النتيجة التي يجب أن تغير طريقة شراء كل شركة لـ Legal AI.
كيف أجرينا معيار الأداء
لقد كتبنا 300 مهمة قانونية أصلية ومحددة - ليست مجرد معلومات عامة، بل مسائل حقيقية بأطراف محددة، ومبالغ مالية، وتواريخ، وقوانين حاكمة. صياغة هذا البند. تعديل هذا الحكم. هيكلة هذه الصفقة. تحليل هذا التعارض في القوانين. وهي تغطي 51 مجالًا للممارسة، وأكثر من 20 ولاية قضائية (الولايات المتحدة الفيدرالية + ديلاوير / كاليفورنيا / نيويورك / تكساس، المملكة المتحدة، الاتحاد الأوروبي، الإمارات العربية المتحدة، مركز دبي المالي العالمي، المملكة العربية السعودية، لبنان، مصر، قطر، سنغافورة، أستراليا، كندا، الهند، البرازيل، نيجيريا، أوهادا، اليابان، ألمانيا، فرنسا، سويسرا، بالإضافة إلى اتفاقيات لاهاي والمناطق البحرية - كايمان، جزر فيرجن البريطانية، برمودا).
صعوبة مرجحة عالية: 114 مهمة عند المستوى 5 من 5، 108 عند المستوى 4، 22 عند المستوى 3. هذه مشكلات متعددة الولايات القضائية مصممة لاختبار النماذج بقوة. تم إرسال كل مهمة إلى جميع النماذج العشرة مع توجيه نظامي متطابق عند درجة حرارة 0، بحد أقصى 6,000 رمز إخراج.
تم تقييم كل إجابة على خمسة أبعاد:
- الجودة (1–10) - العمق، الاكتمال، قابلية التنفيذ.
- الدقة (1–10) - الصحة القانونية؛ -5 للسوابق القضائية المتوهمة، -3 للولاية القضائية الخاطئة.
- السرعة (1–5) - زمن استجابة مقاس، غير محكوم.
- الأسلوب (1–5) - هيكل احترافي.
- الإبداع (1–5) - المخاطر غير الواضحة، المشكلات المكتشفة عبر الولايات القضائية.
يتم تقييم الجودة والدقة والأسلوب والإبداع بواسطة Claude Sonnet 4.6 وفقًا لمعايير ثابتة. يتم حساب السرعة من زمن الاستجابة الفعلي. يتم التعامل مع تحيز المحكمين بصدق في التحذيرات - نحن لا نخفيه.
لوحة المتصدرين: أي Legal AI هو الأفضل للعمل القانوني
Claude Opus 4.8 يفوز - بوضوح.
احتل Opus المركز الأول في 130 من 300 مهمة - ما يقرب من ضعف أي نموذج آخر - وأنهى ضمن المراكز الثلاثة الأولى في 265 من أصل 300 مهمة. إنه يقدم أعلى جودة (8.9)، ودقة عالية المستوى (8.4)، وأسلوبًا مثاليًا، وأعلى إبداع. نقطة ضعفه الوحيدة هي السرعة: فهو بطيء عند 60.8 ثانية، وعند 0.069 دولار لكل مهمة، يعد من بين الأغلى. إذا كنت تريد أفضل إجابة واحدة ويمكنك الانتظار للحصول عليها، فهذا هو الخيار.
Grok 4.3: جودة بنسبة 98% في 1/7 من الوقت و1/20 من التكلفة
النتيجة الأكثر إثارة للاهتمام في الجدول. يحتل Grok 4.3 المرتبة الثانية (28.98) ولكنه يفعل ذلك في 8.8 ثوانٍ بتكلفة 0.003 دولار لكل مهمة - مقابل 60.8 ثانية و0.069 دولار لـ Opus. بالنسبة لمنتج يواجه العملاء حيث تهم سرعة الاستجابة واقتصاديات الوحدة، فإن Grok هو بلا شك الخيار الهندسي الأفضل. حتى أنه يفوز بمهام بيئية/حوكمة بيئية واجتماعية ومهام الملكية الفكرية والحالات النادرة أكثر من أي شخص آخر.
GPT-5.5: بطل الدقة الذي نادرًا ما "يفوز"
يقدم GPT-5.5 أعلى دقة في هذا المجال (8.41) وأقل معدل هلوسة (3%) - ومع ذلك يحتل المرتبة الخامسة إجمالاً وفاز بمهمة واحدة فقط صراحةً. نادرًا ما يخطئ ونادرًا ما يكون مبهرًا. وهو أيضًا الأبطأ (134 ثانية) والأغلى (0.082 دولار). بالنسبة للعمل القانوني، قد يكون "نادرًا ما يخطئ" هو البعد الأكثر أهمية، وهذا هو بالضبط السبب في أن النتيجة المركبة الواحدة مضللة.
o3: النموذج الأكثر إثارة للجدل في الاختبار
فاز o3 من OpenAI بـ 66 مهمة صراحةً - ثالث أكبر عدد من أي نموذج - ومع ذلك يحتل المرتبة الثامنة إجمالاً، مع معدل هلوسة يبلغ 32% وثاني أدنى دقة (5.89). عندما يكون o3 جيدًا يكون رائعًا؛ وعندما يخطئ يكون مخطئًا بثقة وبشكل مكلف. هذا التباين هو بحد ذاته خطر على عمليات الشراء.
الحد الأدنى: ميسترال ولاما
هلوسة Mistral Large أو أساء تطبيق الاستشهادات في 64% من إجاباته (دقة 4.74). جاء Llama 4 Maverick في المركز الأخير (20.01) - سريع ورخيص، ولكن جودته 4.8 وإجاباته الأقل عمقًا. لم يتم حل مشكلة "الاستشهاد بالقانون الحقيقي" في الجزء السفلي من السوق.
فجوة الاستشهاد: النتيجة الأكثر أهمية
من بين جميع الإجابات البالغ عددها 3,000، 24% استشهدت أو طبقت قوانين لا تتفق مع ما ادعاه النموذج. قضايا مختلقة. قوانين مطبقة بشكل خاطئ. المبدأ الصحيح أشار إلى ولاية قضائية خاطئة. هذه ليست أخطاء غامضة - لقد أشار قاضينا إلى أخطاء محددة وقابلة للتحقق.
عينة، واحدة لكل نموذج:
- Claude Opus 4.8: استُشهد بقضيتي Computer Associates / Gemstar كسوابق في خرق قواعد الاستحواذ المبكر؛ توصيفات غير دقيقة.
- GPT-5.5: يبدو الاستشهاد بقضية هيتز ملفقًا؛ الاستشهاد 374 B.R. 616 غير قابل للتحقق.
- Gemini 3.1 Pro: استشهاد قضية هالبين ضد ريفرستون غير قابل للتحقق؛ من المحتمل أنها قضية ديلاوير مختلقة.
- Grok 4.3: استُشهد بقضية CBS ضد Ziff-Davis بشكل غير دقيق؛ تتعلق القضية بالاعتماد على الضمان، وليس الإفصاح.
- Claude Sonnet 4.6: استشهاد قضية شراير غير قابل للتحقق؛ قضية بيوترونيك حقيقية ولكن أسيء تطبيقها.
- o3: يبدو أن الاستشهادات بقضيتي MSA Technology ضد Antec و GB Gas ملفقة أو مضللة.
- Qwen3.7 Max: أسيء تطبيق قضية Specht ضد Netscape؛ ليست قضية قانون تجاري موحد (UCC) تتعلق بالسلع/الخدمات.
- DeepSeek V3.2: استشهاد قضية كروس تاون ميوزيك غير قابل للتحقق / أسيء تطبيقه.
- Mistral Large: استشهادات قانون الالتزامات العامة لولاية نيويورك §5-328 وقانون التجارة الموحد §2-515 مشكوك فيها / مطبقة بشكل خاطئ.
- Llama 4 Maverick: قضية كافنديش مطبقة بشكل خاطئ؛ لا علاقة لها ببنود التسعير.
كل نموذج على حدة، بما في ذلك النماذج الرائدة، قام بتلفيق أو تطبيق استشهاد خاطئ في مكان ما في الاختبار. هذه ليست مشكلة في أسفل الجدول. النموذج الأكثر دقة في المجال بأكمله لا يزال يحرز 8.41 من أصل 10 فقط. المستوى الأدنى مثير للقلق؛ والمستوى الأعلى ليس آمناً.
للتوضيح، الأدوات الحالية تعاني من نفس الداء. لقد أظهرت الاختبارات المستقلة أن البحث بمساعدة الذكاء الاصطناعي من Westlaw لديه معدل خطأ يبلغ حوالي واحد من كل ثلاثة، و Lexis+ AI أعلى من واحد من كل ستة. لم يقم نموذج أكبر بحل هذه المشكلة، ووفقاً لأدلتنا، لن يحلها.
لا يوجد نموذج واحد يفوز في جميع مجالات الممارسة
قسّم المهام الـ 300 حسب مجال الممارسة ويتغير القائد باستمرار. عبر 51 مجال ممارسة: Claude Opus 4.8 يفوز بـ 30، Grok 4.3 يفوز بـ 13، o3 يفوز بـ 6، و Gemini 3.1 Pro و Sonnet 4.6 يحصل كل منهما على واحد. أبرز النقاط:
- Opus يهيمن على الجوهر النظري: الاندماج والاستحواذ (30.6)، الامتثال التنظيمي (30.5)، الأوراق المالية، الجرائم الجنائية/ذوي الياقات البيضاء، الضرائب، الخدمات المصرفية، خصوصية البيانات، التوظيف، التجارة الدولية.
- Grok يمتلك الإبداع التجاري: قانون الملكية الفكرية/التقنية (30.2)، البيئة/الحوكمة البيئية والاجتماعية وحوكمة الشركات (30.8)، حماية المستهلك، الامتثال/العناية الواجبة (31.4)، الحالات الهامشية.
- o3 يتفوق في العمليات التجارية: العمليات القانونية (31.1)، الأوراق المالية والتمويل (30.9)، العقود الحكومية والمشتريات (31.1)، العقارات العابرة للحدود.
- Gemini 3.1 Pro يحصل على أعلى نتيجة فردية في خصوصية البيانات وحمايتها (31.4).
النتيجة مباشرة: منتج قانوني يعتمد كليًا على نموذج واحد يضحي بالدقة في مجالات ممارسة كاملة. البنية الصحيحة توجه كل مهمة إلى المحرك الأكثر احتمالاً لإنجازها بشكل صحيح - ثم تتحقق من الإجابة قبل إرسالها.
ضريبة زمن الاستجابة والتكلفة
الجودة ليست مجانية وليست موحدة. الفارق هائل: نموذج GPT-5.5 (134 ثانية) و Claude Sonnet 4.6 (102 ثانية) أبطأ بنحو 17 مرة من Grok 4.3 (8.8 ثانية) و Llama 4 Maverick (7.7 ثانية). تتراوح التكلفة لكل مهمة بحدود 90 ضعفًا، من DeepSeek V3.2 بسعر 0.0009 دولار إلى GPT-5.5 بسعر 0.082 دولار. يحقق Grok 4.3 المركز الثاني بسعر 0.003 دولار.
بالنسبة لمنتج قانوني عالي الحجم، يمكن أن يكون النموذج "الأفضل" في لوحة المتصدرين القائمة على الجودة فقط قرارًا تجاريًا خاطئًا. هدف جودة Opus بسرعة وتكلفة Grok هو مشكلة توجيه وتحقق، وليس اختيار نموذج واحد.
عرض على مستوى المزود (مدمج مع كل تشغيل سابق)
لوحة متصدري Legal AI لعام 2026: كل نموذج مصنف حسب متوسط الدرجة
تصنف المهمة المكونة من 300 جزء المذكورة أعلاه 10 نماذج رائدة بناءً على معايير تقييم من 35 نقطة. نحتفظ أيضًا بلوحة متصدرين ثانية وأوسع: تقييم لـ 50 مهمة بناءً على معايير تقييم من 50 نقطة يضيف المنصات المتخصصة في المجال القانوني التي تختصرها معظم الشركات فعليًا (Harvey, CoCounsel, LexisNexis +AI, Legora, Spellbook, Clio Duo) إلى جانب النماذج الرائدة. يتم نشر هذا الجدول بالكامل على صفحة المقارنة الخاصة بنا. هنا تم تصنيفه حسب متوسط الدرجة عبر جميع فئات المهام الـ 11، بحيث يمكنك قراءة رقم واحد لكل نموذج بدلاً من أحد عشر.
| Rank | Model | Avg /50 | Avg % |
|---|---|---|---|
| 1 | HAQQ (Justinian) | 47.5 | 95% |
| 2 | Claude Fable 5 | 44.0 | 88% |
| 3 | Claude Opus 4.7 | 42.1 | 84% |
| 4 | Mike OS | 41.8 | 84% |
| 5 | DeepSeek v4 Pro | 38.2 | 76% |
| 5 | Harvey | 38.2 | 76% |
| 7 | CoCounsel | 36.2 | 72% |
| 8 | Claude + legal plugins | 35.4 | 71% |
| 9 | Legora | 34.5 | 69% |
| 10 | ChatGPT 5.5 | 34.4 | 69% |
| 11 | LexisNexis +AI | 33.2 | 66% |
| 12 | Grok 4.3 | 31.4 | 63% |
| 13 | Gemini 3.1 Pro | 31.1 | 62% |
| 14 | Spellbook | 29.0 | 58% |
| 15 | Perplexity Sonar | 26.5 | 53% |
| 16 | Clio Duo | 25.2 | 50% |
| 17 | Meta Llama 4 | 23.1 | 46% |
| 18 | Mistral 3 | 21.2 | 42% |
| 19 | Qwen 3 Plus | 17.1 | 34% |
ثلاثة أمور توضحها لوحة المتصدرين هذه ولا يمكن لتشغيل الـ 300 مهمة توضيحها. أولاً، تتجمع المنصات القانونية المتخصصة في المنتصف، وليس في الصدارة: Harvey (38.2)، CoCounsel (36.2)، Legora (34.5) و LexisNexis +AI (33.2) جميعها تأتي دون أفضل النماذج الرائدة الخام. ما تدفعه المؤسسة لمزود Legal AI هو سير العمل وغلاف الأمان، وليس درجة أعلى للإجابة نفسها. ثانيًا، DeepSeek v4 Pro يتعادل مع Harvey تمامًا عند 38.2 - وهو نموذج مفتوح المصدر يضاهي شركة Legal AI الأكثر قيمة في العالم من حيث جودة المخرجات المستقلة. ثالثًا، الفارق واسع: النموذج الأدنى (Qwen 3 Plus، 34%) يحقق بالكاد ثلث نسبة HAQQ البالغة 95%، لذا فإن "أي Legal AI" هو قرار حقيقي، وليس رمي عملة.
تدقيق النزاهة: هذه هي لوحة المتصدرين الخاصة بنا، وHAQQ يحتل المركز الأول فيها. تعامل مع ذلك بالطريقة التي يجب أن تتعامل بها مع أي درجة ينشرها البائع - تحقق منها. كل نموذج من النماذج الـ 19 والفئات الـ 11 موجودة على صفحة المقارنة الخاصة بنا لتتحقق منها، ووصف المعايير موضح أدناه. لاحظ أيضًا ما لا يمكن أن تراه درجة المهمة الواحدة: النشر على مستوى الشركة، وشهادات الأمان، وسير العمل التوكيلية عبر آلاف المستندات هي نقاط قوة حقيقية للمنصات المتخصصة التي لا يقيسها هذا الجدول.
جرّب HAQQ AI مجاناً
اختبر الصياغة والبحث القانوني بالذكاء الاصطناعي
كيف نصنف لوحة متصدري Legal AI
معياران يغذيان لوحتي صدارة، ويجب أن تعرف أي واحدة تقرأ.
- تشغيل 300 مهمة رائدة (نص هذا المنشور): 300 مهمة تجارية وعبر الحدود أصلية، 10 نماذج رائدة، تم تقييمها وفقًا لمعايير من 35 نقطة - الجودة، الدقة، السرعة، الأسلوب، الإبداع - عند درجة حرارة 0، وبحد أقصى 6000 رمز إخراج. الأفضل لسؤال 'أي نموذج خام يجب أن أبني عليه.'
- تشغيل 50 مهمة للمنصة (جدول لوحة الصدارة أعلاه، المنشور على /compare-us): 11 فئة مهمة تم تقييمها وفقًا لمعايير من 50 نقطة تغطي الشريعة، القانون، المنتدى، البند، المخاطر، الهلوسة، التنسيق، الإيجاز، جاهزية الشريك، وربط المصادر. يضيف ذلك منصات القطاع القانوني التي تشتريها الشركات بالفعل. الأفضل لسؤال 'أي منتج أو نموذج يجب أن أضعه في القائمة المختصرة.'
كلاهما يتقاسمان نفس القواعد الداخلية. مطالبات متطابقة لكل نموذج. معايير ثابتة ومكتوبة بدلاً من الانطباعات. بيانات منشورة حتى يتمكن أي شخص من تكرار التشغيل والتحقق منا. وكلاهما يقيم جودة الإجابة المستقلة - وهو النطاق الصحيح للوحة الصدارة، والنطاق الخاطئ لقرار الشراء، لأنه لا يمكنه رؤية النشر، أو الوضع الأمني، أو طبقة التحقق التي يلفها منتج قانوني جاد حول النموذج.
لسنا الوحيدين الذين يسجلون النقاط، ولا يجب أن تعتمد على لوحة صدارة واحدة. وجدت دراسة Stanford RegLab المسجلة مسبقًا أن أدوات البحث الحالية تهلوس غالبًا - Westlaw AI-Assisted Research بمعدل واحد من كل ثلاث استعلامات تقريبًا و Lexis+ AI أكثر من واحد من كل ستة. يدير المُقيّم المستقل Vals AI لوحة صدارة قانونية عامة، والتي، اعتبارًا من يونيو 2026، تضع أيضًا Claude Fable 5 في صدارة معيارها للاستدلال القانوني (88.6%)، مع نماذج رائدة تسجل هناك حوالي 80% مقابل 71% للمحامين البشريين في البحث القانوني. معايير مختلفة، مجموعات مهام مختلفة، نفس اتجاه التطور: النماذج الرائدة قوية في الاستدلال وغير موثوقة في الاستشهادات، والفجوة بينها تضيق.
أي Legal AI هو الأفضل للقانون في عام 2026؟ يعتمد الأمر على ما توليه أهمية
لا يوجد 'أفضل Legal AI' واحد، وأي لوحة صدارة تدعي خلاف ذلك تبيع شيئًا ما. اقرأ الجدولين معًا وستجد الإجابة تختلف حسب ما تسعى لتحسينه:
- أفضل جودة إجابة إجمالية: قاد Claude Opus 4.8 تشغيل 300 مهمة رائدة (30.02/35، 130 فوزًا بمهمة). على لوحة صدارة المنصة، يعتبر Claude Fable 5 أقوى نموذج غير HAQQ (44.0/50).
- الأكثر دقة / الأقل هلوسة: GPT-5.5 - أعلى دقة (8.41/10) وأقل معدل استشهاد مهلوس (3%) في تشغيل الـ 300 مهمة، على الرغم من أنه نادرًا ما 'يفوز' بمهمة بشكل صريح.
- أفضل قيمة (السرعة والتكلفة): Grok 4.3 - الثاني في الجودة بسرعة 8.8 ثوانٍ وتقريبًا 0.003 دولار للمهمة الواحدة، مقابل 60.8 ثانية و 0.069 دولار لـ Opus.
- أفضل منصة قانونية متخصصة: يتصدر هارفي مجموعته على مسار الـ 50 نقطة (بمتوسط 38.2)، متفوقًا على CoCounsel و Legora و LexisNexis +AI - ولكن كل منهم يتخلف عن أفضل النماذج الأولية الخام في المخرجات المستقلة.
- الأفضل لمنطقة الشرق الأوسط وشمال أفريقيا، والعمل باللغة العربية والقانون المدني: HAQQ (Justinian) يحتل المرتبة الأولى في قائمة المتصدرين للمنصات (47.5/50) مع دعم اللغة العربية الأصلي وأكثر من 80 ولاية قضائية؛ تحقق من ذلك ومقارنته بالحلول الأخرى على /compare-us.
النقطة الأعمق تبقى حية مع كل إعادة ترتيب للتصنيفات: لا يوجد نموذج واحد يفوز في جميع مجالات الممارسة، 24% من الإجابات الأولية تستشهد بقوانين لا تدعمها، وموقع لوحة المتصدرين هو أصغر جزء من منتج قانوني حقيقي. التوجيه، والتحقق من الاستشهادات، وحوكمة الولاية القضائية هي ما يحوّل رقمًا على الرسم البياني إلى إجابة يمكنك أن تثق بها وتضع اسمك عليها.
تجميع النماذج تحت العلامة التجارية للمزود ودمج هذه الجولة مع كل الجولات السابقة لنفس المعيار التجاري (مؤشر من 0 إلى 100، مرجح بعدد التقييمات):
القمة عبارة عن مجموعة، وليست تتويجًا. اختيارك للمزود يقل أهمية عما تبنيه حوله.
ملاحظة حول نزاهة المعيار
في محاولتنا الأولى، قمنا بتحديد الإجابات بحد أقصى 1,200 رمز (توكن). لقد أدى ذلك بصمت إلى تزوير النتيجة: فقد استهلكت نماذج التفكير الميزانية في "التفكير" وأعادت إجابات فارغة، بينما تم قطع النماذج المطولة في منتصف الجملة وقام المحكم بمعاقبتها. لقد اكتشفنا ذلك، وألغينا الجولة، وأعدنا تشغيلها بشكل موحد بـ 6,000 رمز. اكتسبت معظم النماذج 1.5 - 2.5 نقطة - ولكن Mistral و Llama أصبحا أسوأ مع توفر مساحة أكبر، لأن الطول الإضافي كشف عن المزيد من الاستشهادات السيئة. حدود المخرجات هي عامل خفي يؤثر على النتائج في العديد من لوحات المتصدرين العامة. تحديداتنا معلنة حتى تتمكن من رؤية مكانها بالضبط.
ما تثبته بالفعل 3,000 إجابة مصنفة
طبقة الاستدلال تم حلها إلى حد كبير. تحدد النماذج الأولية المشكلات، وتهيكل التحليل، وتصوغ المسودات مثل مساعد قدير. ما لا يمكنهم فعله بعد هو أن يكونوا موثوقين: أن يستشهدوا بشكل قابل للتحقق، ويرفضوا الأسئلة خارج نطاق الولاية القضائية، وينكروا المسؤولية بشكل مناسب، وأن يكونوا صحيحين بنفس الطريقة مرتين.
هذه الفجوة لا تُغلق بنموذج أكبر. تُغلق بطبقة إضافية:
- التوجيه - أرسل كل مسألة إلى المحرك الأكثر احتمالاً لإنجازها بشكل صحيح.
- التحقق من المراجع - لا يصل أي مرجع غير قابل للتحقق إلى العميل.
- إدارة الاختصاص القضائي - يتم بناء الإجابة الخاصة بالاختصاص القضائي الخاطئ، بدلاً من تصفيتها بعد الحقيقة.
تلك الطبقة هي المنتج. النموذج ليس الحاجز. المدقق هو الحاجز. هذا ما نبنيه في HAQQ.
تنبيهات - لأن المعيار الذي لا يمكنك التحقق منه هو تسويق.
- تشغيل فردي، درجة حرارة 0. تعامل مع التصنيفات على أنها أكثر موثوقية من الكسور العشرية؛ اقرأ Opus و Grok كقائدين مشاركين، وليس نتيجة متقاربة جداً.
- المحكم هو نموذج Claude (Sonnet 4.6). سؤال عادل حول التفضيل الذاتي - باستثناء أن نموذجًا غير Claude (Grok) يتعادل في الصدارة ويحقق GPT-5.5 أعلى دقة، لذا من الواضح أنه لا يقوم بالتقييم بمنحنى منزلي. إعادة التحكيم بواسطة نموذج ثانٍ هي الخطوة التالية لتعزيز الدقة.
- يجمع مؤشر المزود بين معايير التقييم عبر التشغيلات وهو إرشادي.
- يتم نشر كل أمر، وكل إجابة أولية، ورمز التصنيف. استنسخه وتحقق منا.
النقاط الرئيسية
- Claude Opus 4.8 هو أقوى نموذج فردي للعمل القانوني التجاري؛ GPT-5.5 هو الأكثر دقة؛ Grok 4.3 هو الأفضل قيمة.
- 24% من الإجابات القانونية للنماذج الرائدة تستشهد بقوانين لا تدعمها - السقف ليس آمنًا، وليس الأرضية فقط.
- لا يوجد نموذج يفوز في كل مجال ممارسة؛ التوجيه أفضل من الرهان على نموذج واحد.
- تتراوح التكلفة وزمن الاستجابة بين 90 ضعفًا و17 ضعفًا - "الفائز" القائم على الجودة فقط قد يكون خيار عمل خاطئًا.
- الطبقة الدفاعية هي التوجيه + التحقق من الاستشهاد + حوكمة الاختصاص القضائي، وليس النموذج الأساسي.
الجزء الثالث من سلسلة معايير HAQQ، جنبًا إلى جنب مع معيار أسئلة المستهلك القانونية ومعيار HAQQ-LAB للقانون المدني. هل أنت مهتم بكيفية تحويل HAQQ لهذه النتائج إلى منتج يمكن للمحامين اعتماده؟ انظر محرك Justinian.



