خمسة مليارات شخص لا يستطيعون الحصول على مساعدة قانونية. قبل أن نطلب من أي شخص الوثوق بالذكاء الاصطناعي في أسئلته القانونية، كان علينا إثبات أنه يعمل بالفعل. لذا أجرينا الاختبار - 100 سؤال قانوني حقيقي، وثلاثة نماذج رائدة، وإطار تقييم منظم واحد.
الإعداد
قمنا باستخلاص أفضل 100 منشور على الإطلاق من r/legaladvice - أسئلة حقيقية من أناس حقيقيين تغطي نزاعات الملاك والمستأجرين، قانون العمل، معارك الحضانة، الدفاع الجنائي، الإصابات الشخصية، وكل شيء بينهما. متوسط طول المنشور: أكثر من 2,200 حرف من التعقيد القانوني الحقيقي.
حقائق أساسية
- أجتاز Claude Sonnet 4 عدد 88 من أصل 100 سؤال قانوني حقيقي، وGPT-4o 87/100، وGemini 2.5 Flash 78/100 باستخدام نفس التوجيه المتسلسل للتفكير.
- كان البعد الأضعف لجميع النماذج الثلاثة هو التحذيرات المناسبة (3.0–3.15/5) - وليس الدقة القانونية (3.98–4.30/5).
- على 20 سؤالًا جديدًا من r/legaladvice من الـ 48 ساعة الماضية: Claude 95%، GPT-4o 90%، Gemini 85%.
تم اختبار كل سؤال من خلال ثلاثة نماذج رائدة باستخدام نفس التوجيه المتسلسل للتفكير:
- Claude Sonnet 4 (Anthropic)
- GPT-4o (OpenAI)
- Gemini 2.5 Flash (Google)
تلقى كل نموذج نفس المطالبة النظامية: تصرّف كمحامٍ أمريكي متمرس، اتبع عملية تفكير منظمة - حدد الولاية القضائية، واكتشف المشكلات، واستشهد بالقانون المعمول به، وحلل، ثم قدم المشورة.
نفس المطالبة. نفس الأسئلة. ثلاثة محركات مختلفة. دع الإجابات تتحدث.
التقييم
استخدمنا كلود كمُقيِّم منظم، لتقييم كل إجابة بناءً على خمسة أبعاد: الدقة القانونية (هل القوانين المستشهد بها صحيحة؟)، اكتمال المشكلات (هل اكتشفت جميع المشكلات القانونية؟)، جودة الاستدلال (هل سلسلة الاستدلال منطقية؟)، القيمة العملية (هل ستساعد هذه النصيحة شخصًا ما على اتخاذ الخطوات الصحيحة التالية؟)، والتحذيرات المناسبة (هل تنفي المسؤولية بشكل صحيح وتوصي بمحامٍ حقيقي؟).
معايير النجاح: متوسط الدرجة ≥ 3.5/5 ولا يوجد بُعد واحد أقل من 2/5. نعم، استخدام الذكاء الاصطناعي لتقييم الذكاء الاصطناعي يُحدث تحيزًا. سنتناول ذلك أدناه.
النتائج
اجتاز كلود سونيت 4 88 سؤالًا من أصل 100 (88%)، واجتاز GPT-4o 87 (87%)، واجتاز Gemini 2.5 Flash 78 (78%). أظهرت النماذج الثلاثة جميعها استدلالًا قانونيًا سليمًا من الناحية الهيكلية عبر سيناريوهات متنوعة من العالم الحقيقي.
تحليل الأبعاد
تراوحت درجات الدقة القانونية من 3.98 إلى 4.30 من 5. كان اكتمال المشكلات هو الأعلى لـ Gemini (4.82) وكلود (4.58). كانت القيمة العملية أقوى بُعد لكلود بـ 4.73. لكن البُعد الأضعف عبر جميع النماذج - التحذيرات المناسبة - يروي القصة الأكثر أهمية.
ما تعلمناه
1. القدرة الخام متوفرة هنا
حدد كل نموذج المجال القانوني الصحيح، واكتشف القضايا الرئيسية، وقدم نصائح قابلة للتنفيذ في الغالبية العظمى من الحالات. تراوحت درجات الدقة القانونية من 3.98 إلى 4.30 من 5 - عبر 100 سؤال متنوع وواقعي. هذا ليس عرضًا توضيحيًا لعبة. هذا هو استدلال قانوني بمستوى الإنتاج.
2. نقطة الضعف هي التحذيرات، وليست الدقة
كان البعد الأضعف عبر النماذج الثلاثة هو التحذيرات المناسبة (3.0-3.15). كانت النماذج تتعمق في التحليل القانوني المفصل - غالبًا ما يكون صحيحًا - دون الإفصاح بشكل صحيح بأنها لا تقدم استشارات قانونية، أو توصي الشخص بالتشاور مع محامٍ محلي.
هذا هو بالضبط السبب في أن نماذج الذكاء الاصطناعي الخام ليست كافية. النصيحة الصحيحة تقنيًا التي تُقدم بثقة غير مناسبة خطيرة. أنت بحاجة إلى طبقة إضافية - ضمانات، إخلاء مسؤولية، مسارات تصعيد - تحوّل نموذج اللغة إلى أداة قانونية مسؤولة. هذا ما نبنيه في HAQQ.
3. الاتساق يتفوق على ذروة الأداء
حصل Gemini 2.5 Flash على أعلى متوسط درجات للدقة القانونية (4.30) واكتمال القضية (4.82)، ومع ذلك، كان لديه أدنى معدل نجاح (78%). بعض الإجابات كانت مبتورة. وتجاهل البعض الآخر إخلاء المسؤولية بالكامل.
للعمل القانوني، لا يمكنك تحمل نموذج رائع 78% من الوقت وغير موثوق به في البقية. الاتساق هو متطلب المنتج. لهذا السبب لا تعتمد HAQQ على نموذج واحد - نحن نوجه ونصدق ونتحقق عبر محركات متعددة لضمان أن كل مخرج يلبي معيار الجودة قبل أن يصل إلى المستخدم.
جرّب HAQQ AI مجاناً
اختبر الصياغة والبحث القانوني بالذكاء الاصطناعي
4. Claude و GPT-4o متقاربان جدًا
عند 88% مقابل 87%، الفارق ليس ذا دلالة إحصائية. تفوق Claude قليلاً في القيمة العملية (4.73 مقابل 4.21) - نصيحته تضمنت خطوات تالية أكثر تحديداً. كان GPT-4o قوياً بشكل عام ولكنه أقل تنظيماً قليلاً. الخلاصة: اختيار النموذج أقل أهمية مما تبنيه حوله.
سؤال التقييم الذاتي
استخدمنا Claude حكماً للنماذج الثلاثة، بما في ذلك نفسه. القيود المعروفة: ميزة محتملة للملعب المنزلي (قد يفضل Claude أسلوب تفكيره الخاص)، تحيز الأسلوب مقابل الجوهر (قد يكافئ المُقَيِّم الأنماط الهيكلية التي يتعرف عليها)، وعدم وجود حقيقة أساسية (بدون التحقق من قبل المحامي، نحن نقيس توافق آراء الذكاء الاصطناعي، وليس الدقة القانونية).
خطوتنا التالية هي التحقق من قبل المحامي. ولكن حتى مع التقييم الذاتي، الإشارة واضحة: تجاوزت النماذج الرائدة عتبة حيث أصبح تفكيرها القانوني سليماً هيكلياً، ومستنداً جيداً، ومفيداً عملياً في غالبية الحالات.
التحقق المباشر: 20 سؤالاً جديداً
المعيار لأفضل 100 يستخدم مشاركات تاريخية. لإثبات أن هذا ليس مجرد مطابقة أنماط، قمنا بتشغيل نفس المسار على 20 سؤالاً جديداً نُشرت على r/legaladvice في الـ 48 ساعة الماضية. سجل Claude Sonnet 4 نسبة 95%، ووصل GPT-4o إلى 90%، وحقق Gemini 2.5 Flash نسبة 85%. أدت جميع النماذج الثلاثة أداءً أفضل على الأسئلة الجديدة.
ثم أخذنا أفضل إجابة لكل سؤال عبر النماذج الثلاثة، وأعدنا صياغتها بلغة طبيعية، ونشرناها كـ رد. كان الجوهر موجوداً. وكان الشكل إنسانياً.
لماذا يهم هذا لـ HAQQ
هذا ما يثبته هذا المعيار في الواقع: طبقة الذكاء الاصطناعي قد حُلت. يمكن للنماذج أن تستنتج في القانون. يمكنها تحديد المشكلات، والاستشهاد بالقوانين، وتقديم نصائح عملية تصمد أمام التدقيق بنسبة 85-95% من الوقت.
ولكن '85-95% من الوقت' ليس جيداً بما يكفي للعمل القانوني. الفجوة بين نموذج قادر ومنتج قانوني موثوق به هي كل ما نقوم به في HAQQ: توجيه متعدد النماذج (نختار أفضل إجابة عبر النماذج لكل استعلام)، حواجز وقائية وتحذيرات (يتضمن كل رد إخلاء مسؤولية مناسب وتصعيداً للمحامين البشريين)، سياق خاص بالشركة (إجابات خاصة بمجالات ممارسة كل شركة وعملها السابق)، ومصادر موثقة (لا يوجد استشهادات قضائية مختلقة - كل مرجع يمكن تتبعه).
لم يكن السؤال قط 'هل يستطيع الذكاء الاصطناعي القيام بالاستدلال القانوني؟' الإجابة هي نعم - 88 مرة من أصل 100 مع التوجيه الصحيح. السؤال الحقيقي هو: من يبني المنتج الذي يجعله آمنًا ومتسقًا ومفيدًا لـ 5 مليارات شخص يحتاجون إليه؟ هذه هي HAQQ.
المنهجية
- المصدر: أفضل 100 منشور من r/legaladvice (على الإطلاق) + 20 منشورًا جديدًا، تمت تصفيتها للمنشورات النصية الذاتية الجوهرية
- النماذج: Claude Sonnet 4, GPT-4o, Gemini 2.5 Flash - جميعها عبر OpenRouter مع مطالبات نظام متطابقة
- التوجيه: تسلسل الأفكار مع إطار استدلال قانوني منظم من 5 خطوات
- التقييم: Claude Sonnet 4 كمقيّم فردي، 5 أبعاد على مقياس 1-5
- عتبة النجاح: المتوسط ≥ 3.5 والحد الأدنى ≥ 2 عبر جميع الأبعاد
- قابلية الاستنساخ: جميع الأكواد والأسئلة والأجوبة والتقييمات متاحة في مستودع GitHub



