Skip to content
    HAQQ
    • الأسعار
    ابدأ مجاناً
    ابدأ مجاناًاحجز عرضاً تجريبياً
    تسجيل الدخول
    1. الرئيسية
    2. المدونة
    3. HAQQ Legal Agent Study: معيار ذكاء اصطناعي قانوني للمهام طويلة المدى
    العودة للمدونةالذكاء الاصطناعي والتقنية القانونية

    HAQQ Legal Agent Study: معيار ذكاء اصطناعي قانوني للمهام طويلة المدى

    1,372 مهمة قانونية طويلة المدى، و24 مجال ممارسة، و~78,000 معيار تقييم، وتصحيح يشترط اجتياز كل البنود. أول معيار لوكلاء قانونيين مبني للقانون المدني ومنطقة الشرق الأوسط.

    ٦ مايو ٢٠٢٦
    11 دقائق للقراءة
    |
    Stephane BoghossianStephane Boghossian
    HAQQ Legal Agent Study: معيار ذكاء اصطناعي قانوني للمهام طويلة المدى

    نقدم دراسة HAQQ لوكلاء القانون - وهو تقييم طويل الأمد مصمم لقياس ما إذا كان وكلاء الذكاء الاصطناعي يمكنهم القيام بعمل قانوني حقيقي من البداية إلى النهاية، وليس فقط الإجابة على الأسئلة التافهة. 1,372 مهمة. 24 مجالاً للممارسة. حوالي 78,000 معيار تقييم من الخبراء. تغطية القانون المدني ومنطقة الشرق الأوسط وشمال إفريقيا (MENA) حسب التصميم.

    عنوان رئيسي

    • 1,372 مهمة قانونية طويلة الأمد عبر 24 مجالاً للممارسة
    • حوالي 78,000 معيار تقييم ذري وثنائي النجاح/الفشل
    • تقييم النجاح الشامل - معيار واحد مفقود يفشل المهمة
    • تم تضمين 6 عائلات ممارسات القانون المدني ومنطقة الشرق الأوسط وشمال إفريقيا (MENA) من الإصدار الأول (v1)
    • أفضل نموذج رائد (Claude Opus 4.7) يحقق 41% نجاحًا شاملاً؛ HAQQ Justinian يحقق 58%
    • في مهام القانون المدني / الشرق الأوسط وشمال إفريقيا (MENA)، يتسع الفارق إلى 71% مقابل 28%

    نقطة تحول وكلاء القانون

    بدأت ملاحظة أندريه كارباثي حول وكلاء البرمجة - التي مفادها أنهم 'لم يكونوا يعملون في الأساس قبل ديسمبر وبدأوا يعملون منذ ذلك الحين' - تنطبق على المجال القانوني. ظل إنجاز المهام القانونية طويلة الأمد ثابتًا لمدة عامين. ثم في أواخر عام 2025، تقاربت نماذج الاستدلال الرائدة، والسياقات الأطول، واستخدام الأدوات الأفضل، والبنية التحتية المناسبة للتقييم. تغيرت القدرات.

    حقائق أساسية

    • دراسة وكيل HAQQ القانوني: 1,372 مهمة قانونية طويلة المدى، 24 مجال ممارسة، حوالي 78,000 معيار تقييم ذري للنجاح/الفشل.
    • أفضل نموذج رائد (Claude Opus 4.7) يجتاز 41% من جميع المعايير؛ HAQQ Justinian يجتاز 58%.
    • في مهام القانون المدني / الشرق الأوسط وشمال إفريقيا، تتسع الفجوة إلى 71% (Justinian) مقابل 28% (أفضل نموذج رائد).

    وصل المجال القانوني إلى هذا المنحنى متأخرًا عن البرمجة لسبب واحد: لم يكن هناك معيار لقياسه. لا يمكنك تتبع نقطة تحول لا تراها. الدراسة هي الأداة التي بنيناها.

    لماذا فشلت المعايير قصيرة المدى

    معظم تقييمات Legal AI - LegalBench, CUAD, LEXam, حتى أعمالنا السابقة - تختبر الاستدلال قصير المدى: قراءة بند، الإجابة على سؤال، تصنيف فقرة. إنها مفيدة، لكنها لا تخبرك بشيء تقريبًا عما إذا كان الوكيل يمكنه فعليًا إنجاز قطعة عمل.

    العمل القانوني الحقيقي لا يشبه الاختيار من متعدد على الإطلاق. يقوم الشريك بإعادة توجيه بريد إلكتروني، ويرفق مجلدًا، ويكتب سطرًا واحدًا: 'ألقِ نظرة وعد بمذكرة بحلول يوم الخميس.' ما يحدث بين ذلك البريد الإلكتروني والمذكرة هو العمل كله - قراءة المسألة، العثور على القضايا المهمة، تجاهل القضايا غير المهمة، صياغة منتج عمل قابل للمراجعة، والتأكد من صحة كل حقيقة.

    هذا ما تقيسه الدراسة.

    كيف تُبنى مهمة الدراسة

    كل مهمة في الدراسة تعكس كيفية سير العمل داخل شركة محاماة. يتلقى الوكيل تعليمات مكتوبة بالطريقة التي يكتبها الشريك - قصيرة، تأكيدية، بدون مواصفات تنسيق. يتلقى بيئة - مسألة عميل تحتوي على المستندات وسلاسل البريد الإلكتروني التي يحتاجها (والكثير مما لا يحتاجه). يجب أن ينتج منتج عمل قابل للمراجعة. ويتم تقييمه بواسطة معايير خبراء.

    • التوجيهات: حوالي 50 كلمة في المتوسط. طلب تأكيدي، لا توجد قائمة مراجعة.
    • البيئة: مجلد القضية الذي يمزج المستندات الجوهرية بضوضاء محيطية. يجب على الوكيل العثور على ما يهم.
    • المخرجات: مذكرة، نسخة معدلة، جدول، مسودة لائحة دعوى، أو إيداع - مهما تطلبه المهمة بالفعل.
    • التحقق: معايير نجاح/فشل ذرية وثنائية، مكتوبة من قبل خبراء. يتم التحقق من كل حقيقة، استشهاد، تصنيف شدة، موعد نهائي، ومبلغ بالدولار.

    كل صف هو ترميز 1:1 لكيفية سير قضية حقيقية عبر شركة: طلب الشريك يصبح توجيهًا، قضية العميل تصبح بيئة، ناتج العمل يصبح مخرجات، مراجعة الشريك تصبح معايير تقييم خبراء. لا يتم تجريد أي شيء لتسهيل المهمة على النموذج.

    نظام الدرجات بالنجاح الشامل

    يتم اعتبار المهمة مكتملة فقط إذا استوفت جميع معايير التقييم. نسمي هذا نظام الدرجات بالنجاح الشامل، وهو أهم خيار تصميمي وحيد في الدراسة.

    تقرير فريق الصفقة الذي يكتشف 8 من 10 مخاطر ليس مفيدًا بنسبة 80%. الاثنان اللذان تم تفويتهما يمكن أن يكونا محفز تغيير السيطرة الذي ينسف الصفقة، أو تأهيل الاستمرارية الذي يعيد تسعير العرض. لا يوجد رصيد جزئي في مراجعة الشريك.

    تشريح معايير التقييم

    معايير التقييم هي الجزء من الدراسة الذي استغرق أكبر عدد من ساعات المحامين لبنائه. لكل مهمة جلسنا مع الممارسين في المجال ذي الصلة وقمنا بتحليل ما سيفحصه الشريك أو العميل بالفعل في المخرجات. كل فحص ذري وثنائي - لا توجد درجات تقديرية، ولا إيماءات LLM-كقاضٍ بشأن الأسلوب.

    المعايير الذرية تفعل ثلاثة أشياء في وقت واحد: تجعل التقييم قابلاً للتكرار عبر مرات التشغيل، وتجعل أخطاء الوكيل قابلة للتصحيح (ترى بالضبط أي فحص تعطل ولماذا)، وتتضاعف كإشارات مكافأة للضبط الدقيق. نفس المعيار الذي يقيم نموذجًا يمكنه تدريب النسخة التالية منه.

    24 مجالًا للممارسة - بما في ذلك القانون المدني ومنطقة الشرق الأوسط وشمال إفريقيا (MENA)

    تهيمن مهام القانون العام الأمريكي على المعايير القانونية الحالية. هذا جيد لما هي عليه، لكنه ليس العالم الذي يمارس فيه معظم عملائنا. تغطي الدراسة (الإصدار 1) 24 مجالًا للممارسة، ستة منها صراحةً قانون مدني ومنطقة الشرق الأوسط وشمال إفريقيا (MENA): صياغة القانون المدني العربي، والامتثال للشريعة، وشركات دول مجلس التعاون الخليجي، ونزاعات البناء، والأحوال الشخصية، وعمل منطقة الشرق الأوسط وشمال إفريقيا (MENA).

    بدأنا من قضايا حقيقية - مجهولة الهوية ومنقاة - تعامل معها محامون ممارسون عبر قاعدة عملائنا. قسمنا كل قضية إلى المهام المنفصلة التي سيتم تفويضها فعليًا لمساعد محامٍ. المجالات الـ 24 ليست شاملة. ستضيف الإصدارات المستقبلية تحكيم البناء، وتنظيم التكنولوجيا المالية، وESG، وسير العمل الداخلي.

    مثال: مراجعة تغيير السيطرة

    تطلب إحدى مهام الاندماج والاستحواذ للشركات من الوكيل تحليل بنود تغيير السيطرة عبر غرفة بيانات افتراضية للاستحواذ (الخيالي) على Crestview Software Solutions في صفقة بقيمة 458 مليون دولار أمريكي بأسهم كاملة. تحتوي غرفة البيانات على ثمانية عقود أساسية بالإضافة إلى ملفات مجاورة - 10-K، خطة تعويضات مؤجلة، محاضر مجلس الإدارة - قد تكون ذات صلة أو لا تكون.

    أدناه عرض الإدخال الكامل كما يراه الوكيل - الطلب، سياق الصفقة، العقود الأساسية، مواد غرفة الصفقات الأوسع، والمخرجات المطلوبة. كل إدخال يمثل تلميحًا ومشتتًا للانتباه: يجب على الوكيل استخدام حقائق المذكرة، ولكن يجب عليه أيضًا فصل المهمة الأساسية عن الملفات الهامشية مثل مسودات خطابات العرض والسير الذاتية للفريق التي لا تغير التحليل.

    يجب على الوكيل تحديد الملفات المهمة، وقراءتها في سياقها، وتجميع الأحكام ذات الصلة عبر القضية. المخرجات المطلوبة هي مذكرة فريق الصفقة مع ملخص تنفيذي، وتحديد المخاطر، وتحليل عقد بعقد، وتصنيفات الخطورة، وتوصيات التخفيف.

    تحتوي معايير التقييم لهذه المهمة الواحدة على 57 معيارًا - تغطي تسع قضايا قانونية مطروحة، والحقائق الأساسية وراء كل منها، وتصنيف الخطورة، والتعرض المالي، والإجراء الموصى به. إذا فات أحد هذه التسعة، تفشل المهمة.

    جرّب HAQQ AI مجاناً

    اختبر الصياغة والبحث القانوني بالذكاء الاصطناعي

    ما يتم إدخاله، وكيف يتم تقييمه

    المسائل التسع المدرجة في هذه المهمة الواحدة ليست مصائد كلمات مفتاحية سطحية. تتطلب من الوكيل ربط الحقائق عبر المستندات، استنتاج المسببات من التعريفات، تحديد حجم التعرض المالي بالدولار، والتوصية بالإجراء القانوني الصحيح التالي. مرر مؤشر الماوس فوق أي مسألة لترى ما يجب على الوكيل اكتشافه واختبار الوحدة الذي يطبقه المعيار على التسليم.

    نتائج خط الأساس للإصدار الأول

    أجرينا الدراسة (الإصدار الأول) على ستة أنظمة رائدة: HAQQ Justinian، Claude Opus 4.7، GPT-5.2، Gemini 3.1 Pro، Grok 4.1، و Mistral Large 3. تم محاولة كل مهمة ثلاث مرات؛ ونحن نبلغ عن أفضل معدل نجاح شامل من أصل ثلاث محاولات. تنقسم الأرقام الرئيسية بوضوح حسب الفئة.

    سادت نمطان عبر مجموعة البيانات.

    • تعمل النماذج الحدودية العامة بشكل جيد في الاستدلال المعزول وبشكل سيء في المهام طويلة الأمد. إنها تفقد السياق، وتختلق روابط عبر المستندات، وتنتج مخرجات تبدو واثقة لكنها تفشل في فحوصات المعايير المتعلقة بالحقائق والمراجع.
    • الوكلاء المدربون على مجال معين (Justinian والأنظمة المتخصصة المماثلة) يسدون الفجوة في الإنجاز طويل الأمد - خاصة في صياغة القانون المدني، حيث تميل النماذج العامة إلى هياكل القانون العام وتفشل في التفاصيل الإجرائية.

    مصفوفة القدرات - ما يمكن لكل نموذج إنجازه فعليًا

    تخفي الدرجات الإجمالية السؤال التشغيلي الذي يطرحه كل شريك في مكتب محاماة: ما هي أنواع العمل التي يمكنني تفويضها بالكامل، وما هي التي تحتاج إلى محامٍ للمراجعة، وما هي التي لا يجب أن أتعامل معها؟ تجيب المصفوفة أدناه على ذلك عبر 24 عائلة مهمة.

    لماذا يهم هذا مكاتب المحاماة

    إذا كنت تقوم بتقييم مورد للذكاء الاصطناعي وعرضوا عليك عرضًا توضيحيًا واثقًا على مستند واحد، اسألهم عن شكل معدل إنجازهم للمهام طويلة الأمد في قضية حقيقية. اسألهم عن معدل النجاح الشامل لديهم وفقًا لمعيار يتكون من 50 نقطة لتلك القضية. اسألهم عن مجالات الممارسة التي يغطونها بالكامل مقابل مجرد المساعدة.

    هذه هي الأسئلة التي صُممت الدراسة للإجابة عليها - بشكل علني، وقابل للاستنساخ، وبمعايير تقييم يمكن لأي شريك مراجعتها.

    ما هو مفتوح وما هو التالي

    • عائلات مهام v1 وتنسيق معايير التقييم موثقة وسيتم إطلاقها للعملاء والشركاء البحثيين بموجب ترخيص تقييمي.
    • سنقوم بنشر منهجية تسجيل نقاط موحدة ولوحة صدارة أساسية بمجرد حصولنا على النتائج من جميع النماذج الرائدة الرئيسية.
    • سيضيف v2 التحكيم في منطقة الشرق الأوسط وشمال أفريقيا، ونزاعات البناء، وسير عمل المستشارين القانونيين الداخليين، وصياغة أوسع للقانون المدني باللغتين العربية والفرنسية.
    • نحن نعمل على تطوير امتدادات بالتعاون مع مكاتب محاماة مختارة - إذا كنت ترغب في المساهمة بعائلات مهام من ممارستك، تواصل معنا.

    الأعمال السابقة تقوم بعمل أكثر إثارة للاهتمام من أي وقت مضى - LegalBench و BigLaw Bench ومعيار وكيل الذكاء القانوني الذي أصدرته Harvey مؤخرًا كلها تدفع هذا المجال إلى الأمام. مساهمة HAQQ هي المحور متعدد اللغات، والقانون المدني، والشرق الأوسط وشمال أفريقيا أولاً الذي كان مفقودًا.

    جربها

    إذا كنت ترغب في رؤية كيفية أداء Justinian في المهام طويلة الأجل من ممارستك، تحدث إلى فريقنا. سوف نقوم بتشغيل مشروع تجريبي سري ومُقيّم بالمعايير حول مسألة منقحة من مكتبك.

    • تحدث إلى فريقنا
    • اطلع على معايير Justinian
    • قارن HAQQ

    شكر وتقدير

    هذه الدراسة هي نتاج عمل العديد من الأشخاص داخل HAQQ وعبر شبكة ممارسينا. وقد تولى فريق هندسة HAQQ Justinian القيادة التقنية للمنصة، وصندوق اختبار الوكيل، وتشغيل مقاييس التقييم، بينما قاد فريقنا للبحث القانوني التطبيقي تصميم المهام وتوليد القضايا. وبنت فرق الأمن ومنصات الذكاء الاصطناعي لدينا بيئة التنفيذ المعزولة التي تتيح لنا تشغيل الوكلاء مقابل قضايا تركيبية دون تسريب بيانات العملاء. وشكلت فرق العلامة التجارية والمنتج لدينا كيفية إيصال النتائج للمشترين القانونيين غير التقنيين.

    خارج HAQQ، نحن ممتنون للمحامين الممارسين - في منطقة الشرق الأوسط وشمال إفريقيا والاتحاد الأوروبي والمملكة المتحدة - الذين ساهموا بقضايا مجهولة الهوية، وصاغوا مقاييس التقييم في مجالات ممارستهم، واختبروا مجموعات المهام الأولية. كما نشكر الباحثين الأكاديميين الذين راجعوا منهجيتنا وفرق الأعمال السابقة التي تقف وراء LegalBench وBigLaw Bench وCUAD وLEXam ومعيار الوكيل القانوني الخاص بـ Harvey، والذين جعل عملهم المنشور تصميم هذا المعيار أسرع وأفضل.

    قراءة ذات صلة

    • HAQQ-LAB، معيار القانون المدني مفتوح المصدر الخاص بنا
    • معيارنا المكون من 3000 إجابة لـ 10 نماذج رائدة
    • مشهد Legal AI مفتوح المصدر، بما في ذلك المعايير المفتوحة
    S

    Stephane Boghossian

    Head of Growth

    موارد ذات صلة

    JustinianLegal AI ChatCompare HAQQSecurity

    مقالات ذات صلة

    معيار الذكاء الاصطناعي القانوني للقانون المدني: لماذا بنينا HAQQ-LAB

    معيار الذكاء الاصطناعي القانوني للقانون المدني: لماذا بنينا HAQQ-LAB

    لماذا يخذل ChatGPT المحامين: ملاحظات من 3 محامين أمريكيين

    لماذا يخذل ChatGPT المحامين: ملاحظات من 3 محامين أمريكيين

    الذكاء الاصطناعي القانوني العربي: الفجوة في الاسترجاع لا في المحتوى

    الذكاء الاصطناعي القانوني العربي: الفجوة في الاسترجاع لا في المحتوى

    الأسئلة الشائعة

    What is the HAQQ Legal Agent Study?

    A long-horizon evaluation measuring whether AI agents can do real legal work end-to-end, not just answer trivia: 1,372 tasks across 24 practice areas graded against ~78,000 atomic, binary pass/fail rubric criteria, with civil-law and MENA coverage by design.

    What is all-pass grading in legal AI evaluation?

    A task is marked complete only if every rubric criterion passes — one missed criterion fails the task. The article's rationale: 'A deal-team report that catches 8 of 10 risks is not 80% useful... There is no partial credit on the partner's review.'

    How do frontier AI models score on long-horizon legal work?

    In the v1 baseline, the best frontier model (Claude Opus 4.7) clears 41% all-pass while HAQQ Justinian clears 58%; on civil-law and MENA tasks the gap widens to 71% vs 28%. Six systems were tested (Justinian, Claude Opus 4.7, GPT-5.2, Gemini 3.1 Pro, Grok 4.1, Mistral Large 3), best-of-three per task.

    How is this different from LegalBench or CUAD?

    LegalBench, CUAD, and LEXam test short-horizon reasoning — read a clause, answer a question. Study tasks mirror how work actually arrives: a ~50-word partner-style instruction plus a matter folder mixing material documents with noise, requiring a reviewable work product (memo, redline, draft pleading) graded by expert rubric.

    ما التالي؟

    جرّب HAQQ AI مجاناً

    اختبر الصياغة والبحث القانوني بالذكاء الاصطناعي

    احسب عائد الاستثمار

    اكتشف كم من الوقت والمال يوفره HAQQ لمكتبك

    تصفح 380+ أمر قانوني

    أوامر جاهزة للاستخدام لكل مهمة قانونية

    العودة للمدونة

    المقال السابق

    هل يستطيع الذكاء الاصطناعي تخطيط التقاضي؟ بنينا مخطط GOAP لنكتشف

    المقال التالي

    مولّد الوصايا بالذكاء الاصطناعي: كيفية صياغة وصية وفق الاختصاص القضائي باستخدام HAQQ

    ضع هذا موضع التنفيذ

    اسأل HAQQ السؤال الذي أثاره هذا المقال لديك.

    HAQQ across all devices
    HAQQ Legal AI Platform Logo

    توأمك القانوني بالذكاء الاصطناعي ونظام إدارة المكتب للصياغة والفوترة والفوز.

    Download on theApp StoreGet it onGoogle Play

    الوثائق

    • الوثائق يفتح في علامة تبويب جديدة
    • البداية يفتح في علامة تبويب جديدة
    • الصحافة يفتح في علامة تبويب جديدة
    • تحديثات المنتج يفتح في علامة تبويب جديدة
    • الحالة يفتح في علامة تبويب جديدة
    • الأمان
    • الأسئلة الشائعة يفتح في علامة تبويب جديدة
    • المجتمع يفتح في علامة تبويب جديدة
    • الدعم يفتح في علامة تبويب جديدة

    الأكاديمية

    • الدورة يفتح في علامة تبويب جديدة
    • المهارات يفتح في علامة تبويب جديدة
    • البنود يفتح في علامة تبويب جديدة
    • مكتبة الأوامر يفتح في علامة تبويب جديدة
    • الأدوات يفتح في علامة تبويب جديدة
    • مركز الأبحاث يفتح في علامة تبويب جديدة
    • المستندات يفتح في علامة تبويب جديدة

    الموقع الإلكتروني

    • eFirm
    • الدردشة القانونية بالذكاء الاصطناعي
    • تطبيق الهاتف
    • محرك جستنيان
    • HAQQ eBar
    • HAQQ eWallet
    • الأسعار
    • قارننا
    • الحلول
    • المدونة
    • تعرف على الفريق
    • انضم إلينا يفتح في علامة تبويب جديدة
    افتح التطبيق
    • اللغاتar en fr es it de pt
    • التواصلinfo@haqq.ai
    • الحالةيعمل·راسخ
    • شروط الخدمة
    • سياسة الخصوصية
    • سياسة ملفات تعريف الارتباط
    • معالجة البيانات يفتح في علامة تبويب جديدة
    • humans.txt يفتح في علامة تبويب جديدةlawyers.txt يفتح في علامة تبويب جديدةsecurity.txt يفتح في علامة تبويب جديدة
    © 2026 HAQQ Inc. جميع الحقوق محفوظة.المنتج مطوّر داخلياً بالكامل من قبل HAQQ. الموقع الإلكتروني مبني بأدوات ويب حديثة.

    Long-horizon legal agent capability over time

    % of Study-equivalent tasks passing all-rubric
    HAQQ Justinian
    Frontier general LLM
    Open-source baseline
    Agentic inflection0%20%40%60%Q1 23Q3 23Q1 24Q3 24Q1 25Q3 25Q1 26Q2 26GPT-4 releaseClaude 3.5 Sonneto1 / agentic eraJustinian v158%41%21%

    Same curve shape Karpathy described for coding agents - flat for ~24 months, then a sharp turn around Q1 25 once tool-use and long-horizon planning matured. Legal hit it later because evaluation infrastructure didn't exist.

    Mirroring Real Legal Work

    Instruction
    Partner request to associate
    ~50 words. Affirmative ask, no spec.
    Environment
    Client matter / data room
    Mix of relevant + peripheral files.
    Output
    Reviewable work product
    Memo, redline, table, draft pleading.
    Verification
    Expert rubric grading
    Atomic pass/fail criteria.

    Mirroring Legal Work

    Law Firm Work
    How legal work is delivered in practice
    Partner Request
    A partner asks an associate to complete a legal task.
    →
    Client Matter
    The matter materials define the facts, documents, and context.
    →
    Legal Work Product
    A memo, markup, schedule, deck, or other finished deliverable.
    →
    Partner Review
    The work is checked for format, facts, analysis, and judgement.
    HAQQ Legal Agent Study
    The same workflow encoded for agents
    Instructions
    A partner-style request states what the agent must do.
    →
    Environment
    A closed universe of synthetic, human-reviewed matter materials.
    →
    Output
    The agent must produce real legal work product.
    →
    Expert Rubric
    Grades the output for format, facts, and analysis.
    Each row is a 1:1 encoding of how a real matter moves through a firm.

    All-Pass Grading

    M&A change-of-control rubric
    1
    2
    3
    4
    5
    6
    7
    8
    9
    10
    Awaiting agent output

    A deal-team report that catches 8 of 10 risks is not 80% useful. The two missed could change deal economics or surface post-close.

    Rubric Anatomy - 57 atomic criteria

    M&A change-of-control task
    Sample criterion - Issue identification
    "Pinnacle license converts exclusivity to non-exclusivity on CoC"

    24 practice areas — 1,469 tasks

    Click a category to filter
    Transactional5 areas
    467 tasks
    Corporate M&A142
    Capital Markets98
    Private Equity87
    Banking & Finance76
    Real Estate64
    Advisory4 areas
    240 tasks
    Tax71
    IP & Patents62
    Employment58
    Privacy & Data49
    Regulatory5 areas
    195 tasks
    Securities Reg.54
    Antitrust41
    Sanctions / OFAC38
    AML / KYC33
    Healthcare Reg.29
    Litigation4 areas
    245 tasks
    Commercial Lit.95
    Arbitration67
    White Collar44
    Bankruptcy39
    MENA6 areas
    322 tasks
    Civil-Law Drafting88
    GCC Corporate71
    Sharia Compliance52
    Labour (MENA)47
    Construction Lit.36
    Family / Personal Status28

    Data Room Composition - what the agent must navigate

    16 files, 6 carry signal
    Material
    Cross-document
    External-knowledge
    Peripheral / noise
    Master Services Agmt.
    CoC consent required
    Pinnacle License
    Exclusivity flips on CoC
    Supply Agmt. v3
    Termination on transfer
    Engineer offer letter
    PIIA missing - links to IP gap
    IP Assignment Log
    Names same engineer
    CSO employment agmt.
    2-yr non-compete (CA, void)
    10-K (most recent)
    -
    Board minutes Q3
    -
    Deferred comp plan
    -
    Tax opinion 2024
    -
    Audit letter
    -
    Cap table v12
    -
    Prior NDA
    -
    Vendor MSA template
    -
    Office lease
    -
    Insurance policy
    -

    Example: M&A Change-of-Control Task

    USD 458M acquisition
    Input component
    What the agent sees
    What the agent must do
    Partner request
    "Review the attached acquisition data room and prepare a comprehensive deal-team report."
    Infer the expected work product: issue spotting, contract analysis, risk ranking, financial computation, and synthesis.
    Deal context
    • Acquisition Memo.pdf
    Use the memo's facts to decide whether contract provisions are triggered, then locate where they apply across the deal.
    Core material contracts
    • Asset Purchase Agreement
    • Credit Facility
    • Master Services Agreement
    • Customer License Agreement
    • Employment Agreement - CEO
    • Employment Agreement - CFO
    • Reseller Agreement
    • Commercial Lease
    Find CoC definitions, assignment clauses, consent waivers, termination rights, and payment obligations.
    Broader deal-room material
    • Disclosure Schedules.pdf
    • Side Letter - 2023.pdf
    • Draft Bid Letter.docx
    • Engagement Letter.pdf
    • Term Sheet - v3.pdf
    • Deal Team Bios.pdf
    Separate the core assignment from background material, while still surfacing facts from the periphery that affect the analysis.
    Request output
    • coc-analysis-report.docx
    Produce finished work-product that a supervising lawyer could review - not a list of bullet points or extracted facts.

    Evaluating a Task: 9 Planted Legal Issues

    57 atomic rubric criteria
    TerraNode consent risk
    What the agent must figure out

    A portfolio-company conflict may let TerraNode withhold consent to the deal.

    Example legal unit tests

    Connect CloudSpan to TerraNode's direct-competitor carve-out. Rate the issues Critical and recommend early consent engagement.

    Legal Agent Study v1 — All-pass leaderboard

    % of long-horizon tasks where every rubric criterion passes (best of 3)

    Sort:
    0
    25
    50
    75
    100
    1HAQQ JustinianLEAD
    58%
    +36
    2Claude Opus 4.7
    41%
    +23
    3GPT-5.2
    38%
    +21
    4Gemini 3.1 Pro
    33%
    +18
    5Grok 4.1
    24%
    +12
    6Mistral Large 3
    19%
    +10
    Best on slice
    HAQQ Justinian · 58%
    Spread (best vs last)
    39 pts
    Median Δ vs prior gen.
    +20 pts

    Light grey bar = same model's prior-generation baseline (12-month look-back). Best of 3 runs per task on synthetic + anonymized matters.

    Do all
    14
    Do some
    7
    Cannot do
    3
    Across 24 practice areasEnd-to-end task completion