مساران للعناية الواجبة. نفس النموذج، نفس غرفة البيانات، نفس مفتاح الإجابة. أحدهما اكتشف 5 من أصل 5 مشكلات جوهرية مزروعة. والآخر اكتشف 3 من أصل 5. الاثنان اللذان فاتاه هما الاثنان اللذان قد تُفصل بسبب عدم اكتشافهما.
العنوان الرئيسي
المشكلات الثلاث التي اكتشفها كلا المساران كانت واضحة - من النوع الذي يحدده مساعد كفؤ بقلم تحديد أصفر. الاثنان اللذان فاتتهما المطالبة الواحدة تطلبا إما ربط مستندين ببعضهما البعض أو تطبيق معرفة قانونية خارجية على بند يبدو جيداً في ظاهره. هذه هي بالضبط الفئات التي تفشل فيها أدوات العناية الواجبة المدعومة بالذكاء الاصطناعي بصمت، وهي بالضبط الفئات التي يتجاهلها كل عرض بائع للذكاء الاصطناعي في عمليات الاندماج والاستحواذ.
حقائق أساسية
- المطالبة الواحدة اكتشفت 3/5 مشكلات جوهرية مزروعة؛ السرب المكون من 3 وكلاء اكتشف 5/5 - كلاهما بدقة 1.0، ونفس النموذج (Claude Opus 4.7، سياق 1M)، ونفس غرفة البيانات المكونة من 30 مستنداً. يكشف المقال أن الأرقام معايرة بشكل وهمي لإظهار الأداة مفتوحة المصدر.
- تتسع غرفة البيانات المكونة من 30 مستنداً (حوالي 13,200 كلمة / 24,000 رمز) في استدعاء واحد بسياق 1M مع حوالي 976 ألف رمز متبقٍ - حجم السياق لم يكن هو القيد.
- نفذ السرب 32 استدعاءً لنموذج اللغة الكبير (30 باحثاً + 1 محدد للمخاطر + 1 ملخص) بتكلفة تقارب 2-3 أضعاف تكلفة المطالبة الواحدة.
لقد بنينا كلا المسارين، وأجريناهما على نفس البيانات، وجعلنا مفتاح الإجابة عاماً.
لماذا أجرينا الاختبار
كل عرض للعناية الواجبة المدعومة بالذكاء الاصطناعي حضرناه يتجنب نفس السؤال: ما هي البنية؟ مطالبة واحدة ضخمة محشوة بالسياق؟ مسار متعدد الوكلاء؟ استرجاع معزز بالجيل (RAG) على مستندات مقسمة؟ معظم العروض لن تخبرك بذلك. العرض التوضيحي هو مذكرة لامعة ولوحة تحكم. البنية "خاصة".
هذه مشكلة، لأن البنية هي المنتج. مطالبة واحدة ضخمة محشوة بالسياق وسرب مكون من 3 وكلاء يعملان على نفس النموذج ينتجان مذكرات مختلفة بشكل كبير في نفس غرفة البيانات. أردنا قياس مدى هذا الاختلاف الكبير.
لذلك بنينا كليهما. نفس النموذج - Claude Opus 4.7، سياق 1 مليون - نفس المستندات، نفس نظام التقييم. تعكس الاختلافات في المخرجات بنية المطالبة، وليس اختيار النموذج. قامت LLM كقاضٍ بتقييم المخرجات مقابل مفتاح إجابة لمسألة مزروعة كانت تستطيع رؤيته، بينما لم تتمكن خطوط الأنابيب نفسها من ذلك.
ملاحظة قبل الأرقام: هذه تجربة مضبوطة على بيانات اصطناعية. تمت معايرة أرقام خط الأنابيب التجريبي لعرض نظام التقييم من البداية إلى النهاية. ننشرها على أي حال لأن نمط الفشل - المطالبة الواحدة تفقد الربط بين المستندات وقضايا المعرفة الخارجية - هو ما نعتقد أنه يتكرر مع استدعاءات LLM الحقيقية، وتصميم التجربة قابل لإعادة الاستخدام. الكود مفتوح المصدر.
غرفة البيانات
ثلاثون مستندًا بصيغة Markdown، سبع فئات، إجمالي ~13,200 كلمة / 24,000 رمز. صُممت لتعكس كثافة الإشارة في غرفة بيانات علاجية من السلسلة D، بأسماء شركات وهمية واضحة حتى لا يخلطها أحد بتسريب (Acme Sprockets, NorthStar Therapeutics, Helix BioSystems, Meridian Bio).
يتسع النص الكامل في استدعاء واحد لـ Claude Opus 4.7 بسياق 1 مليون مع ~976 ألف رمز إضافي. يزيل هذا العذر الأكثر شيوعًا وراء ضعف أداء المطالبة الواحدة. نحن لا نطلب من النموذج استرجاع معلومات من نص كبير جدًا بالنسبة لسياقه. غرفة البيانات بأكملها موجودة في النافذة.
المسائل الخمس المزروعة
خمس مسائل جوهرية مزروعة في مستندات تبدو عادية - ليست في الرؤوس، وليست مُشار إليها بشكل مباشر. متنوعة عمدًا في صعوبة اكتشافها:
- ثلاث مسائل فردية في المستندات، واضحة للعيان - محفز لتغيير السيطرة في اتفاقية توريد، دعوى مقابلة قضائية تزيد قيمتها عن 10% من سعر الشراء، وتحفظ يتعلق باستمرارية المنشأة في تقرير المدقق. بنود قائمة التحقق. إذا فشلت في قائمة التحقق، تفشل في العناية الواجبة.
- مسألة واحدة عبر المستندات - فجوة في سلسلة ملكية الملكية الفكرية تظهر فقط عند ربط سجل تنازلات الملكية الفكرية (الذي يشير إلى مهندس واحد لديه اتفاقية PIIA مفقودة)، وترخيص رئيسي (يسمي نفس المهندس كمخترع للمنصة المرخصة)، ورسالة عرض عمل ذلك المهندس (التي تقول 'PIIA مرفقة' بدون مرفق). لا يحمل أي مستند بمفرده الإشارة الكاملة.
- مسألة واحدة تتعلق بالمعرفة الخارجية - بند عدم منافسة لمدة عامين على مستوى البلاد يخص كبير المسؤولين العلميين، ويخضع لقانون كاليفورنيا. لمعرفة أنه لا قيمة له، يجب أن تعرف أن المادة 16600 من قانون الأعمال والمهن بكاليفورنيا (California Bus. & Prof. § 16600) تبطل معظم بنود عدم المنافسة للموظفين، وأن AB-1076 (ساري المفعول في يناير 2024) أضافت التزامًا بالإخطار فوق ذلك.
مفتاح الإجابة الكامل بمعايير `يجب اكتشافها` لنموذج اللغة الكبير بصفته قاضيًا موجود في `fixtures/known-issues.md`. لم نظهره لخطوط المعالجة.
خط المعالجة 1: مُوجه واحد
اجمع كل مستند. ضعه في موجه نظام لمحامٍ أقدم. استدعاء واحد لنموذج اللغة الكبير. احصل على المذكرة. هذا ما تبدو عليه معظم عروض 'نحن نستخدم نموذجًا رائدًا بمليون سياق' في جوهرها.
const SYSTEM = `You are a senior M&A diligence attorney reviewing a target
company data room on behalf of an acquirer paying $250M for the entire
company. Your job is to identify every material issue that should be
raised with the deal team.
For each issue, output:
- title (short, specific, name the document and section)
- severity (critical | high | medium)
- rationale (2-3 sentences, ground in document text)
- recommended action (rep, indemnity, condition to closing, walk away)
Be concrete. Cite section numbers and document IDs. A material issue is
one that, if unaddressed, could change deal terms, kill the deal, or
expose the acquirer post-close. Do not include ordinary-course items.`;استدعاء واحد للنموذج. ~24 ألف رمز إدخال، ~3 آلاف رمز إخراج، أقل من 15 ثانية وقت تشغيل فعلي، بضعة سنتات فقط لكل تشغيل. رخيص، سريع، وبسيط هيكليًا.
النتيجة: اكتشاف 3/5. دقة 1.0. المسائل الفائتة: الفجوة في تسلسل ملكية الملكية الفكرية وشرط عدم المنافسة في كاليفورنيا.
لقد أصاب بدقة بند تغيير السيطرة، والتعرض للمساءلة القانونية، وشرط استمرارية النشاط. مذكرة نظيفة وموثقة جيدًا. لا توجد هلوسات. بدا الأمر، بصراحة، جيدًا جدًا - حتى قارنته بمفتاح الإجابة.
خط المعالجة 2: سرب من 3 وكلاء
ثلاثة وكلاء، كل واحد منها عبارة عن استدعاء نموذج منفصل بموجه نظام خاص به:
- الباحث (30 استدعاء متوازي، واحد لكل مستند). ملخص منظم لكل مستند: الأطراف المقابلة، المدة، الشروط الاقتصادية، لغة تغيير السيطرة، الأحكام غير العادية، الأسئلة المفتوحة.
- محدد المخاطر (استدعاء واحد). يقرأ جميع ملخصات الباحثين الثلاثين. يعيد قائمة JSON بالمسائل الجوهرية مع تحديد الخطورة، والأساس المنطقي، ومراجع المصدر.
- ملخص (استدعاء واحد). يحول قائمة العلامات إلى مذكرة لفريق الصفقة.
المجموع: 32 استدعاء لنموذج اللغة الكبير (LLM). تكلفة أعلى - يدفع الباحث رموز الإدخال 30 مرة بدلاً من مرة واحدة. التكلفة الإجمالية تعادل تقريبًا 2-3 أضعاف التكلفة للمطالبة الواحدة اعتمادًا على تفصيل الإخراج.
لاحظ حقل `sources` في مخطط مُحدّد المخاطر. يُلزم المخطط النموذج بتحديد مصدر كل علامة إلى مستند واحد أو أكثر. هذا الاختيار التصميمي الوحيد هو ما يجعل المشكلات عبر المستندات تظهر - يُطلب من النموذج التفكير عبر الملخصات، وليس فقط داخلها.
النتيجة: 5/5 تم اكتشافها. الدقة 1.0.
ما فات المطالبة الواحدة ولماذا
هذا هو الجزء المهم. كلا الإخفاقين بنيويان في بنية المطالبة الواحدة، وليسا فشلاً عشوائيًا.
الإخفاق 1 - فجوة سلسلة ملكية الملكية الفكرية
يسجل سجل تنازل الملكية الفكرية أن المهندس وي لين لديه 'خطاب عرض مُنفّذ في الملف ولكن لا يوجد اتفاقية ملكية فكرية وعمل سري (PIIA) موقعة بشكل مقابل في السجل - يتطلب المتابعة'. يحتوي خطاب العرض على سطر نائب يقول `[PIIA مرفق كملحق A]` بدون ملحق. الترخيص الرئيسي، في مجلد منفصل، يسمي وي لين مخترع المنصة الأساسية المرخصة. اربط النقاط الثلاث وستجد مشكلة حرجة: قد لا يمتلك المشتري فعليًا الملكية الفكرية التي يدفع 250 مليون دولار مقابلها.
يمكن لنموذج المطالبة الواحدة أن يرى جميع المستندات الثلاثة. لكنه لا يربط بينها تحت توجيه 'ابحث عن كل مشكلة جوهرية'. السياقات الطويلة تشوش الربط عبر المستندات - ينتج النموذج فحصًا ممتازًا لكل مستند ولكنه نادرًا ما يتخذ خطوة إضافية لطرح السؤال 'هل المهندس في المستند X هو نفس الشخص في المستند Y، وهل هذا يغير الصورة؟' لا يوجد حافز في المطالبة للقيام بذلك.
اكتشفه السرب لأن مدخلات مُحدّد المخاطر هي ملخصات مهيكلة لكل مستند مع كيانات مسماة ظاهرة. عندما يرى التوجيه بأسلوب الشريك 'مهندس لديه اتفاقية ملكية فكرية وعمل سري (PIIA) مفقودة' في ملخص واحد و'مهندس مسمى كمخترع' في آخر، يكون الربط على بعد خطوة استدلال واحدة، وليس مدفونًا في 24 ألف رمز من نص العقد.
جرّب HAQQ AI مجاناً
اختبر الصياغة والبحث القانوني بالذكاء الاصطناعي
الخطأ الثاني - شرط عدم المنافسة غير القابل للتنفيذ في كاليفورنيا
لدى كبير المسؤولين العلميين شرط عدم منافسة لمدة عامين على مستوى البلاد في اتفاقية توظيفها. القانون الحاكم هو كاليفورنيا. وهي تعيش في بالو ألتو.
لأي شخص قرأ قانون الأعمال والمهن بكاليفورنيا § 16600، فإن البند باطل وظيفياً. القانون AB-1076، الساري اعتبارًا من يناير 2024، زاد من حدته: يجب على أصحاب العمل إبلاغ الموظفين السابقين الذين لديهم مثل هذه الشروط بأن هذه الشروط غير قابلة للتنفيذ، وإلا سيواجهون مسؤولية إضافية.
النموذج ذو الموجه الواحد يعرف هذا. اسأله مباشرة - 'هل شرط عدم المنافسة هذا قابل للتنفيذ في كاليفورنيا؟' - وسوف يخبرك. إنه لا يظهر هذه المعرفة تلقائيًا تحت تعليمات عامة مثل 'ابحث عن كل قضية جوهرية'. يبدو البند جيدًا في ظاهره. لا يوجد شيء في المستند نفسه يصرخ 'اسأل عما إذا كنت قابلاً للتنفيذ'.
اكتشفه السرب لأن موجه نظام تحديد المخاطر يحدد دور النموذج كشريك يطبق عتبة جوهرية عبر الملخصات - وفي هذا الدور، يطرح أسئلة قضائية حول شروط التقييد. مع وكيل أكثر تخصصًا (مراجع متخصص في قانون العمل، أو استدعاء أداة لقاعدة بيانات القوانين)، يصبح هذا حتميًا. باستخدام موجه واحد عام، تكون النتيجة عشوائية.
هذه ليست أنماط فشل غريبة. الربط بين المستندات والمعرفة القانونية الخارجية هما الفئتان اللتان تضيف فيهما العناية الواجبة أكبر قيمة. وهما أيضًا الفئتان اللتان يمنحك فيهما حشو السياق لنموذج رائد أسوأ إحساس زائف بالأمان، لأن المخرجات تبدو شاملة.
المفاضلة بين التكلفة والجودة
الموجه الواحد أرخص وأسرع وينتج مذكرة أكثر تماسكًا. في غرفة تتسع لـ 30 وثيقة، يكون أرخص بحوالي 3 مرات وأسرع بـ 3 مرات من السرب.
السرب يكتشف المزيد، ويترك مسار تدقيق لكل وثيقة، ويتيح لك استبدال وكلاء متخصصين (تنظيم FDA، ERISA، الضرائب، قانون العمل الخاص بالولاية القضائية) دون إعادة كتابة المسار.
متى تبرر الفائدة التكلفة؟
- أقل من 10 مستندات، قيمة الصفقة أقل من 25 مليون دولار، قراءة أولية محدودة زمنياً - موجه واحد (single-prompt) لا بأس به. المساحة السطحية المشتركة بين المستندات صغيرة.
- أكثر من 30 مستندًا، قيمة الصفقة تزيد عن 100 مليون دولار، أي شيء قبل التوقيع - سرب (swarm). فارق التكلفة في صفقة بقيمة 100 مليون دولار لا يذكر مقارنة بقضية جوهرية واحدة لم يتم اكتشافها.
- الصناعات المنظمة (علوم الحياة، الخدمات المالية، الدفاع) - سرب (swarm)، مع وكيل متخصص واحد على الأقل للجهة التنظيمية المعنية.
- أي شيء قد تفقد وظيفتك بسببه إذا فاتك - سرب (swarm).
عند أحجام الصفقات التي صُمم هذا من أجلها، بضعة دولارات إضافية لكل تشغيل هي خطأ تقريبي لا يُذكر مقارنة بتكلفة فقدان إحدى هذه المشكلات عند التوقيع. الوضع الافتراضي هو سرب (swarm). الموجه الواحد (single-prompt) هو أداة فرز، وليس أداة عناية واجبة.
ما يعنيه هذا إذا كنت تشتري ذكاءً اصطناعيًا لعمليات الاندماج والاستحواذ الآن
أربعة أشياء. لا شيء منها يُجامل البائع.
أولاً. لا تثق في 'مساعد العناية الواجبة بالذكاء الاصطناعي' الذي لا يخبرك عن بنيته. إذا كانت الإجابة على 'موجه واحد (single prompt) أم متعدد الوكلاء (multi-agent)؟' هي 'ملكية خاصة'، فابتعد. البنية هي التي تحدد ما يتم اكتشافه.
ثانياً. حشو السياق بموجه واحد (single-prompt) مناسب للمراجعات الضيقة والصغيرة وخطير للعناية الواجبة الأعمق. نافذة سياق بمليون رمز (1M) ليست بديلاً عن الانتباه القسري لكل مستند على حدة. بل إنها تسمح لنمط الفشل بالاختباء بشكل أفضل.
ثالثاً. القضايا المتعلقة بالمستندات المشتركة والمعرفة الخارجية لن تظهر من خلال 'العثور على جميع القضايا الجوهرية' مهما كان حجم سياقك كبيراً. إنها تتطلب توجيهًا متخصصًا للوكلاء، أو استدعاءات أدوات للمصادر الموثوقة، أو تعليمات ربط صريحة بين المستندات. إذا لم يتمكن المنتج من إظهار أي من هذه الإجراءات يقوم بها، فهو لا يقوم بها.
رابعاً. تقييم أساسي في اختبارات القضايا المزروعة، وليس بناءً على الانطباعات. تبدو المذكرة شاملة. لكنها لا تكتشف فجوة الملكية الفكرية. الطريقة الوحيدة لمعرفة ذلك هي تشغيل مفتاح إجابة مقابلها.
ما سنبنيه لـ HAQQ
التجمعات (Swarm) كوضع افتراضي، مع المطالبة الفردية كحل احتياطي موفر للتكلفة للمراجعات الصغيرة أو مراجعات الفرز. وكلاء متخصصون لفئات الفشل التي لا تعالجها التجمعات العامة: رابط عبر المستندات يعدد خرائط الكيان إلى المستندات بشكل صريح قبل الإشارة، ومدقق اختصاص يحدد كل شرط تقييدي، وبند قانون حاكم، وممثل تنظيمي بفحص قابلية الإنفاذ مقابل القانون ذي الصلة.
يبقى معيار القضايا المزروعة مفتوح المصدر. سنستمر في إضافة قضايا - مصائد سلسلة الملكية، تباين جدول رأس المال مقابل 409A، بنود الدولة الأكثر رعاية المخفية، الخطابات الجانبية التي تتعارض مع الاتفاقية الرئيسية - وسننشر الأرقام كلما قمنا بتغيير معماري. إذا أراد بائع أن يدعي أن منتجه أفضل، يمكنه تشغيل نفس الاختبار ونشر الإيصالات.



