العودة إلى المكتبة
الاستراتيجية

أرخص بنسبة 30% لكل مهمة مقابل 7 أضعاف الرموز: داخل فخ كفاءة Sonnet 5.5

آخر تحديث: 2026年9月27日

النقاط الرئيسية

  • عنوان Sonnet 5.5 «أقل بنسبة تصل إلى 30% لكل مهمة» يصمد عند مستويات الجهد المنخفض والمتوسط لكنه ينقلب عند الحد الأقصى: فرضت Anthropic جدول الأسعار ذاته ($2/$10) بينما استهلك النموذج نحو 193,000 رمز إخراج لكل مهمة في المؤشر — أثقل استهلاك رموز لمسه Artificial Analysis على الإطلاق — ليكون التكلفة المقيسة 7.60 دولار لكل مهمة، أعلى بنحو 50% من Sonnet 5 و27% من 5.98 دولار لـ Opus 5.5 (Anthropic، 28 سبتمبر؛ Artificial Analysis، 28 سبتمبر).
  • أنتجت نافذة الإطلاق ذاتها استراتيجيتين متناقضتين: خفضت OpenAI أسعار GPT-6 Sol/Luna بنسبة 50% إلى $2/$10 و$0.10/$0.50 لكل مليون رمز في 22 سبتمبر — إذ بلغت تكلفة GPT-6 Sol عند الحد الأقصى 1.06 دولار لكل مهمة في مؤشر الذكاء، أي أقل بنحو 50% من سابقتها — بينما أبقت Anthropic جدول أسعار Sonnet ثابتًا وتركت فاتورة الرموز ترتفع (OpenAI؛ Artificial Analysis).
  • سلك Opus 5.5 (22 سبتمبر) طريقًا ثالثًا: خصم 20% على السعر الظاهر وخصم 60% على قراءة الذاكرة المخبئية (من $0.50 إلى $0.20 لكل مليون)، مستهدفًا البند الذي تسيطر عليه أحمال الوكلاء — ولهذا تحتكر تكلفته المقيسة البالغة 5.98 دولار لكل مهمة أختها الأصغر عند أقصى جهد (Anthropic؛ Finout).
  • عند الجهد المرتفع إلى الحد الأقصى، يقع Sonnet 5.5 خارج خط كفاءة التكلفة: يقدم GPT-6 Sol ذكاءً شبه متساوي «بنفس التكلفة لكل مهمة تقريبًا»، ويؤدي GPT-6 Luna عند الحد الأقصى عملًا بذكاء معادل مقابل 0.07 دولار لكل مهمة — أي نحو المئة واحدة من فاتورة Sonnet 5.5 عند الحد الأقصى (Artificial Analysis، 28 سبتمبر).
  • شهد نحو 180 من 672 نموذجًا مرصودًا تغيرًا سعريًا في سبتمبر — أصبح جدول الأسعار خطرًا شهريًا، والوكيل الذي يذكر عقده تسعير الرموز فقط لا دفاع له ضد تبديل لم يوافق عليه قط (pricepertoken، 28 سبتمبر؛ وتراجع التوجيه التلقائي في DeepSeek هو المثال المدروس).

أطلقت Anthropic نموذج Claude Sonnet 5.5 في 28 سبتمبر بأنقى ادعاء تكلفة في السوق: «إنها ترقية واضحة على Claude Sonnet 5، وتعمل أسرع بنسبة 30% فأكثر، وتكلف أقل بنسبة تصل إلى 30% في معظم الأعمال.» كل كلمة قابلة للتبرير — لكن الآلية ليست ما يوحي به العنوان. جدول الأسعار لم يتحرك: دولاران لكل مليون رمز إدخال، 10 دولار للإخراج، 0.20 دولار لقراءة الذاكرة المخبئية، مطابق لـ Sonnet 5. ما تغيّر هو فاتورة الرموز، وتحركت عكسيًا مع الادعاء عند مستوى الجهد الذي تستخدمه أعمال الوكلاء فعلًا. شغّلت Artificial Analysis النموذج في يوم إطلاقه: عند الحد الأقصى للجهد استهلك Sonnet 5.5 نحو 193,000 رمز إخراج لكل مهمة في مؤشر الذكاء — أعلى ما سجلته اختباراته على الإطلاق، نحو 60% فوق Opus 5.5 عند الحد الأقصى وسبعة أضعاف GPT-6 Astra تقريبًا — لتصبح التكلفة المقيسة 7.60 دولار لكل مهمة (Artificial Analysis، 28 سبتمبر؛ وسجلها فريق kingy.ai أولًا: «Sonnet 5.5 رخيص لكل رمز لكنه قد يكون باهظًا لكل مهمة»).

في ذاته، هذه غرابة نموذج واحد. لكنه، مقارَبًا بنافذة الأسبوعين ذاتها يصبح مفترق طرق الصناعة. في 22 سبتمبر خفضت OpenAI أسعار GPT-6 Sol وLuna بنسبة 50% (OpenAI) وخفضت Anthropic قراءة الذاكرة المخبئية لـ Opus 5.5 بنسبة 60% (Anthropic). بعد ستة أيام، سعرت Anthropic دخولها «أرخص بنسبة 30%» نفس حجم الرموز الذي يبيعه المنافسون بنصف المعدل — واشترت المركز الثاني في المؤشر بصرف الرموز لا بشرائها بأرخص سعر. ثلاث استراتيجيات إطلاق تتنافس الآن على المقياس نفسه، التكلفة لكل مهمة، وتتباعد أكثر ما تتباعد حيث يعيش دليل شراء الاستدلال بالضبط. يرسم هذا المقال الاستراتيجيات الثلاث مقابل أرقام Artificial Analysis المقيسة، ويحسب رياضيات كفاءة الرموز التي يخفيها جدول أسعار الرمز الواحد، ويختم بالبنود التعاقدية الأربعة التي تمنع تبديل النموذج القادم من إعادة تسعير فاتورة وكيلك بصمت.

الادعاء والآلية والقياس

ادعاء Anthropic يخص الكفاءة، وصفحة الإطلاق صريحة حول الآلية: النموذج «يحتاج عادة إلى رموز أقل بكثير لإنجاز العمل نفسه. في اختباراتنا، يكلف أقل بنسبة تصل إلى 30% لكل مهمة من سابقه». وهذا صحيح على توزيع اختبارات Anthropic ذاته وبالإعدادات التي اخترتها Anthropic — فالشركة تقر أن Sonnet 5.5 يتخطى أفضل درجات Sonnet 5 المعيارية «بنحو عُشر التكلفة لكل مهمة» عند جهد منخفض ومتوسط (بحسب ملخص kingy.ai). إذا كانت حِملتك تشتغل خفيفة وبشكل Anthropic — مسودات قصيرة، تصنيف، بحث محدود — فالمرجح أن يصمد الادعاء في فاتورتك.

أحمال الوكلاء ليست ذلك التوزيع. يشغّل مؤشر الذكاء من Artificial Analysis مهام متعددة الخطوات عند خمسة مستويات جهد، ويصعّد الاستدلال التكيفي للنموذج الجهد في المهام الصعبة. عند قمة ذلك المدى تنفجر فاتورة الرموز: نحو 193 ألف رمز إخراج لكل مهمة عند الحد الأقصى، مقابل نحو 120 ألف لـ Sonnet 5 وOpus 5.5 عند الحد الأقصى (~+60%) ونحو 27 ألف لـ GPT-6 Astra (نحو 7 أضعاف). حجم الرموز هو النقطة — سجل Sonnet 5.5 (الحد الأقصى) 56 في المؤشر، أي نقطتين خلف 58 لـ Opus 5.5، مع 64% في Terminal-Bench 4.0، أعلى بقليل من Opus 5.5 وGPT-6 Astra. يبلغ تلك القدرة بالتفكير أطول في كل خطوة، وتُحسب رموز الإخراج بعشرة دولارات لكل مليون مهما كان تبرير كل رمز منها. تكمل حاشية احتياطية الآلية: التوجيه التكيفي الافتراضي لدى Anthropic «يرجع في نحو 0.1% من المهام... مع العودة إلى Sonnet 5 في جميع الحالات» — استبدال آخر محايد مع جدول الأسعار لا يراه المشغّل إلا في الفاتورة (Artificial Analysis).

التكلفة لكل مهمة هي المقياس الوحيد الذي يصمد أمام هذه البنية، لأنها تركّب جدول الأسعار مع فاتورة الرموز. القياسات في اليوم نفسه، جميعها تكلفة لكل مهمة على مؤشر الذكاء عند أقصى جهد:

النموذج (الحد الأقصى) السعر الظاهر ($/M إدخال/إخراج) رموز الإخراج لكل مهمة التكلفة المقيسة لكل مهمة استراتيجية الإطلاق
Claude Sonnet 5.5 $2 / $10 ~193k 7.60 دولار القيادة بالقدرة: جدول ثابت، فاتورة رموز صاعدة
Claude Opus 5.5 $4 / $20 (مخبأ $0.20) ~120k 5.98 دولار القيادة بالمخبأ: ظاهر −20%، بند الوكيل −60%
Claude Sonnet 5 $2 / $10 ~120k ~5.00 دولار خط الأساس
GPT-6 Sol $2 / $10 ~31k 1.06 دولار القيادة بالسعر: ظاهر −50%
GPT-6 Luna $0.10 / $0.50 ~51k 0.07 دولار القيادة بالسعر: سعر أرضي

(نقاط مؤشر الذكاء من AA إصدار v4.x: Sonnet 5.5 بـ 56 في المرتبة الثانية؛ Opus 5.5 بـ 58 في المركز الأول؛ GPT-6 Sol ما يعادل فئة 56 تقريبًا في أعمال وكلاء البرمجة. تحمل النقاط تنبيه نسب — أعاد AA حساب أساس مؤشره مرتين هذا العام؛ فاستشهد بالنقاط بين منشورات المصدر نفسه فقط.)

الفخ في الصف الأول والثالث: أسعار ظاهرة متطابقة، تفارق بمقدار 7.6 ضعف في التكلفة المقيسة. قرار شراء مبني على جدول الأسعار — «Sonnet 5.5 يساوي سعر Sonnet 5، فهو الترقية الاقتصادية» — ينتج العكس التام للفاتورة. والترتيب المقيس يقلب الحدس مرة ثانية: النموذج الأغلى ظاهريًا على الطاولة (Opus 5.5 بـ $4/$20) هو المهمة الأرخص، لأن خفض قراءة مخبئه يصيب البند الذي تسيطر عليه أحمال الوكلاء فعلًا — إعادة قراءة سياق طويل آلاف المرات لكل مهمة (Anthropic: «قراءات المخبأ (التي تشكل أغلب تكاليف أعمال الوكلاء والبرمجة) هي $0.20 لكل مليون رمز»).

ثلاث استراتيجيات إطلاق، ساحة واحدة

حسمت نافذة سبتمبر ما كانت حرب الأسعار توحي به منذ يونيو: لم يعد سعر الرمز الواحد ساحة تنافس الموردين، لأن سعر الرمز أصبح شبه مجاني. انتقلت الساحة إلى التكلفة لكل مهمة، واختارت كل مختبر سلاحًا مختلفًا.

القيادة بالقدرة (Anthropic، خط Sonnet). إطلاق نموذج شبه حدي على جدول الأسعار القديم وكسب جدول المعايير. Sonnet 5.5 في المركز الثاني بفاتورة رموز أثقل بنسبة 60% هو أنقى صورة لهذه الاستراتيجية: مكسب الذكاء حقيقي (+18 نقطة مؤشر فوق Sonnet 5 عند الحد الأقصى)، وتكلفته تحل في بند الرموز بالفاتورة، حيث يبقى «أرخص بنسبة 30%» و«7.60 دولار» صحيحين تقنيًا معًا. تراهن الاستراتيجية على أن المشترون يقرؤوا العناوين والمعايير ويعتبرون حجم الرموز سلعة مجانية — ووفق توقعات Gartner في 16 سبتمبر بأن ينمو الإنفاق العالمي على الذكاء الاصطناعي 49.5% في 2026 إلى 2.7 تريليون دولار، مع قطاع الوكلاء والمساعدين على مسار 16.5 مليار ثم 29.2 مليار ثم 65.5 مليار دولار، فإن للرهان جمهورًا حقيقيًا.

القيادة بالسعر (OpenAI، خط Sol/Luna). خفض السعر الظاهر إلى النصف ونشر رياضيات التكلفة لكل مهمة بنفسه. جدول إطلاق OpenAI جاهز للشراء بطرقة لم يعرفها إطلاق نموذج قبله: سجل GPT-6 Sol (xhigh) نسبة 33.2% مقابل 0.27 دولار لكل مهمة، في حين سجل Claude Opus 5 (الحد الأقصى) نسبة 26.9% مقابل 11.1 ضعف التكلفة. وعلى جانب Artificial Analysis خفض GPT-6 Sol عند الحد الأقصى تكلفة سابقه من 1.99 إلى 1.06 دولار مع كسب نقطتين في مؤشر وكلاء البرمجة (Artificial Analysis). تراهن الاستراتيجية على أن التكلفة المقيسة المنشورة لكل مهمة هي مقياس الشراء المستقبلي — وأن مزودًا واثقًا من كفاءته يفوز بالشراء بجعل مقارنات التكلفة بلا عناء.

القيادة بالمخبأ (Anthropic، خط Opus). الإبقاء على السعر الظاهر الحدي وتفريغ مُحرّك تكلفة الوكيل. يستهدف خفض قراءة المخبأ في Opus 5.5 من $0.50 إلى $0.20 بالضبط شكل الحمل الذي تعيش فيه رموز الوكيل — القراءة المتكررة لسياق كبير ومستقر. تقدّر Anthropic انخفاض التكلفة الكلية بنحو 40% في العمل النموذجي (Fello AI ملخصًا ادعاءات الإطلاق)، وتؤكد التكلفة المقيسة 5.98 دولار مقابل 7.60 دولار لكل مهمة هذا الاتجاه باستقلال.

المقياس نفسه. ثلاث استراتيجيات متعارضة. التكلفة لكل مهمة في مؤشر الذكاء عند أقصى جهد، مقيسة — إطلاقات سبتمبر 2026 · Artificial Analysis التكلفة المقيسة لكل مهمة (أقصى جهد) $7.60 Sonnet 5.5 193 ألف رمز إخراج لكل مهمة $5.98 Opus 5.5 قراءة المخبأ أرخص 60% ~$5.00 Sonnet 5 خط أساس «السابق» $1.06 GPT-6 Sol السعر الظاهر −50% $0.07 GPT-6 Luna الفئة الأرضية تكلفة Sonnet 5.5 عند الحد الأقصى تعادل 7.2 ضعف GPT-6 Sol بالحد الأقصى — على جدول الأسعار ذاته $2/$10 ثلاث استراتيجيات إطلاق، سبتمبر 2026 القيادة بالقدرة — Anthropic Sonnet 5.5 جدول أسعار ثابت عند $2/$10. كسب المؤشر (المركز الثاني، 56 نقطة) بالتفكير الأطول: 193 ألف رمز لكل مهمة، أثقل ما قاسته AA. تلحظ التكلفة في بند الرموز بالفاتورة. المعيار يشتري العنوان القيادة بالسعر — OpenAI Sol / Luna خفض السعر الظاهر إلى النصف (22 سبتمبر) ونشر رياضيات كل مهمة في منشور الإطلاق: Sol xhigh بـ $0.27/مهمة مقابل Opus 5 بالحجم الأقصى بـ 11.1 ضعفًا. Luna: أقل بنسبة 96% لكل مهمة من Fable 5. شراء بالأرقام المنشورة القيادة بالمخبأ — Anthropic (Opus) Opus 5.5 السعر الظاهر −20%، قراءة المخبأ −60% ($0.50 → $0.20). يستهدف البند الذي تسوده أحمال الوكلاء: «قراءات المخبأ... تشكل غالبية تكاليف أعمال الوكلاء والبرمجة.» الأخ الأكبر يتفوق على الأصغر الرياضيات التي يخفيها جدول الأسعار — حمل من 200 خطوة، 1,000 خطوة يوميًا Sonnet 5.5 بالحد الأقصى: 1,200 خطوة أسبوعيًا × 193 ألف رمز إخراج = 231.6 مليون رمز إخراج أسبوعيًا × $10/M = $2,316 أسبوعيًا الحمل نفسه على GPT-6 Sol بالحد الأقصى: 31 ألف رمز ← $121 أسبوعيًا. على Sonnet 5 بالحد الأقصى: 120 ألف رمز ← $1,200 أسبوعيًا. على هذا الملف، يكلف النموذج «الأرخص بنسبة 30%» 1.9 ضعف سابقه نفسه — جدول الأسعار لم يتغير قط؛ تغير عمود الرموز. مستويات الجهد تغير الفاتورة 30 ضعفًا — تتعاقد على الحد الأعلى سعر الرمز الواحد مقياس شراء خاطئ. تتعاقد على التكلفة لكل مهمة وإلا اختار التبديل فاتورتك. ثبّت معرّفات النموذج لكل خطوة · حدّد أسقف الرموز لكل مهمة بقاطع دائرة · سجّل النموذج المُقدَّم لا المطلوب · اطلب تسعيرًا منشورًا لكل مهمة إثبات تراجع DeepSeek خلال 45 ساعة أن الأربعة لازمة — وأن لا واحدًا منها كافٍ وحده. Sonnet 5.5 أقصى $7.60/مهمة · Opus 5.5 $5.98 · Sonnet 5 ~$5.00 · GPT-6 Sol $1.06 · GPT-6 Luna $0.07 المصادر: Artificial Analysis (22 + 28 سبتمبر) · Anthropic · OpenAI — ideabosque.com

نقطة المخطط في صندوق الرياضيات لا في الأعمدة: جدول الأسعار ثمن لكل مليون؛ وعقد التكلفة لكل مهمة ثمن لكل ناتج. في حمل من 200 خطوة يُشغَّل 1,200 مرة أسبوعيًا، ينفق Sonnet 5.5 عند الحد الأقصى 193 ألف رمز إخراج لكل خطوة ويفوتر نحو $2,316 أسبوعيًا، بينما يفوتر GPT-6 Sol مبلغ $121 عن ذكاء مقيس شبه متساوٍ (كلاهما يسجل في منتصف الخمسينات بالمؤشر؛ والاقتصاد الخاص بوكلاء البرمجة لدى Sol عند $2.99 لكل مهمة يقع على خط باريتو وفق تحليل مؤشر البرمجة لدى AA). الفارق الأسبوعي بين النموذج «الأرخص بنسبة 30%» وسابقه يقارب $1,100 — ادعاء «أقل بنسبة تصل إلى 30%» ومضاعفة التكلفة مرتين صحيحان معًا، ولا يفصل بينهما سوى توزيع الجهد. لهذا يهم العقد أكثر من منشور الإطلاق.

المشكلة الشرائية التي جعلها سبتمبر أصعب

حقيقتان بنيويتان يحولان هذا من تعليق إلى صياغة تعاقدية. أولًا أصبح خطر جدول الأسعار شهريًا: يقرأ pricepertoken نحو 180 من 672 نموذجًا مرصودًا تغيرًا سعريًا في سبتمبر (انجراف العداد عبر الشهر: 178/672 ثم 181/671)، ويسرد خط زمن LLM Gateway ثلاثة وعشرين نموذجًا جديدًا من خمسة عشر مزودًا هذا الشهر — فاتورة أغسطس التي شغّلها وكيلك ليست فاتورة أكتوبر. ثانيًا، تُشحن طبقة الاستبدال فعلًا كمنتج: يجعل Smart Route من LLM Gateway، الصادر في 25 سبتمبر، التوجيه من جانب المزود ميزة قابلة للشراء، والرجوع التكيفي لدى Anthropic («يرجع في نحو 0.1% من المهام، وبشكل رئيسي في Terminal-Bench، مع العودة إلى Sonnet 5 في كل الحالات» وفق اختبارات AA) هو الآلية نفسها داخل استدعاء النموذج. وليس أيٌّ منهما سلوكًا منحرفًا — أثبت حادثة DeepSeek أن المزود يمكنه حتى الإعلان عن استبدال نموذج لكل الأسطول ثم التراجع عنه بعد 45 ساعة تحت ضغط المستخدمين. قرار التوجيه حقيقي وهو ممن يمسك بيئة التشغيل.

على هذه الخلفية، للشراء على جدول الأسعار ثلاثة أنماط فشل محددة:

  1. فشل عنوان المعيار. يتصدر Sonnet 5.5 قصة القدرة (المركز الثاني في المؤشر، و64% في Terminal-Bench 4.0) وقصة التكلفة (أرخص بنسبة 30% لكل مهمة) في الإطلاق نفسه — كلاهما صحيح، ولكنه مركّب على خط أساس مختلف. عملية شراء تقرأ منشور الإطلاق وجدول المعايير دون عمود الرموز تصادق على أغلى تكوين تكلفة لكل مهمة على الطاولة.
  2. التوقع الأعمى عن مستوى الجهد. تفترض معظم حسابات التكلفة المنشورة إعدادات منشورة. يبيّن مسح AA أن فاتورة Sonnet 5.5 تتأرجح بحسب الجهد (الحد الأقصى $7.60 مقابل نحو $5.00 لـ Sonnet 5؛ إعدادات منخفضة/متوسط يعيش فيها ادعاء «أرخص بنسبة 30%»)؛ والتوقعات المبنية على الإعداد الافتراضي لواجهة API ترث المستوى الذي يختاره منطق تصعيد SDK لدى المزود لكل مهمة.
  3. السعر الوحدوي الأعمى عن المخبأ. اختار نموذجان من Anthropic بينهما 30 يومًا محاور متعاكسة — جعل Sonnet 5.5 الرموز باهظة، وجعل Opus 5.5 قراءة المخبأ رخيصة. أصبحت نسبة إصابة المخبأ الفعلية لحمل الوكيل (أوامر نظام طويلة مستقرة؛ مخططات أدوات متكررة؛ سياق استرجاع كبير) أكبر محدد مفرد لأيّهما أرخص — رقمًا لا يسأل عنه معظم عمليات RFQ أبدًا.

لا يوجد أي غش من المزود فيما سبق. الثلاثة كلها ناتج طبيعي لسوق انزاحت اقتصاديات وحدته تحت لغة التسعير الخاصة به — الاستنتاج ذاته الذي خلُص إليه AA في سطر واحد: «Sonnet 5.5 رخيص لكل رمز لكنه قد يكون باهظًا لكل مهمة.»

العقد: أربعة بنود تنجو من الإطلاق القادم

العلاج ليس اختيار المختبر الفائز؛ فالفائز في التكلفة لكل مهمة يتبدل أسبوعيًا (يتحرك عداد pricepertoken شهريًا). العلاج هو قياس القرار حتى يصبح التبديل القادم تغييرًا مقيسًا للإعداد بدلًا من مفاجأة في الفاتورة. البنود الأربعة تقابل طبقة التشغيل ذاتها التي يبنيها هذا الموقع في كل وكيل:

1. ثبّت معرّفات النموذج لكل خطوة وسجّل النموذج المُقدَّم لا المطلوب. طبقة التوجيه بنية تحتية للمشغّل. توجد حقول model في إعداد وكيلك — في بيئة التشغيل المرجعية يشير الوكلاء إلى موارد النماذج المسجلة بالمزود والاسم، ويكون تغيير النموذج عملية بيانات لا إعادة نشر. تسجل مسار التدقيق النموذج المُقدَّم فعلًا عند كل استدعاء أداة (مقال DeepSeek يغطي نمط الحادثة كاملًا). المزود الذي يستبدل نموذجك بصمت ينتج الآن فرقًا مرئيًا.

2. تتعاقد على التكلفة لكل مهمة مع سقف أسبوعي، لا على الرموز مع فاتورة شهرية. يصبح التسعير لكل مهمة مقياسًا منشورًا من الطرف الأول (ينشره OpenAI في جداول الإطلاق؛ ويقيس AA الجميع على المهام نفسها). العقد المحدّد النطاق يسمّي الحمل (الخطوات وشكل السياق ونسبة إصابة المخبأ المتوقعة)، والنموذج ومستوى الجهد لكل فئة خطوة، وسقفًا مقيسًا لكل مهمة — بسعر المزود المنشور لكل مهمة سطرًا مرجعيًا. يقدّم إطار المتجهات الست للتكلفة قائمة التدقيق؛ والمتجه الخامس (مخاطرة استبدال المزود) هو البند الذي يشغّله هذا القسم.

3. وازن الرموز وجعل مقبض الجهد سطح شراء لا إعداد مطوّر. تقلب فاتورة Sonnet 5.5 بعشرين ضعفًا عبر مستويات الجهد هو الحالة الملموسة. على طبقة التوجيه أن تعامل جهد الاستدلال حقل إعداد مصنفًا لكل فئة خطوة — عتبات التصعيد صريحة، والحدود تقف توقفًا صلبًا في بيئة التشغيل (نمط سقف التكلفة للوكلاء طويلة التشغيل)، وسياسة التصعيد مرئية في مسار التدقيق. الإعداد الافتراضي «أقصى جهد» عبر 1,200 خطوة يوميًا قرار شرائي لم يُتخذ قط.

4. اختبر الكفاءة المدعى على حملك قبل أن تُلتزم أسطولًا به. «أقل بنسبة تصل إلى 30%» من Anthropic صادق ومحدد النطاق ومرتبط بالحمل — والقیاس المقابل $7.60 من AA صادق ومحدد ومرتبط بالحمل كذلك. لا يخبرك أي منهما بفاتورتك. التجربة الثلاثينية الدقيقة: خذ أسبوعًا من تشغيلات الوكيل الحقيقية، وأعدها ضد النموذج المرشح عند كل مستوى جهد، وقس الرموز ونسبة إصابة المخبأ لكل خطوة، وضع الأرقام الثلاثة (جدول الأسعار، فاتورة الرموز، التكلفة المقيسة لكل مهمة) في صفحة الشراء الواحدة. يجعل تراكب TypeSafe Jev ثلاثي الطبقات هذا مستمرًا — مصنّف طبقة قرار معايَر يراقب الفاتورة لكل فئة خطوات، لأن المراقب شبه مجاني لكل استدعاء.

ينطبق وسم صدق على ما تقدم كله، بما فيه صندوق الرياضيات: كل الأرقام المقيسة لكل مهمة مصدرها اختبارَان مستقلان في اليوم نفسه (AA، kingy.ai) إضافة إلى جداول منشورة من المزودين، ووعلى مهام معيارية لا على حِملك. كذلك أُعيد حساب أساس مؤشر الذكاء لدى AA مرتين هذا العام؛ والنقاط والتكاليف المذكورة هنا مقارنات ضمن تاريخ النشر نفسه وقد تتغير عند إعادة الحساب التالية. اعتبار ذلك كله خط الأساس الانطلاقي الذي تحل التجربة محلّه — الاتجاه (جدول الأسعار ≠ الفاتورة؛ الرموز هي المتغير) ثابت، والثوابت الدقيقة لا.

الناتج، على ملف حقيقي

شغّل الأرقام على ملف البناء للقوقة المتوسطة الحجم الذي يكتب حوله هذا الموقع: وكيل التسعير لدى موزّع، 200 RFQ أسبوعيًا، ونحو 1,200 خطوة نموذج أسبوعيًا على بحث الكتالوج والتسعير الطبقي وبدائل الرسم المعرفي وتوليد المسودات. عند Sonnet 5.5 بالحد الأقصى يفوتر هذا الملف نحو $2,300 أسبوعيًا. وبالتوجيه المتعمد — جهد حدي على خطوات التفاوض وحدها، ونموذج متوسط على الاستعلامات، ونموذج قريب من السعر الأرضي على التصنيف، وسياق مُخبأ كثيف مشترك عبر الخطوات — يفوتر الحمل نفسه أقل من $300 أسبوعيًا، بجودة مركزة حيث توجد نتيجة العمل فعلًا: عرض السعر الذي يراه العميل. فرق الـ 87% مهارة اختيار نماذج ليس؛ بل بيئة التشغيل تفرض قرار تكلفة لم يتخذها منشور الإطلاق إن عنك قط. عند هذه الأحجام تبقى طبقة التكامل — وحدات MCP، وسياسة التوجيه، ومسار التدقيق — الـ 90% من البناء التي لا يستطيع جدول أسعار الرمز تسعيرها؛ فاتورة النموذج ضجيج، والنمط أعلاه هو كيف تبقيها ضجيجًا بدل الإشارة.

قراءة ذات صلة


يُسعّر موزّع متوسط الحجم يشغّل NetSuite وBigCommerce مائتي RFQ أسبوعيًا عبر منظومة وكلاء محكومة: وحدات MCP لمنظومة ERP وثلاثة فهارس موردين، ورسم معرفي لبدائل القطع، ومحرك RFQ يدير حجوزات التوفر — وطبقة توجيه تثبت معرّفات النماذج لكل فئة خطوات وتحدد سقف الرموز لكل مهمة وتسجل النموذج المُقدَّم عند كل استدعاء. حين يدّعي منشور الإطلاق القادم «أرخص بنسبة 30%»، تجرّ الطبقة تجربة إعادة تشغيل لأسبوع وتحصل صفحة الشراء على ثلاثة أرقام بدل صفة واحدة. أول وكيل حي في 5–8 أسابيع.

اطلب بناء محدد النطاق. أسبوع اكتشاف. تحصل على جرد الأنظمة وخريطة سير العمل ونطاق ثابت — سواء أنشأت معنا أو لا.

هل تريد هذا مبنياً لأنظمتك؟

كل وثيقة هنا من عمل إنتاجي حقيقي. إذا كان لديك نظام مُستهدَف وسير عمل في الذهن، نستطيع تحديد نطاق بناء في أسبوع واحد.

اطلب بناءً محدد النطاق

اكتشاف مدته أسبوع واحد. تحصل على جرد للأنظمة وخريطة لسير العمل ونطاق ثابت — سواء بنيت معنا أم لا.