أغلى جزء في خط أنابيب المحتوى لدي ليس الكتابة، بل اتخاذ القرارات. وهذه هي المشكلة تحديدًا التي صُمم TypeSafe Jev لحلها، ولهذا قضيت صباحًا مع نموذج لا يستطيع كتابة جملة واحدة.
كل مقال يمر عبره يطلق سلسلة من الأحكام الصغيرة: هل يستحق هذا الموضوع التغطية، هل هو منشور تقني أم منشور موسيقي، هل المسودة جيدة بما يكفي لتجاوز بوابة المحرر، وهل تبرر نتيجة SEO إعادة الكتابة. لا يحتاج أي من ذلك إلى نثر. ما يحتاجه هو إجابة يستطيع switch statement قراءتها. وحتى الأسبوع الماضي، كانت الطريقة الوحيدة التي أملكها للحصول على واحدة هي استئجار نموذج متقدم يولّد فقرة، ويغلفها في JSON، ويحاسبني على كليهما.
في 15 سبتمبر 2026، أطلق مختبر يُدعى TypeSafe AI نموذجًا صُمم خصيصًا للقضاء على هذا النمط. TypeSafe Jev هو نموذج System One: لا يولّد نصًا على الإطلاق، وتبلغ تكلفته 0.042 دولار لكل مليون input tokens، بينما يكون سعر output صفرًا.
لم أستخدمه عمليًا بعد. فالوصول المبكر يتطلب التسجيل في قائمة انتظار. لذلك فهذه ليست تجربة ميدانية. إنها البحث الذي أجريته قبل أن أقرر ما إذا كنت سأضعه على خارطة الطريق، والأجزاء من الإطلاق التي تصمد أمام التدقيق، والأجزاء التي لا تصمد، والمكان الذي يمكن أن يشغله فعليًا داخل الأنظمة التي أشغّلها بالفعل.
ما الذي أطلقته TypeSafe فعليًا
خرجت TypeSafe AI من نحو عامين من العمل السري، بتمويل تأسيسي قدره 40 مليون دولار قادته DCVC. ويتكون الفريق المؤسس من Diogo Almeida وErik Gafni وSasha Sheng.
خلفية Almeida هي السبب في أن هذا الإطلاق حظي بالاهتمام بدلًا من أن يمر دون ملاحظة. فقد عمل في OpenAI، وكان مؤلفًا رئيسيًا بمساهمة متساوية في ورقة InstructGPT، وأسهم في GPT-4. بعض التغطيات اختزلت ذلك إلى عبارة "المخترع المشارك لـ ChatGPT"، وهي مبالغة تختزل جهدًا جماعيًا كبيرًا في شخص واحد. لكن الصياغة الدقيقة لا تزال قوية: لقد ساعد في بناء أبحاث اتباع التعليمات التي جعلت المساعدات الحوارية تعمل، وهو يجادل الآن بأن هذا النهج هو الواجهة الخاطئة للأتمتة.
سؤاله التأطيري هو الجزء الجيد: كانت النماذج خارقة للبشر في المحادثة لسنوات، فأين كل هذه الأتمتة؟
إجابة TypeSafe هي أن عنق الزجاجة لم يكن الذكاء قط. المشكلة هي أن النموذج الذي يجيب بالنثر أداة غير مريحة لبناء البرمجيات عليها. تطرح سؤالًا، فتحصل على سلسلة نصية، ثم تحللها، وتتحقق منها، وتعالج حالة رفضه، وتعالج حالة كتابته ثلاث فقرات من الاستدلال أولًا، وبعد ذلك فقط تنفذ التفرع. جعلت المخرجات المنظمة ذلك أقل إيلامًا. لكنها لم تغير حقيقة أن الواجهة الأساسية لا تزال توليدية.
يبدأ Jev من مساحة القرار بدلًا من ذلك. والتسمية مقصودة من الطرفين: يشير "System One" إلى تفكير System 1 السريع والحدسي لدى Kahneman، بينما سُمّي Jev على اسم William Stanley Jevons، الذي تنص مفارقته على أن انخفاض التكلفة يؤدي إلى زيادة الاستهلاك. تخبرك TypeSafe بما تتوقع حدوثه لحجم الاستدعاءات.
ثلاث بدائيات، وهذه هي الواجهة البرمجية كاملة
ترسل حالة البرنامج مع أسئلة مكتوبة بأنواع محددة. وتحصل على إجابات مكتوبة بأنواع محددة، تحمل كل واحدة منها احتمالًا معايرًا. وهناك ثلاثة أنواع فقط من الأسئلة.
Choice وScore وNoul
Choice يختار خيارًا واحدًا من مجموعة معلنة، يصل عددها إلى 255 خيارًا، ويعيد توزيعًا احتماليًا عبر جميع الخيارات، بالإضافة إلى قيمة للثقة.
Score يضع الإدخال على طيف من مستويين إلى عشرة مستويات مرتبة تصفها بالكلمات. ويعيد موضعًا مستمرًا يمكن أن يقع بين المستويات، لذا فإن 1.035 إجابة صالحة.
Noul يقيّم قضية ثنائية ويعيد رقمًا واحدًا من 0 إلى 1: احتمال كونها صحيحة. ولا يوجد حقل ثقة منفصل، لأن الرقم هو الاعتقاد نفسه.
كيف يبدو الاستدعاء الحقيقي
إليك البنية التي توثقها Python SDK الخاصة بـ TypeSafe:
python from typesafe_sdk import Choice, Noul, Score, TypeSafeClient
client = TypeSafeClient()
response = client.system_one( state={ "ticket": {"subject": "Duplicate charge", "body": "I was charged twice for order A-104."}, "order": {"id": "A-104", "charges": [{"amount_usd": 49}, {"amount_usd": 49}]}, "refund_policy": "Duplicate charges are eligible for a refund.", }, questions={ "department": Choice( instructions="Which team should handle this", criteria={ "billing": "Payment or subscription issues", "technical": "Bugs or integration problems", "other": "Anything else", }, ), "frustration": Score( instructions="How frustrated the customer appears", criteria=["Calm, just stating facts", "Frustrated but civil", "Very angry"], ), "refund_requested": Noul(instructions="The customer is explicitly asking for a refund"), "policy_supports": Noul(instructions="The stated refund policy covers this situation"), }, )
if response.answers["refund_requested"].noul > 0.7 and response.answers["policy_supports"].noul > 0.8: start_refund_flow("A-104")
أربعة أحكام، وطلب واحد، ورحلة ذهاب وإياب واحدة. يوفّر النموذج الفهم الدلالي. بينما تبقى السياسة في الكود، حيث يمكنني قراءتها ومقارنتها واختبارها.
وهذا الجزء الأخير هو الحجة المعمارية، وهو أكثر إثارة للاهتمام من التسعير. فبدلًا من أن تطلب من نموذج أن "يتعامل مع هذا العميل"، تحدد ما يجب فهمه، وتبقي ما يحدث بعد ذلك في نظام التحكم بالمصدر المعتاد.
كم تبلغ تكلفة TypeSafe Jev
هذا هو الرقم الذي جعل الناس ينتبهون.
| البُعد | Jev | Frontier LLMs |
|---|---|---|
| --- | --- | --- |
| سعر input | 0.042 دولار / MTok | 0.20 - 10 دولارات / MTok |
| سعر output | مجاني | نحو 5 أضعاف input |
| زمن الاستجابة (بحسب المورّد) | 70 - 500 ms | 3 - 329 s |
| السياق | 64k state + questions | مئات الآلاف |
| شكل output | Typed، ومخطط ثابت | سلاسل نصية تحللها |
| الثقة | معايرة، في كل حقل | غير متسقة عند طلبها |
كون output مجانيًا ليس عرضًا ترويجيًا. فلا توجد حلقة فك ترميز autoregressive، وبالتالي لا يوجد شيء لقياسه. ولا يمكن معرفة ما إذا كان سعر 0.042 دولار مستدامًا أو مدعومًا من رأس المال الاستثماري في الوقت الحالي، وTypeSafe تقول ذلك مباشرة في منشور الإطلاق الخاص بها. وتتوقع أن ينخفض السعر بدلًا من أن يرتفع، وهو ادعاء لا يحسمه إلا الزمن.
تعمل حدود السياق بشكل مختلف عن LLM، لأن state تُستوعب مرة واحدة وتعمل الأسئلة بالتوازي عليها: نحو 64k tokenًا لـ state وجميع الأسئلة مجتمعة، مع نحو 32k لـ state بالإضافة إلى أطول سؤال منفرد. النص وJSON المنظمان فقط. لا صور، ولا صوت، ولا فيديو.
ادعاء زمن الاستجابة، وما قاسه شخص فعليًا
نشرت TypeSafe زمنًا من البداية إلى النهاية يتراوح بين 70 و500 ms. وكان منشور الإطلاق صريحًا في أن تلك الاختبارات جاءت من حواسيب الفريق المحمولة في الساحل الغربي للولايات المتحدة، وهي أفضل حالة لواجهة API مستضافة في الولايات المتحدة.
قام مهندس في Classmethod Malaysia باختباره في مهمة توجيه حقيقية. حصل على الوصول بعد قائمة الانتظار، واستدعى POST https://api.typesafe.ai/v1/systemone مباشرة، واستخدم Choice لتكرار المصنف الموجود في إعداد توجيه NVIDIA's NeMo Switchyard، مع تصنيف المحادثات إلى أربع فئات. أربعون استدعاءً، عشرة لكل فئة.
نجحت الاستدعاءات الأربعون كلها. وطابقت جميعها الفئة المتوقعة. واستقر زمن الاستجابة الوسيط عند 0.64-0.67 ثانية. أما التكلفة لكل استدعاء فكانت بين 0.000025 و0.000027 دولار.
هذا أبطأ بنحو عشرة أضعاف من الرقم الرئيسي البالغ 70 ms، ومع ذلك فهو لا يزال النتيجة الأكثر إثارة للاهتمام في دورة الإطلاق بأكملها. لأن الشيء الذي استبدله كان مصنف Gemini 3.5 Flash بزمن وسيط قدره 2.1 ثانية، أو مصنف DeepSeek V4 Flash بزمن قدره 7.2 ثانية. جاء Jev أسرع بنحو 3 أضعاف من الخيار السريع والمكلف، وأسرع 10 أضعاف من الخيار الرخيص والبطيء، مع تكلفة لا تتجاوز أجزاء من السنت لكل استدعاء.
هناك تفصيل واحد من ذلك الاختبار يستحق أكثر من أرقام السرعة. في الفئات الثلاث غير الملتبسة، عادت الثقة بقيمة 1.0. أما في الفئة "المتوسطة" الحدودية فعلًا، فانخفضت إلى 0.57-0.67. كان النموذج يعرف أي استدعاء كان صعبًا. وهذه خاصية لا يمكنك الحصول عليها بشكل موثوق من نموذج محادثة، وهي التي تغير فعلًا طريقة كتابة الكود المحيط به.
ماذا يقول الآخرون عن TypeSafe Jev
استقطب الإطلاق نقاشًا من 256 تعليقًا على Hacker News. والجانب المفيد فيه أن أحدًا تقريبًا لم يجادل بأن التقنية زائفة. قال العديد من المعلقين إنهم سيطلقونها. لكن الاعتراض وُجّه مباشرة إلى التسويق، ويستحق القراءة قبل أن يبني أي شخص خارطة طريق على هذا المنتج.
عبارة "Frontier model" تحمل الكثير من المعاني
لا يستطيع Jev كتابة الكود، أو إجراء محادثة، أو إنتاج جملة. ووضعه في العبارة نفسها مع GPT أو Claude يستعير مصداقية لم يكتسبها مستقلًا. اقترح أحد المعلقين عنوانًا أكثر صدقًا: لقد دفع حدود السرعة والتكلفة للقرارات المنظمة. وهذا إنجاز حقيقي. لكنه ليس الجملة نفسها.
عبارة "لا يمكنه الهلوسة" أضيق مما تبدو
صحيح أن النموذج الذي لا يُخرج نصًا حرًا لا يمكنه اختراع استشهاد أو اسم أداة، وأن رقم TypeSafe البالغ 0% لأخطاء النوع ناتج عن التصميم لا عن القياس. لكن النموذج المقيد بثلاث فئات مسموحة يمكنه مع ذلك اختيار الفئة الخاطئة بثقة. ما أُزيل هو الإجابة غير الصحيحة شكليًا، لا الحكم الخاطئ. وقد وافق الرئيس التنفيذي لـ TypeSafe مباشرة على هذا التمييز في النقاش.
قد لا تكون مقارنة السرعة متكافئة
قيس رقم 70 ms مقابل قيام LLM بتوليد إجابة منظمة كاملة بشكل autoregressive، بما في ذلك أسماء المخطط والتنسيق، بدلًا من مقارنته بـ LLM مقيّد بإخراج القرار القصير المكافئ. ولم يُحسم هذا السؤال المنهجي بعد.
التقييمات مصممة داخليًا
أنشأت TypeSafe تنسيقًا جديدًا لـ "workflow eval" بدلًا من تشغيل معايير عامة، وسجلت النماذج مقابل متوسط تنبؤ GPT-6 Astra وFable 5.1 بدلًا من الحقيقة المرجعية. وتشير الشركة إلى حدودها بنفسها: صمم فريقها الخاص سير العمل، وتحاز النماذج المرجعية النتائج لصالح OpenAI وAnthropic، بينما تعمل LLMs المنافسة عبر adapter الخاص بـ TypeSafe. كما قالت إنها ستتخطى لوحات المتصدرين العامة، وهو ما قرأه عدة أشخاص باعتباره أمرًا ملائمًا لها.
لا توجد ورقة معمارية. وRLCD، أو Reinforcement Learning for Calibrated Decisions، هي طريقة التدريب التي تستند إليها الحجة بأكملها، وقد وُصفت دون الكشف عن تفاصيلها. لا توجد دالة مكافأة، ولا منحنيات معايرة، ولا شيء يمكن إعادة إنتاجه بشكل مستقل. وكما أشار Anthony Maio، فإن reinforcement learning للمعايرة ليس جديدًا بحد ذاته؛ فالأعمال السابقة مثل "Rewarding Doubt" تستكشف المجال نفسه. وقد يكون الجديد هو الحزمة، وليس الطريقة بالضرورة.
الرقم الذي تجاهلته معظم التغطيات
مدفونًا في تقييم TypeSafe الخاص بها، عبر أربع مهام عمل تغطي الاستجابة لحوادث الأمن، وقابلية ملاحظة آثار الوكلاء، ومعالجة الفواتير، وخدمة العملاء، توجد صورة الدقة.
| النموذج | التوافق | التكلفة / الحالة | زمن الاستجابة |
|---|---|---|---|
| --- | --- | --- | --- |
| Jev | 67.8% | 0.0004 دولار | 0.4 s |
| GPT-5.6 Terra | 67.9% | 0.0304 دولار | 10.1 s |
| Claude Sonnet 5 | 67.8% | أعلى | أعلى |
| Claude Opus 5 | 73.1% | غير منشور | غير منشور |
| GPT Sol | 74.1% | غير منشور | غير منشور |
اقرأ ذلك بعناية، لأنه يعيد صياغة كل شيء. يطابق Jev نماذج Frontier متوسطة المستوى بتكلفة تقارب واحدًا من ستة وسبعين من التكلفة، وبزمن استجابة يبلغ واحدًا من خمسة وعشرين من الزمن. لكنه لا يطابق المستوى الأعلى. وفي معالجة الفواتير تحديدًا، كانت الفجوة أوسع: حقق Jev نسبة 61.8% مقابل 79.1% لـ Sol.
إذًا، التموضع الصادق ليس "ذكاء Frontier أرخص". بل هو "حكم بمستوى Sonnet بسعر يتيح لك استدعاءه في كل طلب بدلًا من بعض الطلبات". بالنسبة إلى router أو classifier أو pre-filter، فإن هذه المقايضة ممتازة. أما بالنسبة إلى قرار تكون تكلفة الخطأ فيه مرتفعة، فالفجوة البالغة اثنتي عشرة نقطة مقابل Sol هي القصة بأكملها.
أين يناسب TypeSafe Jev مكدسي
عند تشغيله مقابل الأنظمة التي أديرها بالفعل، تنجح ثلاثة مواضع ولا ينجح موضعان.
بوابات المقالات في خط أنابيب المحتوى
المنسق الذي يشغّل خط أنابيب الموقع متعدد الوكلاء ينفذ عشرات الأحكام المحدودة في كل تشغيل. ويعتمد تعيين الفئة بين التقنية والموسيقى حاليًا على أساليب استدلال لتوزيع الوسوم. كما تجيب مراحل المحرر والصقل وإضفاء الطابع البشري، كل منها، عن نسخة من سؤال "هل هذا جاهز؟". هذه أسئلة Choice وNoul ترتدي زي LLM. وتهم المعايرة هنا أكثر من السعر: إذ تتيح لي درجة الثقة تمرير الحالات الواضحة تلقائيًا، وتوجيه الحالات الملتبسة فقط إلى نموذج أكبر.
Apify actors
يقيس أحدها جودة SEO للمقالات الموجودة، وهو حرفيًا مهمة تسجيل، والشيء الوحيد الذي يؤثر في نقطة التعادل هناك هو إنفاق النموذج داخل API. إن استخدام بدائية Score بسعر 0.000026 دولار لكل استدعاء مقابل نموذج Frontier يؤدي المهمة نفسها هو تغيير في الهامش، وليس مجرد تحسين. وهذا أول ما سأقيسه، ثم أصدقه.
توجيه أسئلة العملاء في جانب التجارة الإلكترونية
تحتاج أسئلة FAQ الواردة إلى فئة، وقراءة لدرجة الاستعجال، وعلامة "هل يحتاج هذا إلى إنسان؟". ثلاثة أسئلة متوازية، وطلب واحد، وأقل من ثانية. هذه هي حالة الاستخدام النموذجية، وهي التي بُني عليها العرض التوضيحي للإطلاق.
أين لا يناسب
موضعان، وكلاهما حدود صلبة لا أحكام تقديرية. Mixanalytic هو تحليل صوتي، وJev يقبل النص وJSON فقط، لذا يجب أن تتم عملية النسخ أو استخراج الميزات أولًا، وبحلول ذلك الوقت يكون العمل المثير للاهتمام قد أُنجز بالفعل. وكذلك أي شيء يكتب: مسودات المقالات، وتوليد التغريدات، والترجمات. يتخلى Jev عن السلاسل النصية عن قصد. إنه ليس Claude أرخص، بل مكوّن مختلف.
هذا هو التمييز الذي سأتمسك به. هذه ليست عملية استبدال نموذج. إنها طبقة جديدة تقع أسفل استدعاءات LLM، وتتولى القرارات التي تكون تلك الاستدعاءات مؤهلة أكثر من اللازم للتعامل معها.
قراءة ذات صلة: يشرح سير عمل مراجعة الكود متعدد الوكلاء→ الخاص بي كيف أنظم أحكام الوكلاء المستقلة، وتحتوي مراجعة Claude Fable 5.1→ على تسعير نموذج Frontier الذي تتم مقارنته به، بينما يحتوي سجل البناء الذي أُطلقت فيه تلك actors→ على سياق ما تفعله.
كيف تبدأ مع TypeSafe Jev
الوصول متاح عبر قائمة انتظار من خلال console.typesafe.ai، أو عبر Vercel AI Gateway. وأفاد مهندس Classmethod بأنه حصل على الوصول فور التسجيل، لذا قد تكون قائمة الانتظار قصيرة عمليًا.
bash export TYPESAFE_API_KEY="sk-..."
pip install typesafe-sdk # Python 3.10+ npm install @typesafe-ai/sdk # Node 20+
يقرأ كلا SDKs المتغير TYPESAFE_API_KEY من البيئة، ويستخدمان افتراضيًا jev-latest. وهناك endpoint واحد، هو POST https://api.typesafe.ai/v1/systemone، إذا كنت تفضل تجاوز SDK بالكامل. وتتضمن وحدة التحكم playground مع أمثلة عملية لتوجيه التذاكر، وفحص السير الذاتية، وعمليات تدقيق وكلاء الدعم.
هناك أمران يستحقان المعرفة قبل الاستدعاء الأول، وكلاهما وارد في الدليل العملي الذي نُشر خلال أول 48 ساعة. اطرح جميع الأسئلة مسبقًا بدلًا من إجراء استدعاء رخيص ثم المتابعة باستدعاء آخر، لأن الأسئلة تُقيّم بالتوازي، لذا يكلف السؤال العاشر tokens لكنه لا يضيف وقتًا يُذكر، كما يذكر cookbook الخاص بـ TypeSafe أن التجميع أرخص بنحو 12 مرة وأسرع 10 مرات من طرح الأسئلة واحدًا تلو الآخر. وأدرج دائمًا خيار other صريحًا في Choice، حتى يتمكن النموذج من القول إن لا شيء يناسب بدلًا من اختيار أقرب خيار خاطئ.
الحكم على TypeSafe Jev
التسعير هو العنوان الرئيسي، أما المعمارية فهي الحجة الفعلية. أزل إطار "نموذج Frontier" وأرقام 200x المبنية على تقييمات مصممة داخليًا، وما يبقى لا يزال أكثر ما قرأته إثارة للاهتمام عن بنية AI التحتية هذا الربع: مكوّن يصدر أحكامًا محدودة داخل البرمجيات، مع عدم يقين صادق مرفق بها، بينما يحافظ الكود الحتمي على التحكم في التنفيذ.
ما لن أفعله هو اعتبار المعايرة مثبتة. فكل ادعاء مهم، من أن الاحتمالات صادقة، إلى أن الدقة تصمد في مجال شخص آخر، إلى أن كل هذا يتحمل حمل الإنتاج، لا يزال حاليًا مُبلغًا عنه ذاتيًا من شركة لم يمض على وصولها المبكر سوى أسبوع، من دون ورقة أو إعادة إنتاج من طرف ثالث. يمكنك التحقق من السرعة والسعر في اليوم الأول. أما المعايرة فتتطلب آلاف النتائج الموسومة، ولم ينشر أحد هذه النتائج بعد.
إذًا: تسجيل في قائمة الانتظار، ومهمة تسجيل أشغّلها بالفعل على نطاق واسع، وقياس أجريه بنفسي قبل أن يتحرك أي شيء. هذا هو القدر الصحيح من الحماس لنموذج عمره أسبوع واحد، يحمل فكرة جيدة فعلًا، ولا توجد لها أدلة تحقق منها أي جهة خارج الشركة.
المصادر
إفصاح: أُجري البحث وأُعدت المسودة باستخدام Claude Opus 5 عبر personal-site MCP الخاص بي في 19 سبتمبر 2026، بالاعتماد على منشور إطلاق TypeSafe وستة تقارير مستقلة، من بينها قياس عملي واحد لـ API. لا أملك وصولًا مبكرًا إلى Jev، ولا أدعي أنني اختبرته بنفسي. وقد وُسمت الأرقام التي أبلغ عنها المورّد على هذا النحو في جميع أنحاء النص؛ وكل رقم هنا منسوب إلى مصدر أعلاه.
