مختبر
أبحاث، تجارب ومصادر مفتوحة: الأجهزة، إنترنت الأشياء، الروبوتات، التكنولوجيا الحيوية والذكاء الاصطناعي الحدي
47 published articles
الأجهزة الاستهلاكية
CMF وElektron وOhSnap يُظهرون أن العتاد الاقتصادي يتفوق على تضخّم الميزات
سماعات CMF Clip Pro بسعر 79 دولارًا، وصندوقا الإيقاع Model من Elektron بسعر 349 دولارًا، وحامل OhSnap Snap Grip Stand بسعر 50 دولارًا، كلها كسبت مراجعات The Verge عبر الاعتراف بمقايضاتها. النمط نفسه يظهر في نظارات الواقع المعزز. على المشترين الانتباه.
2026-08-23
معيار الاستدلال المالي
نماذج اللغة الكبيرة تعرف الصيغ المحاسبية. FinIndices يُظهر أنها لا تستطيع تطبيقها
يمكن لنماذج اللغة الكبيرة أن تردد الصيغ المحاسبية، لكن FinIndices، وهو معيار مبني على بيانات مالية صينية حقيقية، يُظهر أنها تكافح لتطبيقها. انخفضت دقة Gemini-3.1-Pro من 70.70% إلى 38.22% عند إزالة تلميحات الصيغ، وكان توليد الجداول يضعف استدلال النماذج بشكل مباشر.
2026-08-20
HDR10+ ADVANCED: سامسونج وبريم فيديو تطلقانه أولاً
هل يمكن للبيانات الوصفية لكل مشهد إصلاح السمعة السيئة لتنعيم الحركة؟
برايم فيديو هو أول خدمة بث تتبنى HDR10+ ADVANCED على تلفزيونات سامسونج لعام 2026 اعتبارًا من أغسطس 2026. يضيف المعيار سطوعًا إجماليًا محسّنًا وتنعيمًا ذكيًا للحركة يدرك سياق المشهد، وهي الإعداد الأسوأ سمعةً في المسرح المنزلي، وأصبحت الآن مدعومة ببيانات وصفية أكثر ذكاءً.
2026-08-11
الذكاء الاصطناعي في التعليم
المعلّمون بالذكاء الاصطناعي يفرطون في المساعدة بحكم تصميمهم. معيار جديد يقيس ذلك
معيار مبني على 462 جلسة تدريس حقيقية يجد أن المعلّمين بالذكاء الاصطناعي يقومون افتراضيًا بالعمل نيابة عن الطلاب. التنبيه الصريح يساعد، لكن النماذج ما تزال تواجه صعوبة في الحكم الأساسي: متى تدفع، ومتى توفّر سقالة، ومتى تتراجع.
2026-08-10
وكلاء الصوت
لماذا يتفوق Grok 4.1 Fast على النماذج الأذكى في المكالمات الهاتفية
الترتيبات العامة تختار نماذج LLM الخاطئة للمكالمات الصوتية. ترتيب BenchLM لعام 2026 يضع زمن الاستجابة أولاً: Grok 4.1 Fast يجيب في 0.54 ثانية بينما يحتاج Claude Opus 4.6، الأعلى تسجيلاً، إلى 1.78 ثانية. النماذج السريعة تتولى المحادثة؛ بينما تبقى نماذج التفكير لاستدعاءات الأدوات الخلفية.
2026-08-05
تقييم الذكاء الاصطناعي
المعايير القديمة للذكاء الاصطناعي تعطلت. إليك ما حل محلها.
المعايير الثابتة مثل MMLU وGSM8K مشبعة وملوثة. انتقلت الصناعة إلى إعادة التوليد الديناميكي والامتحانات الخبيرة وبيئات المهام الوكيلية للحصول على قياس حقيقي لقدرة الذكاء الاصطناعي.
2026-08-04
الهندسة والسحابة
لماذا يعرض لوحة IoT الخاصة بك بيانات الأمس، وكيفية إصلاح ذلك
معظم منصات مراقبة إنترنت الأشياء تفشل ليس في جمع البيانات بل في التسليم الموثوق. بنية متعددة الطبقات باستخدام Alibaba Cloud DataWorks تؤتمت المزامنة المجدولة، وتزيل مخاطر مثل التكرار والتأخير، وتحافظ على تحديث لوحات التحكم دون وسيطة مخصصة.
2026-08-03
تقرير خاص: تقييم الذكاء الاصطناعي
حالة قياس أداء الذكاء الاصطناعي في عام 2026: انهيار الاختبارات الثابتة والأنظمة التي حلت محلها
جولة شاملة في مشهد قياس أداء الذكاء الاصطناعي لعام 2026: لماذا انهارت MMLU وGSM8K وHumanEval، وكيف حلت محلها المعايير الديناميكية والامتحانات الخبيرة مثل HLE وGPQA Diamond، وما يكشفه اختبار العوامل والذكاء المتعرج، وكيف تكمل الآن التفضيلات البشرية، ومحكمو نماذج اللغات الكبيرة، والمراقبة الإنتاجية مجموعة التقييم الكاملة.
2026-08-03
تقييم الأداء
نماذج الرؤية الذكية الرائدة تفشل في الإدراك الأساسي، وفقًا لمعيار جديد
يختبر PerceptionBench عشر قدرات بصرية ذرية عبر 3000 سؤال. لم ينجح أي نموذج رائد في تجاوز 60%، وتخفي الدرجات الإجمالية المتشابهة ملفات ضعف مختلفة للغاية.
2026-08-03
تحليل المعايير
LiveBench يرفض البقاء ثابتًا. هذا هو المغزى كله
يستبدل LiveBench مفتاح إجابة ثابت بمجموعة محدثة باستمرار من مشاكل البرمجة والمستودعات وأسئلة التوقع، متجاوزًا التلوث الذي قوض MMLU و GSM8K. إنه جزء من تحول أوسع نحو التقييم الديناميكي إلى جانب LiveCodeBench و ForecastBench و LLMEval-Fair.
2026-08-03
مراجعة نموذج
Qwen2.5-Omni: النموذج مفتوح المصدر الذي يفعل أخيرًا ما يعد به المنافسون فقط
غوص عميق في النموذج مفتوح المصدر الذي يعالج النصوص والصور والصوت والفيديو في وقت واحد مع توليد كلام متدفق، متفوقًا على GPT-4o-mini وGemini في اختبارات معيارية متعددة، مع إمكانية تشغيله على بطاقة رسومية استهلاكية واحدة مع التكميم.
2026-08-03
تحليل قياس الأداء
5 ملايين صوت، 25 نقطة إيلو: داخل لوحة متصدرين Chatbot Arena التي لا يمكن لأحد زعزعتها
يُصنف LMSYS Chatbot Arena النماذج حسب التفضيل البشري الأعمى على مقياس إيلو، مع ما يقرب من خمسة ملايين صوت الآن تزحم المختبرات الرائدة في نطاق 25 نقطة. تحمل طرق LLM-as-a-Judge التي توسع نطاق هذا النوع من التقييم تحيزاتها الموثقة تجاه الإسهاب والموضع.
2026-08-02