مختبر

أبحاث، تجارب ومصادر مفتوحة: الأجهزة، إنترنت الأشياء، الروبوتات، التكنولوجيا الحيوية والذكاء الاصطناعي الحدي

47 published articles

5 min read

الأجهزة الاستهلاكية

CMF وElektron وOhSnap يُظهرون أن العتاد الاقتصادي يتفوق على تضخّم الميزات

سماعات CMF Clip Pro بسعر 79 دولارًا، وصندوقا الإيقاع Model من Elektron بسعر 349 دولارًا، وحامل OhSnap Snap Grip Stand بسعر 50 دولارًا، كلها كسبت مراجعات The Verge عبر الاعتراف بمقايضاتها. النمط نفسه يظهر في نظارات الواقع المعزز. على المشترين الانتباه.

2026-08-23

4 min read

معيار الاستدلال المالي

نماذج اللغة الكبيرة تعرف الصيغ المحاسبية. FinIndices يُظهر أنها لا تستطيع تطبيقها

يمكن لنماذج اللغة الكبيرة أن تردد الصيغ المحاسبية، لكن FinIndices، وهو معيار مبني على بيانات مالية صينية حقيقية، يُظهر أنها تكافح لتطبيقها. انخفضت دقة Gemini-3.1-Pro من 70.70% إلى 38.22% عند إزالة تلميحات الصيغ، وكان توليد الجداول يضعف استدلال النماذج بشكل مباشر.

2026-08-20

4 min read

HDR10+ ADVANCED: سامسونج وبريم فيديو تطلقانه أولاً

هل يمكن للبيانات الوصفية لكل مشهد إصلاح السمعة السيئة لتنعيم الحركة؟

برايم فيديو هو أول خدمة بث تتبنى HDR10+ ADVANCED على تلفزيونات سامسونج لعام 2026 اعتبارًا من أغسطس 2026. يضيف المعيار سطوعًا إجماليًا محسّنًا وتنعيمًا ذكيًا للحركة يدرك سياق المشهد، وهي الإعداد الأسوأ سمعةً في المسرح المنزلي، وأصبحت الآن مدعومة ببيانات وصفية أكثر ذكاءً.

2026-08-11

5 min read

الذكاء الاصطناعي في التعليم

المعلّمون بالذكاء الاصطناعي يفرطون في المساعدة بحكم تصميمهم. معيار جديد يقيس ذلك

معيار مبني على 462 جلسة تدريس حقيقية يجد أن المعلّمين بالذكاء الاصطناعي يقومون افتراضيًا بالعمل نيابة عن الطلاب. التنبيه الصريح يساعد، لكن النماذج ما تزال تواجه صعوبة في الحكم الأساسي: متى تدفع، ومتى توفّر سقالة، ومتى تتراجع.

2026-08-10

5 min read

وكلاء الصوت

لماذا يتفوق Grok 4.1 Fast على النماذج الأذكى في المكالمات الهاتفية

الترتيبات العامة تختار نماذج LLM الخاطئة للمكالمات الصوتية. ترتيب BenchLM لعام 2026 يضع زمن الاستجابة أولاً: Grok 4.1 Fast يجيب في 0.54 ثانية بينما يحتاج Claude Opus 4.6، الأعلى تسجيلاً، إلى 1.78 ثانية. النماذج السريعة تتولى المحادثة؛ بينما تبقى نماذج التفكير لاستدعاءات الأدوات الخلفية.

2026-08-05

Featured5 min read

تقييم الذكاء الاصطناعي

المعايير القديمة للذكاء الاصطناعي تعطلت. إليك ما حل محلها.

المعايير الثابتة مثل MMLU وGSM8K مشبعة وملوثة. انتقلت الصناعة إلى إعادة التوليد الديناميكي والامتحانات الخبيرة وبيئات المهام الوكيلية للحصول على قياس حقيقي لقدرة الذكاء الاصطناعي.

2026-08-04

Featured3 min read

الهندسة والسحابة

لماذا يعرض لوحة IoT الخاصة بك بيانات الأمس، وكيفية إصلاح ذلك

معظم منصات مراقبة إنترنت الأشياء تفشل ليس في جمع البيانات بل في التسليم الموثوق. بنية متعددة الطبقات باستخدام Alibaba Cloud DataWorks تؤتمت المزامنة المجدولة، وتزيل مخاطر مثل التكرار والتأخير، وتحافظ على تحديث لوحات التحكم دون وسيطة مخصصة.

2026-08-03

Featured8 min read

تقرير خاص: تقييم الذكاء الاصطناعي

حالة قياس أداء الذكاء الاصطناعي في عام 2026: انهيار الاختبارات الثابتة والأنظمة التي حلت محلها

جولة شاملة في مشهد قياس أداء الذكاء الاصطناعي لعام 2026: لماذا انهارت MMLU وGSM8K وHumanEval، وكيف حلت محلها المعايير الديناميكية والامتحانات الخبيرة مثل HLE وGPQA Diamond، وما يكشفه اختبار العوامل والذكاء المتعرج، وكيف تكمل الآن التفضيلات البشرية، ومحكمو نماذج اللغات الكبيرة، والمراقبة الإنتاجية مجموعة التقييم الكاملة.

2026-08-03

Featured3 min read

تقييم الأداء

نماذج الرؤية الذكية الرائدة تفشل في الإدراك الأساسي، وفقًا لمعيار جديد

يختبر PerceptionBench عشر قدرات بصرية ذرية عبر 3000 سؤال. لم ينجح أي نموذج رائد في تجاوز 60%، وتخفي الدرجات الإجمالية المتشابهة ملفات ضعف مختلفة للغاية.

2026-08-03

Featured2 min read

تحليل المعايير

LiveBench يرفض البقاء ثابتًا. هذا هو المغزى كله

يستبدل LiveBench مفتاح إجابة ثابت بمجموعة محدثة باستمرار من مشاكل البرمجة والمستودعات وأسئلة التوقع، متجاوزًا التلوث الذي قوض MMLU و GSM8K. إنه جزء من تحول أوسع نحو التقييم الديناميكي إلى جانب LiveCodeBench و ForecastBench و LLMEval-Fair.

2026-08-03

4 min read

مراجعة نموذج

Qwen2.5-Omni: النموذج مفتوح المصدر الذي يفعل أخيرًا ما يعد به المنافسون فقط

غوص عميق في النموذج مفتوح المصدر الذي يعالج النصوص والصور والصوت والفيديو في وقت واحد مع توليد كلام متدفق، متفوقًا على GPT-4o-mini وGemini في اختبارات معيارية متعددة، مع إمكانية تشغيله على بطاقة رسومية استهلاكية واحدة مع التكميم.

2026-08-03

Featured2 min read

تحليل قياس الأداء

5 ملايين صوت، 25 نقطة إيلو: داخل لوحة متصدرين Chatbot Arena التي لا يمكن لأحد زعزعتها

يُصنف LMSYS Chatbot Arena النماذج حسب التفضيل البشري الأعمى على مقياس إيلو، مع ما يقرب من خمسة ملايين صوت الآن تزحم المختبرات الرائدة في نطاق 25 نقطة. تحمل طرق LLM-as-a-Judge التي توسع نطاق هذا النوع من التقييم تحيزاتها الموثقة تجاه الإسهاب والموضع.

2026-08-02

← PreviousPage 1 / 4 · 47 articlesNext →