llama.cpp
2 published articles
نماذج اللغات الكبيرةFeatured6 min read
LLMs & الاستدلال
الرياضيات وراء التسريع: كيف يخفي الترميز التخميني زمن الاستجابة دون تغيير المخرجات
يعمل الترميز التخميني على تسريع التوليد التلقائي من خلال اقتراح رموز مرشحة بآلية مسودة رخيصة والتحقق منها في تمريرة أمامية واحدة للنموذج المستهدف، دون تغيير المخرجات. يحلل هذا التقرير الرياضيات، والطرق الرئيسية (نماذج المسودة، EAGLE-3، DFLASH، توقع الرموز المتعددة، n-gram)، وما تعنيه معدلات القبول فعليًا لزمن الاستجابة في العالم الحقيقي.
2026-07-21
الأدوات والأطرFeatured3 min read
الذكاء الاصطناعي المحلي
Ollama 0.30 يجلب تسريعًا أسرع لوحدة معالجة الرسوميات ودعمًا أصليًا لنماذج GGUF
يعزز إصدار Ollama 0.30 سرعة استدلال NVIDIA بنسبة تصل إلى 20%، ويمكّن دعم Vulkan لوحدة معالجة الرسوميات افتراضيًا لأجهزة AMD وIntel، ويوسع توافق نماذج GGUF، بما في ذلك النماذج المضبوطة بدقة من Hugging Face ودعم استدعاء الأدوات مع وكلاء البرمجة.
2026-06-05