GGUF وGPTQ وAWQ وEXL2: كيف تستخدم صيغ تكميم LLM الذاكرة فعليًا
قارن استخدام الذاكرة بين GGUF وGPTQ وAWQ وEXL2، من حجم ملف Q4_K_M إلى نمو ذاكرة KV cache والنفقات الإضافية لبيئة التشغيل.
اختر بلدًا لعرض Cloudzy بلغتك.
الفئة
22 posts
قارن استخدام الذاكرة بين GGUF وGPTQ وAWQ وEXL2، من حجم ملف Q4_K_M إلى نمو ذاكرة KV cache والنفقات الإضافية لبيئة التشغيل.
تتيح الذاكرة الموحدة لجهاز AI PC مدمج تحميل نماذج من فئة 235B لا يستطيع أي GPU منفرد بسعة 24-32GB استيعابها. ما هي، ولماذا تنجح، ولماذا لا يعني الأكبر الأسرع.
شغّلت AMD نموذجاً بتريليون معامل على أربعة أجهزة كمبيوتر مصغّرة. القصة الحقيقية هي الخدعة المعمارية التي تجعله صحيحاً، والانتظار بين 40 ثانية و4 دقائق الذي تتخطّاه ورقة المواصفات.
How do AI models like GameNGen, Oasis, and Genie 3 generate playable games with no game engine? A clear look at how next-frame prediction works, why these worlds drift, and what th
Neural rendering is AI that predicts pixels, lighting, and detail instead of computing them. Here is what it actually means, how DLSS fits, and what is real vs. hype.
مقارنة بين Claude Code وCodex CLI وGemini CLI وCline من حيث المرونة والاستقلالية والتسعير والاختبارات المعيارية، إضافة إلى ما يعنيه إيقاف Gemini CLI في 2026.
ملف markdown واحد أخبر للتو 178,000 مطوّر بكيفية ضبط سلوك الذكاء الاصطناعي. وكلاء أمن، وقواعد وصولية، وهيئات معايير، ما الذي يحدث فعلًا.
إطار تنفيذ العميل هو البرنامج المحيط بـ LLM الذي يجعله يتصرف كعميل. هنا ما هو الإطار التنفيذي ومكوناته ولماذا هو أكثر أهمية من النموذج.
تفشل حلقات وكيل AI في بيئة الإنتاج لستة أسباب متكررة، من الحلقات اللانهائية إلى عواصف إعادة المحاولة. إليك ما يتعطّل وكيفية إصلاحه في كل حالة.
غيّرت الإعداد الافتراضي في Claude Code إلى Fable 5 منذ اليوم الأول. ثلاثة أشياء تغيرت فعلًا في سير عملي، وشيء واحد محبط. إليك رأيي الحقيقي.
OpenCode vs OpenClaw is mostly a choice between a coding agent that works inside your repo and an always-on assistant gateway that connects chat apps, tools, and scheduled actions.
OpenCode vs Claude Code boils down to a choice between a managed AI coding agent and a coding agent you can run in your own environment. Claude Code is easier to start with because
Claude Code is still one of the strongest coding agents around, but a lot of developers are now picking tools based on workflow, model access, and long-term cost instead of stickin
With the ever-rising demand for local LLMs, many users find themselves confused when choosing the most suitable one, but using them isn’t as simple as you might think. Being modera
Choosing a GPU VPS can feel overwhelming when you’re staring at spec sheets filled with numbers. Core counts jump from 2,560 to 21,760, but what does that mean? A CUDA core is a pa
If your plan is to buy a new GPU to stop seeing out-of-memory errors, 5070 Ti vs 5080 is the wrong argument. Both cards land on 16 GB of VRAM, and that capacity limit shows up in d
If you’re deciding H100 vs RTX 4090 for AI, keep in mind that most “benchmarks” don’t matter until your model and cache actually fit in VRAM. RTX 4090 is the sweet spot for single-
In recent years, artificial intelligence (AI) has dramatically reshaped the way we approach a variety of tasks, from content creation and technical problem-solving to coding and re
Ensemble learning is a machine learning technique where it combines two or more learners to make better predictions. Learner is the algorithm or process that takes in data and lear
One of, if not the most important, aspect of machine learning is achieving accurate and reliable predictions. One innovative approach for this goal that has gained prominence is Bo
When OpenAI introduced ChatGPT to the public in November 2022, it quickly became a widespread phenomenon, with possibilities that truly felt endless. Through continuous development
Machine learning and its subcategory, deep learning, require a substantial amount of computational power that can only be provided by GPUs. However, any GPU won’t do, so here are t