GGUF
2 published articles
开源3 min read
模型量化
Unsloth 将 9750 亿参数 Inkling 模型压缩至 270 GB,准确率保留 74%
Unsloth 的动态 GGUF 量化将 9750 亿参数的开放模型 Inkling 从 1.9 TB 压缩至 1 位下的 270 GB,准确率保留 74.2%。该方法有选择性地保留高精度层,从而实现在配备 290 GB 以上 RAM+VRAM 的机器上进行本地推理。
2026-07-16
工具与框架Featured3 min read
本地 AI
Ollama 0.30 带来更快的 GPU 推理和原生 GGUF 模型支持
Ollama 0.30 将 NVIDIA 推理速度提升高达 20%,默认启用对 AMD 和 Intel 设备的 Vulkan GPU 支持,并扩展了 GGUF 模型兼容性,包括来自 Hugging Face 的微调模型以及对编码代理工具调用的支持。
2026-06-05