推理成本
4 published articles
人工智能3 min read
开放权重推理
英伟达Nemotron-4:速度快、开放,直指Llama与GPT之间的鸿沟
英伟达的Nemotron-4系列以具有竞争力的MMLU分数和声称的推理成本降低30%挑战Llama 3.3和Mistral Large。其开放许可和双尺寸策略使其成为团队大规模运行智能体工作负载的实用替代方案。
2026-07-25
人工智能Featured2 min read
成本工程
微软测试中国模型,Copilot成本或削减高达6亿美元
微软正准备在Copilot中测试Moonshot AI的Kimi K3模型,以期将AI推理成本削减高达6亿美元。该公司正在寻找比OpenAI和Anthropic模型更便宜的替代方案,但这款中国开源权重模型仍需通过质量和延迟测试。
2026-07-21
人工智能Featured5 min read
AI 基础设施
Nvidia Nemotron 3 Ultra 颠覆智能体工作流成本方程
Nemotron 3 Ultra,Nvidia 的密集-稀疏智能体模型,承诺将推理成本降低高达 30%(相比同级开源模型),同时保持前沿推理能力。凭借 100 万 token 上下文窗口和原生 NVFP4 量化,它被定位为企业工具调用工作负载的主力模型。
2026-06-04
人工智能Featured2 min read
Qwen3.7
时区漏洞让AI推理成本降低80%
Model Studio在夜间窗口期自动将Qwen3.7-Max和Qwen3.7-Plus API成本降低高达80%,该窗口期恰好覆盖美国和欧洲的工作时间。无需注册、无需修改代码,只要时机得当,任何人都能享受更便宜的推理。
2026-05-20