合成数据
3 published articles
NLP与机器学习6 min read
具身智能
小米发布380亿参数具身智能开源大模型,突破数据瓶颈
凭借一个统一四项机器人任务的380亿参数模型,并开源整个流程,小米旨在打破具身智能的数据瓶颈。早期基准测试显示,在使用模型增强数据训练时,任务完成率提升了26%。
2026-07-15
大语言模型与模型4 min read
合成数据策略
英伟达数据图谱显示:合成数据比模型权重更重要
英伟达的Nemotron Post-Training v3 Prompt Atlas提供了一张包含数十亿合成数据样本的交互式地图,凸显了开放合成数据是构建可靠AI智能体所缺失的关键层。该公司认为,智能体行为必须可审计,而开放发布的合成数据是唯一既能保留专有信号又不泄露商业机密的方式。
2026-07-12
NLP与机器学习4 min read
合成数据
没有老板,没有瓶颈:点对点框架重塑合成数据生成方式
Matrix是一个去中心化框架,通过分布式队列传递序列化消息,实现多智能体合成数据生成。通过消除中央协调器,在相同硬件上实现了2到15倍的吞吐量提升。
2026-06-06