具身智能
7 published articles
人工智能
新型黑盒攻击揭示:类镜头噪声可轻易干扰视觉语言导航智能体
AdvNav 是一种黑盒对抗攻击,利用类似镜头的 Perlin 噪声混淆视觉语言导航智能体。仅通过观察智能体的行为(而非内部权重),该方法实现了高达87%的攻击成功率。该框架揭示了当前 VLN 系统普遍存在的脆弱性。
2026-07-28
具身智能
机器人仿真栈正在悄然分裂与重组
机器人仿真已成为具身智能训练的支柱。随着引擎的增多和专业化,问题不再是哪一个最快,而是哪些抽象层将作为共享基础设施存活下来。NVIDIA、DeepMind和迪士尼支持的Newton指向了一个开放、分层的未来。
2026-07-25
AI研究
阿里巴巴通义千问将世界建模转化为语言问题
Qwen-AgentWorld是一种原生语言世界模型,可在七个领域模拟智能体环境。通过从一开始就将环境建模作为训练目标,它为基于视频的世界模型和特定领域模拟器提供了另一种选择,用于具身AI。
2026-07-19
具身AI
Qwen新机器人模型摒弃常见AI捷径
阿里巴巴Qwen团队发布了三款机器人专用基础模型和一个智能体环境世界模型,从通用视觉语言模型转向为物理行动专门构建的架构。
2026-07-18
具身智能
Mistral的80亿参数小模型让办公机器人不再依赖激光雷达
Mistral AI的Robostral Navigate是一个80亿参数的模型,仅使用一个RGB摄像头就在R2R-CE基准测试中达到76.6%的成功率,比多传感器方法高出4.5个百分点。它通过模拟数据和一种token高效的前缀缓存方法构建,能够跨机器人类型泛化并适应未见过的障碍物。
2026-07-17
具身智能
小米发布380亿参数具身智能开源大模型,突破数据瓶颈
凭借一个统一四项机器人任务的380亿参数模型,并开源整个流程,小米旨在打破具身智能的数据瓶颈。早期基准测试显示,在使用模型增强数据训练时,任务完成率提升了26%。
2026-07-15
机器人AI
Mistral AI的8B机器人模型用一个摄像头、无深度传感器创下导航新纪录
Mistral AI推出Robostral Navigate,一个紧凑的8B模型,让机器人仅用单个摄像头就能在复杂室内环境中导航。它在R2R-CE基准测试中比多传感器方法高出4.5个百分点,可运行于轮式、足式和飞行机器人,并通过前缀缓存高效训练,将令牌数量减少22倍。
2026-07-08