SevenTnewS

视觉与扩散

图像与视频生成及多模态模型。

8 published articles

Featured5 min read

视频AI研究

上下文匹配蒸馏如何阻止视频教师模型窥见未来

视频蒸馏长期以来一直训练因果学生,而教师则用未来知识对完整片段进行评分。CMD 用因果教师取代了这一评分方式,增加了前缀评分的目标,并在自回归方法中报告了最先进的结果。

2026-08-14

3 min read

AI 设计工具

替换一个元素,Reve 的 Templates 就会重绘其余部分

Reve 的 Templates 可将一张产品照片变成完整设计:替换产品或文字,模板其余部分会自动更新。该功能已在 Reve.com 上线。

2026-08-08

4 min read

计算机视觉

CABiNet以八分之一算力将差距保持在YOLO26x的2个百分点以内

VDD语义分割模型库将基于多样化无人机影像训练的YOLO26和CABiNet模型带到Hugging Face。YOLO26x-sem以78.83%的mIoU领跑,但CABiNet-Large在54.8 GFLOPs下取得77.76%的成绩,为效率优势提供了论据。

2026-08-07

Featured3 min read

AI视频生成

Wan3.0-Video按秒计费:一条30秒视频收费6美元

阿里巴巴的Wan3.0-Video在DashScope上按秒计费,一条30秒1080P视频每次生成花费6美元。我们解析了定价分层、多输入工作流程,以及该列表未解答的问题。

2026-08-07

Featured3 min read

AI 图像生成

Reve 2.1 以十分之一算力位居 Arena 第二

Reve 2.1 声称在 Arena 排行榜上整体排名第二,而训练算力不到周围实验室的十分之一。该公司还详细介绍了 4K 输出、可寻址区域和多语言文本渲染。

2026-08-05

4 min read

计算机视觉、世界模型与AI研究

PhiZero:在渲染前教视频AI用物理规律思考

PhiZero是CASIA的世界模型,它从原始视频中学习一种紧凑的离散“物理语言”,并在渲染帧之前用这种语言推理场景将如何演变。作者认为,这种先推理后渲染的设计比直接预测像素能产生物理上更一致的视频。

2026-07-31

4 min read

AI 研究

VideoCoCo 通过在 Blender 代码中思考,修复 AI 视频错乱的物理

VideoCoCo 将可执行的 Blender 代码视为思维链:编码代理编写场景脚本,模拟器将其演绎出来,视频引擎让结果达到照片级逼真。这种分工针对文生视频的物理问题,并在 PhyGenBench 和 VBench-2.0 上取得了最佳平均分。

2026-07-30

3 min read

AI图像生成

这款中国AI图像工具解决了Midjourney无法做到的事

智谱AI的GLM-Image修复了AI图像生成中的一个明显盲点:准确的中文文本渲染,免费、无限制、无水印。对中文创作者来说是一款实用的工具。

2026-07-17