Visión y Difusión
Generación de imágenes y videos y modelos multimodales.
8 published articles
Investigación en IA de video
Cómo Context-Matched Distillation impide que los maestros de video vean el futuro
Durante mucho tiempo, la destilación de video ha entrenado a estudiantes causales con profesores que puntúan clips completos usando conocimiento futuro. CMD reemplaza esa puntuación con un profesor causal, añade objetivos puntuados por prefijo y reporta resultados de vanguardia entre los métodos autorregresivos.
2026-08-14
Herramientas de diseño con IA
Intercambia un elemento y las plantillas de Reve redibujan el resto
Las plantillas de Reve convierten una sola foto de producto en un diseño completo: intercambia el producto o el texto y el resto de la plantilla se actualiza automáticamente. La función ya está disponible en Reve.com.
2026-08-08
Visión por Computadora
CABiNet se mantiene a menos de 2 puntos de YOLO26x con la octava parte del cómputo
El VDD Semantic Segmentation Model Zoo trae a Hugging Face modelos YOLO26 y CABiNet entrenados con metraje variado de drones. YOLO26x-sem lidera con 78.83% de mIoU, pero el 77.76% de CABiNet-Large a 54.8 GFLOPs plantea el caso de la eficiencia.
2026-08-07
Generación de video con IA
Wan3.0-Video se cobra por segundo: un clip de 30 segundos asciende a $6
El Wan3.0-Video de Alibaba factura por segundo en DashScope, con un clip de 30 segundos en 1080P que cuesta $6 por generación. Desglosamos los niveles de precios, el flujo de trabajo de múltiples entradas y las preguntas que la publicación deja sin responder.
2026-08-07
Generación de imágenes con IA
Reve 2.1 logra el segundo puesto en Arena con una décima parte del cómputo
Reve 2.1 afirma el segundo puesto general en las tablas de Arena mientras se entrena con menos de una décima parte del cómputo de los laboratorios que lo rodean. La compañía también detalla la salida en 4K, las regiones direccionables y el renderizado de texto multilingüe.
2026-08-05
Visión por computadora, modelos del mundo e investigación en IA
PhiZero: enseñar a la IA de video a pensar en física antes de renderizar
PhiZero, un modelo del mundo de CASIA, aprende un compacto "lenguaje físico" discreto a partir de video sin procesar y lo usa para razonar sobre cómo evolucionará una escena antes de renderizar fotogramas. Los autores sostienen que este diseño de razonar-luego-renderizar produce video más físicamente coherente que la predicción directa de píxeles.
2026-07-31
Investigación en IA
VideoCoCo corrige la física rota de los videos de IA pensando en código de Blender
VideoCoCo trata el código ejecutable de Blender como una cadena de pensamiento: un agente de codificación programa una escena, un simulador la reproduce y un motor de video hace que el resultado sea fotorrealista. Esta división ataca el problema de la física del texto a video y logra las mejores puntuaciones medias en PhyGenBench y VBench-2.0.
2026-07-30
Generación de imágenes con IA
La herramienta china de imágenes con IA que arregló lo que Midjourney no pudo
GLM-Image de Zhipu AI soluciona un punto ciego evidente en la generación de imágenes con IA: el renderizado preciso de texto chino, de forma gratuita y sin límites ni marcas de agua. Una herramienta práctica para creadores de habla china.
2026-07-17