SevenTnewS

Visión y Difusión

Generación de imágenes y videos y modelos multimodales.

8 published articles

Featured5 min read

Investigación en IA de video

Cómo Context-Matched Distillation impide que los maestros de video vean el futuro

Durante mucho tiempo, la destilación de video ha entrenado a estudiantes causales con profesores que puntúan clips completos usando conocimiento futuro. CMD reemplaza esa puntuación con un profesor causal, añade objetivos puntuados por prefijo y reporta resultados de vanguardia entre los métodos autorregresivos.

2026-08-14

3 min read

Herramientas de diseño con IA

Intercambia un elemento y las plantillas de Reve redibujan el resto

Las plantillas de Reve convierten una sola foto de producto en un diseño completo: intercambia el producto o el texto y el resto de la plantilla se actualiza automáticamente. La función ya está disponible en Reve.com.

2026-08-08

4 min read

Visión por Computadora

CABiNet se mantiene a menos de 2 puntos de YOLO26x con la octava parte del cómputo

El VDD Semantic Segmentation Model Zoo trae a Hugging Face modelos YOLO26 y CABiNet entrenados con metraje variado de drones. YOLO26x-sem lidera con 78.83% de mIoU, pero el 77.76% de CABiNet-Large a 54.8 GFLOPs plantea el caso de la eficiencia.

2026-08-07

Featured3 min read

Generación de video con IA

Wan3.0-Video se cobra por segundo: un clip de 30 segundos asciende a $6

El Wan3.0-Video de Alibaba factura por segundo en DashScope, con un clip de 30 segundos en 1080P que cuesta $6 por generación. Desglosamos los niveles de precios, el flujo de trabajo de múltiples entradas y las preguntas que la publicación deja sin responder.

2026-08-07

Featured3 min read

Generación de imágenes con IA

Reve 2.1 logra el segundo puesto en Arena con una décima parte del cómputo

Reve 2.1 afirma el segundo puesto general en las tablas de Arena mientras se entrena con menos de una décima parte del cómputo de los laboratorios que lo rodean. La compañía también detalla la salida en 4K, las regiones direccionables y el renderizado de texto multilingüe.

2026-08-05

4 min read

Visión por computadora, modelos del mundo e investigación en IA

PhiZero: enseñar a la IA de video a pensar en física antes de renderizar

PhiZero, un modelo del mundo de CASIA, aprende un compacto "lenguaje físico" discreto a partir de video sin procesar y lo usa para razonar sobre cómo evolucionará una escena antes de renderizar fotogramas. Los autores sostienen que este diseño de razonar-luego-renderizar produce video más físicamente coherente que la predicción directa de píxeles.

2026-07-31

4 min read

Investigación en IA

VideoCoCo corrige la física rota de los videos de IA pensando en código de Blender

VideoCoCo trata el código ejecutable de Blender como una cadena de pensamiento: un agente de codificación programa una escena, un simulador la reproduce y un motor de video hace que el resultado sea fotorrealista. Esta división ataca el problema de la física del texto a video y logra las mejores puntuaciones medias en PhyGenBench y VBench-2.0.

2026-07-30

3 min read

Generación de imágenes con IA

La herramienta china de imágenes con IA que arregló lo que Midjourney no pudo

GLM-Image de Zhipu AI soluciona un punto ciego evidente en la generación de imágenes con IA: el renderizado preciso de texto chino, de forma gratuita y sin límites ni marcas de agua. Una herramienta práctica para creadores de habla china.

2026-07-17