SevenTnewS

IA multimodal

13 published articles

LLMs y Modelos5 min read

IA de pesos abiertos

dots3-note de Xiaohongshu: un MoE abierto de 280B que solo activa 16B

El estudio dots de Xiaohongshu ha lanzado dots3-note preview, su primer modelo de pesos abiertos: un MoE multimodal con 280B de parámetros, 16B activos y una ventana de contexto de 512K. El diseño disperso apunta a un bajo coste de inferencia en un único nodo de 8 GPU, pero la ficha aún no ha publicado cifras de benchmarks.

2026-08-20

LLMs y Modelos5 min read

Generación de video

MiniMax descartó su arquitectura probada para que H3 lo haga todo

MiniMax afirma que H3 unifica la generación de texto, imagen, video y audio en un solo modelo, fija la salida 2K por debajo de un tercio del precio de los modelos convencionales y planea abrir los pesos en cuestión de días. La letra pequeña es la verdadera historia: la empresa abandonó la arquitectura que le dio una ventaja para conseguirlo.

2026-08-07

Qwen / Alibaba4 min read

Qwen / Alibaba Cloud

Qwen2.5-Omni supera a Gemini-1.5-Pro en OmniBench y cabe en menos de 12GB

El Qwen2.5-Omni de código abierto de Alibaba superó a Gemini-1.5-Pro en OmniBench y encabezó la tabla de clasificación de razonamiento de audio MMAU. Las versiones cuantizadas reducen la VRAM a menos de 12GB y la compatibilidad con MNN lleva el chat de voz en tiempo real a los teléfonos.

2026-08-07

IoT y Sensores4 min read

Análisis de modelo

Qwen2.5-Omni: el modelo de código abierto que finalmente hace lo que los competidores solo prometen

Una inmersión profunda en el modelo de código abierto que procesa simultáneamente texto, imágenes, audio y video mientras genera voz en streaming, superando a GPT-4o-mini y Gemini en múltiples evaluaciones, y que cabe en una sola GPU de consumo con cuantización.

2026-08-03

Laboratorios e Investigación3 min read

Modelos Fundacionales de Grafos

La transferencia zero-shot en grafos tiene un punto ciego multimodal. CHARM ofrece una solución

CHARM reemplaza las características aisladas de los nodos con contextos de grafos estructurados que capturan semántica multimodal y relaciones entre modalidades. Al mapear patrones específicos de dominio a conceptos compartidos de alto nivel, el modelo logra transferencia zero-shot a través de grafos con texto, imágenes y otras modalidades.

2026-08-01

IA4 min read

Generación de vídeo

MiniMax H3 subcotiza a los rivales de vídeo y planea liberar sus pesos

MiniMax agrupa la generación de imagen, vídeo y audio en un solo modelo, fija el precio de la salida en menos de un tercio de las tarifas por segundo convencionales y planea liberar los pesos en cuestión de días. Hasta qué punto los resultados se sostienen fuera de sus propias demos es la cuestión abierta.

2026-07-30

Qwen / Alibaba2 min read

Inteligencia Artificial

El modelo de 7B que supera a los más grandes, funciona en un teléfono y cambia la ecuación de costos de la IA

El Qwen2.5-Omni de Alibaba Cloud es un modelo de 7B que maneja texto, imágenes, audio y video, generando voz y texto en tiempo real. Su arquitectura Thinker-Talker y la incrustación posicional TMRoPE permiten la interacción en streaming, y la variante de 3B se ejecuta en SoCs móviles como Snapdragon 8 Gen 1 a velocidades utilizables.

2026-07-23

IA5 min read

IA multimodal

Qwen2.5-Omni de Alibaba quiere ser el modelo que oye, ve y habla, todo a la vez

Qwen2.5-Omni de Alibaba Cloud procesa texto, imágenes, audio y video de extremo a extremo, generando texto y habla natural en tiempo real. Los puntos de referencia muestran que a menudo iguala o supera a los modelos especializados de modalidad única, lo que sugiere un cambio hacia arquitecturas unificadas.

2026-07-20

LLMs y Modelos2 min read

IA multimodal

Un modelo de 12B supera a uno de 90B. La ortodoxia del escalado está en aprietos

Pixtral-12B iguala o supera a modelos siete veces más grandes en benchmarks multimodales, sin sacrificar el rendimiento lingüístico. Mistral también publica un nuevo benchmark abierto para la evaluación práctica de lenguaje visual, desafiando la idea de que más grande siempre es mejor.

2026-07-17

PLN y MLFeatured4 min read

IA Física

El Qwen de Alibaba es ahora el cerebro dentro de 150.000 robots, coches, gafas y drones

La familia de IA Qwen de Alibaba ahora impulsa más de 150.000 dispositivos hardware, desde robots humanoides hasta cámaras infantiles, mientras la empresa gira de los chatbots a la IA Física, integrando modelos multimodales en robots, coches, gafas y drones.

2026-07-14

LLMs y ModelosFeatured4 min read

Google DeepMind

Gemma 4 acaba de hacer que todos los demás modelos de peso abierto parezcan 10 veces demasiado grandes

La familia de peso abierto nativamente multimodal Gemma 4 de Google DeepMind introduce modo de pensamiento, arquitectura sin codificador y opciones MoE. El modelo de 2.3B iguala el rendimiento del Gemma 3 de 27B. El modelo de 31B lidera las tablas de clasificación de peso abierto.

2026-07-13

LLMs y Modelos2 min read

Alibaba Cloud

El Spark Serverless EMR de Alibaba Cloud ahora procesa imágenes y video en SQL puro, sin necesidad de Python

El Spark Serverless EMR de Alibaba Cloud ahora admite imágenes y fotogramas de video directamente en SQL, permitiendo a los ingenieros de datos evitar la sobrecarga de Python. Un caso de estudio sobre preprocesamiento de datos de conducción autónoma muestra pipelines ETL automatizados impulsados por modelos de visión Qwen que reemplazan la anotación manual.

2026-07-09

← PreviousPage 1 / 2 · 13 articlesNext →