IA multimodal
13 published articles
IA de pesos abiertos
dots3-note de Xiaohongshu: un MoE abierto de 280B que solo activa 16B
El estudio dots de Xiaohongshu ha lanzado dots3-note preview, su primer modelo de pesos abiertos: un MoE multimodal con 280B de parámetros, 16B activos y una ventana de contexto de 512K. El diseño disperso apunta a un bajo coste de inferencia en un único nodo de 8 GPU, pero la ficha aún no ha publicado cifras de benchmarks.
2026-08-20
Generación de video
MiniMax descartó su arquitectura probada para que H3 lo haga todo
MiniMax afirma que H3 unifica la generación de texto, imagen, video y audio en un solo modelo, fija la salida 2K por debajo de un tercio del precio de los modelos convencionales y planea abrir los pesos en cuestión de días. La letra pequeña es la verdadera historia: la empresa abandonó la arquitectura que le dio una ventaja para conseguirlo.
2026-08-07
Qwen / Alibaba Cloud
Qwen2.5-Omni supera a Gemini-1.5-Pro en OmniBench y cabe en menos de 12GB
El Qwen2.5-Omni de código abierto de Alibaba superó a Gemini-1.5-Pro en OmniBench y encabezó la tabla de clasificación de razonamiento de audio MMAU. Las versiones cuantizadas reducen la VRAM a menos de 12GB y la compatibilidad con MNN lleva el chat de voz en tiempo real a los teléfonos.
2026-08-07
Análisis de modelo
Qwen2.5-Omni: el modelo de código abierto que finalmente hace lo que los competidores solo prometen
Una inmersión profunda en el modelo de código abierto que procesa simultáneamente texto, imágenes, audio y video mientras genera voz en streaming, superando a GPT-4o-mini y Gemini en múltiples evaluaciones, y que cabe en una sola GPU de consumo con cuantización.
2026-08-03
Modelos Fundacionales de Grafos
La transferencia zero-shot en grafos tiene un punto ciego multimodal. CHARM ofrece una solución
CHARM reemplaza las características aisladas de los nodos con contextos de grafos estructurados que capturan semántica multimodal y relaciones entre modalidades. Al mapear patrones específicos de dominio a conceptos compartidos de alto nivel, el modelo logra transferencia zero-shot a través de grafos con texto, imágenes y otras modalidades.
2026-08-01
Generación de vídeo
MiniMax H3 subcotiza a los rivales de vídeo y planea liberar sus pesos
MiniMax agrupa la generación de imagen, vídeo y audio en un solo modelo, fija el precio de la salida en menos de un tercio de las tarifas por segundo convencionales y planea liberar los pesos en cuestión de días. Hasta qué punto los resultados se sostienen fuera de sus propias demos es la cuestión abierta.
2026-07-30
Inteligencia Artificial
El modelo de 7B que supera a los más grandes, funciona en un teléfono y cambia la ecuación de costos de la IA
El Qwen2.5-Omni de Alibaba Cloud es un modelo de 7B que maneja texto, imágenes, audio y video, generando voz y texto en tiempo real. Su arquitectura Thinker-Talker y la incrustación posicional TMRoPE permiten la interacción en streaming, y la variante de 3B se ejecuta en SoCs móviles como Snapdragon 8 Gen 1 a velocidades utilizables.
2026-07-23
IA multimodal
Qwen2.5-Omni de Alibaba quiere ser el modelo que oye, ve y habla, todo a la vez
Qwen2.5-Omni de Alibaba Cloud procesa texto, imágenes, audio y video de extremo a extremo, generando texto y habla natural en tiempo real. Los puntos de referencia muestran que a menudo iguala o supera a los modelos especializados de modalidad única, lo que sugiere un cambio hacia arquitecturas unificadas.
2026-07-20
IA multimodal
Un modelo de 12B supera a uno de 90B. La ortodoxia del escalado está en aprietos
Pixtral-12B iguala o supera a modelos siete veces más grandes en benchmarks multimodales, sin sacrificar el rendimiento lingüístico. Mistral también publica un nuevo benchmark abierto para la evaluación práctica de lenguaje visual, desafiando la idea de que más grande siempre es mejor.
2026-07-17
IA Física
El Qwen de Alibaba es ahora el cerebro dentro de 150.000 robots, coches, gafas y drones
La familia de IA Qwen de Alibaba ahora impulsa más de 150.000 dispositivos hardware, desde robots humanoides hasta cámaras infantiles, mientras la empresa gira de los chatbots a la IA Física, integrando modelos multimodales en robots, coches, gafas y drones.
2026-07-14
Google DeepMind
Gemma 4 acaba de hacer que todos los demás modelos de peso abierto parezcan 10 veces demasiado grandes
La familia de peso abierto nativamente multimodal Gemma 4 de Google DeepMind introduce modo de pensamiento, arquitectura sin codificador y opciones MoE. El modelo de 2.3B iguala el rendimiento del Gemma 3 de 27B. El modelo de 31B lidera las tablas de clasificación de peso abierto.
2026-07-13
Alibaba Cloud
El Spark Serverless EMR de Alibaba Cloud ahora procesa imágenes y video en SQL puro, sin necesidad de Python
El Spark Serverless EMR de Alibaba Cloud ahora admite imágenes y fotogramas de video directamente en SQL, permitiendo a los ingenieros de datos evitar la sobrecarga de Python. Un caso de estudio sobre preprocesamiento de datos de conducción autónoma muestra pipelines ETL automatizados impulsados por modelos de visión Qwen que reemplazan la anotación manual.
2026-07-09