Laboratorio
Investigación, experimentación y código abierto: hardware, IoT, robótica, biotecnología e IA de borde.
47 published articles
Hardware de consumo
CMF, Elektron y OhSnap demuestran que el hardware económico vence al exceso de funciones
Los auriculares Clip Pro de CMF por $79, las grooveboxes Model de Elektron por $349 y el Snap Grip Stand de OhSnap por $50 ganaron las reseñas de The Verge al asumir sus concesiones. El mismo patrón aparece en las gafas AR. Los compradores deberían tomar nota.
2026-08-23
Benchmark de razonamiento financiero
Los LLM conocen las fórmulas contables. FinIndices demuestra que no saben aplicarlas
Los LLM pueden recitar fórmulas contables, pero FinIndices, un benchmark construido sobre estados financieros reales de empresas chinas, demuestra que les cuesta aplicarlas. La precisión de Gemini-3.1-Pro cayó del 70.70% al 38.22% al eliminar las pistas de fórmulas, y la generación de tablas degradó activamente el razonamiento de los modelos.
2026-08-20
HDR10+ ADVANCED: Samsung y Prime Video lo lanzan primero
¿Pueden los metadatos escena por escena arreglar la mala reputación del suavizado de movimiento?
Prime Video es el primer servicio de streaming en adoptar HDR10+ ADVANCED en los televisores Samsung de 2026 a partir de agosto de 2026. El estándar añade Enhanced Overall Brightness e Intelligent Motion Smoothing consciente de la escena, el ajuste con la peor reputación en el cine en casa, ahora respaldado por metadatos más inteligentes.
2026-08-11
IA en la Educación
Los tutores de IA sobreayudan por diseño. Un nuevo benchmark lo cuantifica
Un benchmark construido sobre 462 sesiones reales de tutoría encuentra que los tutores de IA tienden por defecto a hacer el trabajo por los estudiantes. La instrucción explícita ayuda, pero los modelos todavía tienen dificultades con la decisión de juicio central: cuándo presionar, cuándo proporcionar andamiaje, cuándo dar un paso atrás.
2026-08-10
Agentes de voz
Por qué Grok 4.1 Fast supera a modelos más inteligentes en una llamada telefónica
Las clasificaciones generales eligen los LLM equivocados para las llamadas de voz. La clasificación de 2026 de BenchLM pone la latencia primero: Grok 4.1 Fast responde en 0.54s, mientras que Claude Opus 4.6, el mejor puntuado, necesita 1.78s. Los modelos rápidos se llevan la conversación; los modelos de razonamiento se quedan en las llamadas a herramientas en segundo plano.
2026-08-05
Evaluación de IA
Los antiguos benchmarks de IA se rompieron. Esto es lo que los reemplazó.
Los benchmarks estáticos como MMLU y GSM8K están saturados y contaminados. La industria se ha movido hacia la regeneración dinámica, exámenes a nivel experto y entornos de tareas agénticas para obtener una medida real de la capacidad de la IA.
2026-08-04
Arquitectura y Cloud
Por qué tu panel de IoT muestra datos de ayer y cómo solucionarlo
La mayoría de las plataformas de monitoreo IoT fallan no en la recopilación de datos sino en la entrega confiable. Una arquitectura en capas que utiliza Alibaba Cloud DataWorks automatiza la sincronización programada, elimina riesgos como la duplicación y la latencia, y mantiene tus paneles actualizados sin middleware personalizado.
2026-08-03
Informe Especial: Evaluación de IA
Estado de la evaluación comparativa de IA en 2026: el colapso de las pruebas estáticas y los sistemas que las reemplazan
Un recorrido completo por el panorama de los benchmarks de IA en 2026: por qué se rompieron MMLU, GSM8K y HumanEval, cómo los benchmarks dinámicos y exámenes de expertos como HLE y GPQA Diamond los reemplazaron, qué revelan las pruebas de inteligencia agéntica y desigual, y cómo la preferencia humana, los jueces LLM y la observabilidad en producción completan ahora la pila de evaluación.
2026-08-03
Evaluación comparativa
Los modelos de visión AI de frontera fallan en percepción básica, según nuevo benchmark
PerceptionBench evalúa diez capacidades visuales atómicas en 3.000 preguntas. Ningún modelo de frontera superó el 60%, y puntuaciones generales similares ocultan perfiles de debilidad muy diferentes.
2026-08-03
Análisis de referencia
LiveBench se niega a quedarse quieto. Ese es el punto
LiveBench reemplaza una clave de respuestas fija por un conjunto continuamente renovado de problemas de programación, repositorios y preguntas de predicción, evitando la contaminación que socavó a MMLU y GSM8K. Es parte de un cambio más amplio hacia la evaluación dinámica junto con LiveCodeBench, ForecastBench y LLMEval-Fair.
2026-08-03
Análisis de modelo
Qwen2.5-Omni: el modelo de código abierto que finalmente hace lo que los competidores solo prometen
Una inmersión profunda en el modelo de código abierto que procesa simultáneamente texto, imágenes, audio y video mientras genera voz en streaming, superando a GPT-4o-mini y Gemini en múltiples evaluaciones, y que cabe en una sola GPU de consumo con cuantización.
2026-08-03
Análisis de Benchmark
5 Millones de Votos, 25 Puntos Elo: Dentro del Leaderboard de Chatbot Arena que Nadie Puede Sacudir
LMSYS Chatbot Arena clasifica modelos por preferencia humana ciega en una escala Elo, con casi cinco millones de votos que ahora agrupan los principales laboratorios en una banda de 25 puntos. Los métodos LLM-as-a-Judge que escalan este tipo de evaluación tienen sus propios sesgos documentados hacia la verbosidad y la posición.
2026-08-02