Laboratorio
Investigación, experimentación y código abierto: hardware, IoT, robótica, biotecnología e IA de borde.
47 published articles
Benchmark
El abismo entre los LLM y el método científico: un nuevo benchmark revela que los modelos pueden describir datos pero no razonar a través de ellos
SDABench, un nuevo benchmark orientado a capacidades que abarca seis habilidades fundamentales de razonamiento científico y cinco dominios, evalúa 15 LLM y descubre que los modelos son sólidos en el análisis descriptivo, pero fallan en tareas inferenciales y causales. El artículo proporciona un marco de análisis de errores de cinco etapas para localizar fallos.
2026-07-25
Benchmark & Tests
Los modelos de aprendizaje en grafos no se prueban con datos tan feos. Un nuevo punto de referencia lo cambia
OpenRTAG, un benchmark de un equipo académico, organiza los problemas de calidad en TAG en una taxonomía 3×3 que abarca degradación de texto, estructura y etiquetas. Prueba GNN tradicionales, GNN mejoradas con modelos de lenguaje grandes y modelos fundacionales de grafos en nueve conjuntos de datos, revelando patrones de sensibilidad que estudios fragmentados previos pasaron por alto.
2026-07-24
Evaluación de agentes
¿Tu agente de IA sigue fallando? Podría ser el arnés, no el cerebro
PawBench, un benchmark de código abierto del equipo de AgentScope, evalúa sistemáticamente modelos y arneses de agentes juntos. Los resultados muestran que el diseño del arnés puede variar las puntuaciones en más de 11 puntos para modelos más pequeños, exponiendo un punto ciego en la forma en que se evalúan actualmente los agentes de IA.
2026-07-22
La inteligencia colectiva de Sakana AI se vuelve física
Cientos de ladrillos simples se enseñaron a reconocer su propia forma
Un colectivo de cientos de ladrillos modulares idénticos, cada uno ejecutando la misma pequeña red neuronal con solo comunicación local, puede reconocer su forma global, detectar daños y guiar el recrecimiento. Publicado en Nature Communications, el sistema alcanzó un 100% de precisión en hardware en cuatro formas.
2026-07-21
Codificación agéntica
Cómo Grok 4.5 se adelantó en el SWE Marathon, y qué significa para los agentes de codificación
Grok 4.5 ahora lidera la tabla de clasificación de SWE Marathon, superando a Claude 4 Opus y GPT-5. El referente evalúa habilidades reales de ingeniería de software: corrección de errores, adición de funciones y comprensión de código en repositorios reales. El resultado redefine el panorama competitivo de los agentes de codificación de IA.
2026-07-20
Investigación en IA
Cómo BMW metió 16K de contexto en una GPU de 16 GB rediseñando la atención
Investigadores de BMW demuestran que la Atención Global Jerárquica, combinada con retropropagación truncada y almacenamiento externo de KV, permite que una GPU de 16 GB entrene en 16K tokens, cuatro veces el límite de la atención densa, sin pérdida medible en la calidad del adaptador.
2026-07-20
NVIDIA
Nvidia y Hugging Face se unen para hacer aburrido el entrenamiento distribuido de difusión
NeMo Automodel de Nvidia ahora se integra directamente con Diffusers de Hugging Face, lo que permite entrenamiento distribuido de nivel de producción para modelos como FLUX, Wan 2.1 y HunyuanVideo. La biblioteca bajo Apache 2.0 maneja el paralelismo como un conmutador de configuración y permite que los puntos de control ajustados se carguen directamente en los pipelines de inferencia.
2026-07-19
IA y Robótica
RoboTTT de NVIDIA muestra que la longitud de contexto es el próximo eje de escalado para modelos robóticos
RoboTTT de NVIDIA Research escala el contexto del modelo robótico a 8K pasos de tiempo, tres órdenes de magnitud más allá de las políticas actuales, desbloqueando imitación directa a partir de video humano y mejoras de rendimiento del 87%, sugiriendo la longitud de contexto como un nuevo eje de escalado para modelos base robóticos.
2026-07-17
Hardware y Electrónica
El chip de memristor de 40 nm de la Universidad de Pekín supera al Nvidia A100 hasta en 478 veces
Un equipo conjunto de la Universidad de Pekín y la Academia China de Ciencias ha construido un chip neuromórfico que procesa la dinámica neuronal entre 50 y 478 veces más rápido que una GPU NVIDIA A100 mientras utiliza una fracción de la potencia. El chip de memristor de cambio de fase de 40 nm logra una dinámica neuronal en tiempo real a nivel de milisegundos, abriendo la puerta a la navegación quirúrgica y los gemelos digitales del cerebro.
2026-07-16
Impulso del mercado
El repunte de la capitalización de mercado de Nvidia señala que la demanda de IA no se está enfriando
La capitalización de mercado de Nvidia superó los 3 billones de dólares mientras la demanda de infraestructura de IA continúa creciendo. El hito subraya que las compras empresariales de GPU se mantienen sólidas a pesar de la creciente competencia de AMD y startups que ofrecen chips de inferencia más baratos.
2026-07-16
Teoría del Aprendizaje Automático
Por qué los modelos de difusión interpolan, no solo memorizan: una teoría matemática de la creatividad
Investigadores de Google revelan que la creatividad de los modelos de difusión proviene de un efecto de 'suavizado de puntuación' causado por la regularización de redes neuronales. Este marco teórico explica por qué los modelos interpolan entre puntos de datos de entrenamiento en lugar de simplemente memorizarlos, abriendo el camino para una novedad controlada en la IA generativa.
2026-07-16
Robótica humanoide
El robot humanoide de Xiaomi logró lo que Optimus aún no pudo: trabajo real en una fábrica
El robot humanoide de Xiaomi alcanzó más del 90% de éxito en tareas complejas de piezas flexibles tras solo seis meses de despliegue en fábrica, desafiando la afirmación de Elon Musk de enero de que Optimus no está listo para trabajo útil en fábrica. El salto de la inserción de tornillos en una sola estación a la clasificación bimanual de paneles y el plegado de cajas establece un nuevo ritmo para la industrialización de humanoides.
2026-07-15