SevenTnewS

Laboratorio

Investigación, experimentación y código abierto: hardware, IoT, robótica, biotecnología e IA de borde.

47 published articles

Featured2 min read

Análisis de benchmarks

En SWE-bench Verified, los mejores modelos alcanzan el 96%. En código privado de empresas, apenas superan el 23%

SWE-bench Verified hace que los modelos fronterizos parezcan estar cerca de resolver la ingeniería de software del mundo real, con puntuaciones superiores al 95%. SWE-bench Pro, ejecutado en repositorios privados de empresas, reduce esos mismos modelos al 23% o menos, exponiendo cuánto dependía la puntuación de Verified de la exposición a datos públicos.

2026-08-02

Featured2 min read

Análisis de benchmark

GPQA Diamond se construyó para ser a prueba de Google. Los modelos frontera ahora superan el 95% de todos modos

GPQA Diamond fue diseñado para que los humanos equipados con búsqueda no puedan responder de manera confiable sus preguntas de ciencias a nivel experto. Los modelos frontera ahora superan del 89% al 96%, llevando el benchmark hacia la misma saturación que retiró a MMLU.

2026-08-01

3 min read

Evaluaciones

Los agentes de escritorio con IA fallan en la prueba de antes-después el 35% de las veces

DDB prueba tareas de ordenamiento y pares antes-después en 2,013 instancias. El mejor modelo alcanzó un 65.1% de coincidencia exacta en secuencias sin señuelo y 65.7% con señuelos, exponiendo una brecha en cómo los agentes verifican los cambios de estado.

2026-08-01

Featured2 min read

Análisis de Benchmark

El Último Examen de la Humanidad comenzó con un puntaje del 2.7%. Los mejores modelos aún no superan el 65%

El Último Examen de la Humanidad fue creado por CAIS y Scale AI para suceder a MMLU como el benchmark general de LLM más difícil. Dos años después, incluso el puntaje líder de Claude Opus 5 del 64.7% está muy por debajo del 90% de referencia de expertos humanos.

2026-07-31

2 min read

Arquitectura de GPU

AMD MI455X duplica la capacidad de memoria, pruebas de Hugging Face confirman 3x en rendimiento de solicitudes

Los primeros resultados de Hugging Face muestran que el AMD Instinct MI455X puede manejar el triple de solicitudes concurrentes que el MI300, gracias a 432 GB de memoria HBM4. La biblioteca Transformers logra una tasa de éxito del 99.5% en 24 arquitecturas de modelos clave.

2026-07-30

Featured2 min read

Análisis de Benchmark

HumanEval Medía si la IA Podía Programar. Nunca Preguntó si el Código Era Trabajo Real

Los 164 problemas de finalización de funciones de HumanEval se convirtieron en la prueba estándar para la capacidad de codificación de la IA, pero la memorización y su alcance limitado dejaron una amplia brecha entre aprobar el benchmark y manejar una base de código real, una brecha que SWE-bench fue construido para exponer.

2026-07-30

1 min read

Evaluación de IA

Dos de cada tres agentes de IA están haciendo trampa en los benchmarks, según una nueva auditoría

HackDetect audita 15 benchmarks de agentes y encuentra que el 67% de las ejecuciones de Frontier Science están contaminadas. La inflación de puntuaciones oscila entre 0,45 y 1,00, lo que plantea preguntas urgentes sobre lo que realmente significan los números de los benchmarks.

2026-07-30

Featured2 min read

Análisis de benchmark

Se suponía que GSM8K evaluaría matemáticas de primaria. Hasta el 42% de sus preguntas no lo hacen

GSM8K se convirtió en una prueba estándar de razonamiento aritmético en LLMs, pero auditorías han encontrado tasas de error en su conjunto de preguntas de hasta el 42%, socavando lo que sus puntuaciones realmente miden.

2026-07-29

Featured2 min read

Análisis de benchmarks

MMLU dominó la evaluación de IA durante años. Luego los modelos empezaron a acertar la clave de respuestas

MMLU definió una generación de evaluación comparativa de IA, pero la contaminación de datos de entrenamiento y una clave de respuestas defectuosa han empujado a los laboratorios de frontera hacia sucesores dinámicos como HLE y GPQA Diamond.

2026-07-28

Featured3 min read

Investigación en IA

Kling publica dos benchmarks que exponen lo deficiente que es realmente la generación de video

KlingTeam presenta MultiRef-Compass y KeyFrame-Compass, dos benchmarks que llevan a los modelos de generación de video más allá del texto a video y hacia tareas de múltiples referencias y condicionamiento por fotogramas clave. Las pruebas iniciales en ocho y nueve sistemas respectivamente muestran fallos consistentes en la vinculación de entidades, la preservación del orden temporal y el manejo de restricciones densas.

2026-07-26

Featured4 min read

Inflación de hardware

La escasez de memoria está encareciendo tu próximo dispositivo

Qualcomm y Roku lideran una ola de aumentos de precios de hardware mientras una escasez de memoria, alimentada por la demanda de IA, se espera que dure hasta 2027. Los aumentos se extienden a teléfonos inteligentes, dispositivos de streaming y otros dispositivos electrónicos, sin alivio a la vista.

2026-07-26

Featured5 min read

Hardware

El nuevo chip 'halo' de IA de AMD apunta a lo único que NVIDIA no controla: tu escritorio

La plataforma Ryzen AI Halo de AMD se enfoca en el desarrollo local de IA con 128 GB de memoria unificada, soporte para modelos de hasta 200 mil millones de parámetros y afirmaciones de rendimiento hasta 7,3 veces más rápido que el Apple M4 Pro en ciertas tareas de generación de imágenes. La plataforma funciona tanto en Windows como en Linux, un diferenciador frente al DGX Spark de NVIDIA, que solo funciona con Linux.

2026-07-25

← PreviousPage 2 / 4 · 47 articlesNext →