Features
In-depth special reports combining feature, analysis, interview and profile reporting.
31 published features
Modelos de video de frontera: informe especial
Perceptron Mk1 apuesta el futuro de la IA de video a observar, no a crear
Perceptron Mk1 es un modelo de visión y lenguaje de código cerrado con un precio pensado para uso continuo, orientado a la comprensión de video con marcas de tiempo y al razonamiento encarnado. La verdadera carrera de la IA de video no consiste en crear clips más bonitos, y los benchmarks que mezclan ambas categorías inducen a error.
2026-08-06
Seguridad de IA
Shieldstral, el clasificador de 3B que supera a modelos siete veces más grandes
Un clasificador de seguridad de 3B iguala a los modelos de texto casi siete veces más grandes y establece un nuevo estado del arte en moderación multimodal, según un artículo de arXiv de julio de 2026. El truco: la moderación reformulada como respuesta a preguntas binarias, entrenada con aproximadamente 54,1 millones de muestras.
2026-08-05
Evaluación de IA
Los antiguos benchmarks de IA se rompieron. Esto es lo que los reemplazó.
Los benchmarks estáticos como MMLU y GSM8K están saturados y contaminados. La industria se ha movido hacia la regeneración dinámica, exámenes a nivel experto y entornos de tareas agénticas para obtener una medida real de la capacidad de la IA.
2026-08-04
Agentes de IA
Tratar los SOP como código: un nuevo runtime con paginación de pila separa a los agentes fuertes de los débiles
Una nueva investigación de Hong Kong y China continental demuestra que compilar SOP en pseudocódigo ejecutable y ejecutarlos en una máquina virtual con pila paginada separa limpiamente a los agentes capaces de los frágiles. El trabajo produce una regla de implementación precisa: compilar primero, paginar solo después de una verificación de disciplina a nivel de modelo.
2026-08-04
Informe Especial: Evaluación de IA
Estado de la evaluación comparativa de IA en 2026: el colapso de las pruebas estáticas y los sistemas que las reemplazan
Un recorrido completo por el panorama de los benchmarks de IA en 2026: por qué se rompieron MMLU, GSM8K y HumanEval, cómo los benchmarks dinámicos y exámenes de expertos como HLE y GPQA Diamond los reemplazaron, qué revelan las pruebas de inteligencia agéntica y desigual, y cómo la preferencia humana, los jueces LLM y la observabilidad en producción completan ahora la pila de evaluación.
2026-08-03
Inteligencia Artificial
Cómo un sistema de doble memoria enseñó a la IA a diagnosticar los fallos que sigue olvidando
OpsMem combina una memoria a corto plazo (STM) para el estado de diagnóstico en evolución con una memoria a largo plazo (LTM) para la experiencia operativa reutilizable. A través de un mecanismo llamado resonancia de memoria cruzada, el sistema activa experiencia relevante del estado desde la LTM para guiar el diagnóstico multiagente. En un conjunto de datos de microservicios de Huawei, superó las líneas base de razonamiento agéntico y aumentadas con conocimiento por márgenes significativos.
2026-08-03
Interpretabilidad en IA
Las decisiones de tu red neuronal ahora se pueden rastrear hasta casos de entrenamiento específicos
Investigadores muestran que las puntuaciones de acción de redes neuronales pueden expresarse como sumas ponderadas exactas de retornos de casos de entrenamiento, utilizando la geometría de Gram. Esto permite señales de auditoría posteriores al entrenamiento que identifican casos influyentes, miden la coherencia de la acción y señalan soporte débil, sin reentrenar ni acceder a la trayectoria de optimización original.
2026-08-03
Investigación en IA
Por qué la probabilidad logarítmica de los tokens es la señal equivocada para monitorear modelos de razonamiento de IA
Novelis Research demuestra que la probabilidad logarítmica de los tokens falla como monitor de decodificador para modelos de razonamiento cuantizados, siendo ciega a los bucles confiados. Introducen un controlador e-CUSUM calibrado que combina señales de incertidumbre y repetición, logrando selectividad en GSM8K con DeepSeek-R1-Distill-Qwen-1.5B.
2026-08-03
Investigación en IA
La espuma en la cadena de pensamiento: un nuevo benchmark revela por qué los LLMs desperdician tokens en razonamientos válidos pero inútiles
Los LLMs a menudo generan cadenas de razonamiento que son correctas pero rellenas con pasos innecesarios. Un nuevo benchmark de diagnóstico y un método de compresión muestran que los evaluadores actuales pasan por alto esta ineficiencia por completo y que la mitad de los pasos de razonamiento escritos por humanos podrían ser comprimibles.
2026-07-31
Matemáticas formales
Cómo un laboratorio chino resolvió el cuello de botella en la demostración matemática impulsada por IA
El marco ToMap de la Universidad de Nankín logra resultados de vanguardia en la autoformalización completa de demostraciones al identificar el paso de descomposición como el cuello de botella crítico. Mediante la evolución iterativa guiada por Pareto de las descomposiciones de la demostración, ToMap eleva la precisión conjunta sintáctico-semántica en un 19% en el punto de referencia ProofFlowBench, al tiempo que reduce los costos en tiempo de prueba.
2026-07-30
Investigación
Seis palabras que podrían remodelar cómo los agentes de IA exploran y se mantienen seguros: disruptir, validar, intermediar
Una novedosa arquitectura de cohorte de agentes heterogéneos separa la exploración divergente, el control de seguridad en tiempo de ejecución y la recuperación de conocimiento entre dominios en roles especializados. El Disruptor genera propuestas de alta entropía, el Validador impone comprobaciones estrictas de llamadas a herramientas, y el Intermediario importa analogías fuera de dominio mediante recuperación de novedad contrastiva. Los fallos de ejecución se compilan en parches de restricción firmados llamados Scars, almacenados en caché para generaciones futuras. En las evaluaciones, la cohorte logró un 95% de descubrimiento de objetivos remotos, cero infracciones ejecutadas y un 15.1% de ahorro de tokens gracias a Scars, con una reducción del 55.9% en costos bajo restricciones de recursos mediante asignación de ancho de banda basada en créditos.
2026-07-30
Analítica Empresarial
QwenPaw-Data de Alibaba quiere ser la capa faltante entre los analistas de negocio y sus datos
QwenPaw-Data de Alibaba introduce una arquitectura de tres subsistemas, DataBridge, Skill-Hub y Host, para convertir datos empresariales fragmentados en activos analíticos reutilizables. Las evaluaciones iniciales muestran mejoras sustanciales frente a los sistemas existentes tanto en benchmarks públicos como en cargas de trabajo de BI industrial.
2026-07-30