SevenTnewS

Features

In-depth special reports combining feature, analysis, interview and profile reporting.

31 published features

6 min read

Modelos de video de frontera: informe especial

Perceptron Mk1 apuesta el futuro de la IA de video a observar, no a crear

Perceptron Mk1 es un modelo de visión y lenguaje de código cerrado con un precio pensado para uso continuo, orientado a la comprensión de video con marcas de tiempo y al razonamiento encarnado. La verdadera carrera de la IA de video no consiste en crear clips más bonitos, y los benchmarks que mezclan ambas categorías inducen a error.

2026-08-06

Featured4 min read

Seguridad de IA

Shieldstral, el clasificador de 3B que supera a modelos siete veces más grandes

Un clasificador de seguridad de 3B iguala a los modelos de texto casi siete veces más grandes y establece un nuevo estado del arte en moderación multimodal, según un artículo de arXiv de julio de 2026. El truco: la moderación reformulada como respuesta a preguntas binarias, entrenada con aproximadamente 54,1 millones de muestras.

2026-08-05

Featured5 min read

Evaluación de IA

Los antiguos benchmarks de IA se rompieron. Esto es lo que los reemplazó.

Los benchmarks estáticos como MMLU y GSM8K están saturados y contaminados. La industria se ha movido hacia la regeneración dinámica, exámenes a nivel experto y entornos de tareas agénticas para obtener una medida real de la capacidad de la IA.

2026-08-04

5 min read

Agentes de IA

Tratar los SOP como código: un nuevo runtime con paginación de pila separa a los agentes fuertes de los débiles

Una nueva investigación de Hong Kong y China continental demuestra que compilar SOP en pseudocódigo ejecutable y ejecutarlos en una máquina virtual con pila paginada separa limpiamente a los agentes capaces de los frágiles. El trabajo produce una regla de implementación precisa: compilar primero, paginar solo después de una verificación de disciplina a nivel de modelo.

2026-08-04

Featured8 min read

Informe Especial: Evaluación de IA

Estado de la evaluación comparativa de IA en 2026: el colapso de las pruebas estáticas y los sistemas que las reemplazan

Un recorrido completo por el panorama de los benchmarks de IA en 2026: por qué se rompieron MMLU, GSM8K y HumanEval, cómo los benchmarks dinámicos y exámenes de expertos como HLE y GPQA Diamond los reemplazaron, qué revelan las pruebas de inteligencia agéntica y desigual, y cómo la preferencia humana, los jueces LLM y la observabilidad en producción completan ahora la pila de evaluación.

2026-08-03

5 min read

Inteligencia Artificial

Cómo un sistema de doble memoria enseñó a la IA a diagnosticar los fallos que sigue olvidando

OpsMem combina una memoria a corto plazo (STM) para el estado de diagnóstico en evolución con una memoria a largo plazo (LTM) para la experiencia operativa reutilizable. A través de un mecanismo llamado resonancia de memoria cruzada, el sistema activa experiencia relevante del estado desde la LTM para guiar el diagnóstico multiagente. En un conjunto de datos de microservicios de Huawei, superó las líneas base de razonamiento agéntico y aumentadas con conocimiento por márgenes significativos.

2026-08-03

5 min read

Interpretabilidad en IA

Las decisiones de tu red neuronal ahora se pueden rastrear hasta casos de entrenamiento específicos

Investigadores muestran que las puntuaciones de acción de redes neuronales pueden expresarse como sumas ponderadas exactas de retornos de casos de entrenamiento, utilizando la geometría de Gram. Esto permite señales de auditoría posteriores al entrenamiento que identifican casos influyentes, miden la coherencia de la acción y señalan soporte débil, sin reentrenar ni acceder a la trayectoria de optimización original.

2026-08-03

3 min read

Investigación en IA

Por qué la probabilidad logarítmica de los tokens es la señal equivocada para monitorear modelos de razonamiento de IA

Novelis Research demuestra que la probabilidad logarítmica de los tokens falla como monitor de decodificador para modelos de razonamiento cuantizados, siendo ciega a los bucles confiados. Introducen un controlador e-CUSUM calibrado que combina señales de incertidumbre y repetición, logrando selectividad en GSM8K con DeepSeek-R1-Distill-Qwen-1.5B.

2026-08-03

4 min read

Investigación en IA

La espuma en la cadena de pensamiento: un nuevo benchmark revela por qué los LLMs desperdician tokens en razonamientos válidos pero inútiles

Los LLMs a menudo generan cadenas de razonamiento que son correctas pero rellenas con pasos innecesarios. Un nuevo benchmark de diagnóstico y un método de compresión muestran que los evaluadores actuales pasan por alto esta ineficiencia por completo y que la mitad de los pasos de razonamiento escritos por humanos podrían ser comprimibles.

2026-07-31

3 min read

Matemáticas formales

Cómo un laboratorio chino resolvió el cuello de botella en la demostración matemática impulsada por IA

El marco ToMap de la Universidad de Nankín logra resultados de vanguardia en la autoformalización completa de demostraciones al identificar el paso de descomposición como el cuello de botella crítico. Mediante la evolución iterativa guiada por Pareto de las descomposiciones de la demostración, ToMap eleva la precisión conjunta sintáctico-semántica en un 19% en el punto de referencia ProofFlowBench, al tiempo que reduce los costos en tiempo de prueba.

2026-07-30

5 min read

Investigación

Seis palabras que podrían remodelar cómo los agentes de IA exploran y se mantienen seguros: disruptir, validar, intermediar

Una novedosa arquitectura de cohorte de agentes heterogéneos separa la exploración divergente, el control de seguridad en tiempo de ejecución y la recuperación de conocimiento entre dominios en roles especializados. El Disruptor genera propuestas de alta entropía, el Validador impone comprobaciones estrictas de llamadas a herramientas, y el Intermediario importa analogías fuera de dominio mediante recuperación de novedad contrastiva. Los fallos de ejecución se compilan en parches de restricción firmados llamados Scars, almacenados en caché para generaciones futuras. En las evaluaciones, la cohorte logró un 95% de descubrimiento de objetivos remotos, cero infracciones ejecutadas y un 15.1% de ahorro de tokens gracias a Scars, con una reducción del 55.9% en costos bajo restricciones de recursos mediante asignación de ancho de banda basada en créditos.

2026-07-30

4 min read

Analítica Empresarial

QwenPaw-Data de Alibaba quiere ser la capa faltante entre los analistas de negocio y sus datos

QwenPaw-Data de Alibaba introduce una arquitectura de tres subsistemas, DataBridge, Skill-Hub y Host, para convertir datos empresariales fragmentados en activos analíticos reutilizables. Las evaluaciones iniciales muestran mejoras sustanciales frente a los sistemas existentes tanto en benchmarks públicos como en cargas de trabajo de BI industrial.

2026-07-30

← PreviousPage 1 / 3 · 31 featuresNext →