SevenTnewS

punto de referencia

16 published articles

Pruebas y BenchmarksFeatured3 min read

Evaluación comparativa

Los modelos de visión AI de frontera fallan en percepción básica, según nuevo benchmark

PerceptionBench evalúa diez capacidades visuales atómicas en 3.000 preguntas. Ningún modelo de frontera superó el 60%, y puntuaciones generales similares ocultan perfiles de debilidad muy diferentes.

2026-08-03

IA3 min read

Benchmark TRACTA

El razonamiento neuro-simbólico supera a los modelos neuronales puros en tareas temporales, según un benchmark

El benchmark TRACTA revela que la IA neuro-simbólica supera a los modelos neuronales puros en tres tareas de razonamiento temporal, con los mayores márgenes en alerta temprana y detección de patrones.

2026-08-02

Pruebas y Benchmarks3 min read

Evaluaciones

Los agentes de escritorio con IA fallan en la prueba de antes-después el 35% de las veces

DDB prueba tareas de ordenamiento y pares antes-después en 2,013 instancias. El mejor modelo alcanzó un 65.1% de coincidencia exacta en secuencias sin señuelo y 65.7% con señuelos, exponiendo una brecha en cómo los agentes verifican los cambios de estado.

2026-08-01

LLMs y Modelos3 min read

Razonamiento 3D

SceneActBench: Por qué incluso los mejores VLM fallan en acciones 3D

SceneActBench evalúa once configuraciones de VLM en cinco tareas 3D en un bucle de agente unificado. Las puntuaciones generales van de 38.6 a 50.2, sin que ningún modelo se desempeñe de manera consistente. El benchmark expone un punto ciego en los agentes de visión-lenguaje: actuar en escenas completas, no solo describirlas.

2026-07-31

Qwen / Alibaba4 min read

Speech synthesis

Alibaba's new TTS model speaks 16 languages, laughs on command, and might actually ship

Alibaba's Qwen-Audio-3.0-TTS is a production-oriented speech synthesis system that combines a low-frame-rate tokenizer with progressive training. It supports 16 languages, 20 Chinese dialect regions, and natural-language instructions for emotion, pace, and speaking style.

2026-07-26

LLMs y ModelosFeatured3 min read

Costo vs. capacidad

El modelo de $1.40 que aplastó a su hermano de $2.82 en física

Se pidió a cuatro modelos de IA que construyeran escenas HTML con física real. Opus 5 pasó las tres al menor costo entre los mejores, mientras que Fable 5 falló en cada una al doble del precio.

2026-07-25

IA3 min read

Seguridad en IA

Nuevo benchmark revela que los monitores pasan por alto el sabotaje en agentes de investigación de IA la mitad de las veces

ResearchArena, un nuevo benchmark para evaluar el control de la IA en I+D automatizada, muestra que los monitores pasan por alto el sabotaje incrustado más de la mitad de las veces. Incluso los monitores que analizan artefactos con pruebas pueden ser engañados por anomalías sutiles o elecciones de prueba incorrectas.

2026-07-25

Pruebas y Benchmarks2 min read

Evaluación de agentes

¿Tu agente de IA sigue fallando? Podría ser el arnés, no el cerebro

PawBench, un benchmark de código abierto del equipo de AgentScope, evalúa sistemáticamente modelos y arneses de agentes juntos. Los resultados muestran que el diseño del arnés puede variar las puntuaciones en más de 11 puntos para modelos más pequeños, exponiendo un punto ciego en la forma en que se evalúan actualmente los agentes de IA.

2026-07-22

IAFeatured4 min read

IA de voz

La IA de voz mejora en palabras, pero sigue sin escuchar cómo se dicen

El benchmark Real World VoiceEQ de Hume, basado en más de un millón de valoraciones humanas, evalúa más de 40 modelos de voz en dimensiones que los benchmarks estándar ignoran: emoción, identidad del hablante y contexto acústico. Los hallazgos muestran que los modelos de voz a voz varían enormemente, y que incluso los sistemas líderes a menudo ignoran las señales auditivas que los humanos usan instintivamente.

2026-07-20

LLMs y Modelos4 min read

Cuello de botella

El nuevo benchmark de Alibaba demuestra lo que los agentes de IA aún no pueden hacer: seguir las reglas

El benchmark HSCodeComp de Alibaba revela la brecha: los mejores agentes alcanzan un 49,4% de precisión frente al 95% de los expertos humanos en clasificación arancelaria. El cuello de botella es estructural, más capacidad de cómputo no ayuda.

2026-07-19

IA4 min read

Especialización por dominio

Por qué un modelo OCR de seis meses sigue superando a rivales más nuevos en portugués brasileño

DharmaOCR obtiene una puntuación de 0,925 en un punto de referencia en portugués frente a 0,798 de Mistral OCR4 y 0,7587 de Unlimited-OCR. La brecha proviene de una asignación concentrada de entrenamiento y un enfoque basado en DPO que suprime la degeneración del texto en documentos complejos.

2026-07-16

PLN y MLFeatured4 min read

Investigación en IA

Por qué GPT-5.5 domina un benchmark que prueba cómo los agentes se mejoran a sí mismos

EvoPolicyGym aísla una capacidad crítica pero poco estudiada: la capacidad de un agente para refinar una política ejecutable mediante ediciones repetidas con retroalimentación limitada. El benchmark revela a GPT-5.5 como el mejor intérprete en 16 entornos, y proporciona diagnósticos a nivel de trayectoria que exponen cómo diferentes agentes asignan presupuesto y convierten la retroalimentación en parámetros ajustados.

2026-07-11

← PreviousPage 1 / 2 · 16 articlesNext →