Evaluación comparativa
Los modelos de visión AI de frontera fallan en percepción básica, según nuevo benchmark
PerceptionBench evalúa diez capacidades visuales atómicas en 3.000 preguntas. Ningún modelo de frontera superó el 60%, y puntuaciones generales similares ocultan perfiles de debilidad muy diferentes.
Emmanuel Fabrice Omgbwa Yasse Asistido por IA
2026-08-03 · 3 min de lectura

Un nuevo benchmark llamado PerceptionBench sugiere que la brecha entre lo que los modelos multimodales de IA parecen entender y lo que realmente perciben es más amplia de lo que muchos suponen. En pruebas con dieciséis modelos de frontera, ninguno superó el 60% de precisión en preguntas diseñadas para medir la percepción visual atómica: la capacidad de ver un hecho visual único e inequívoco sin apoyarse en el razonamiento o el conocimiento previo.
Los benchmarks existentes a menudo mezclan percepción con razonamiento, lo que dificulta determinar si un error ocurrió porque el modelo no vio el objeto o porque no pudo razonar sobre él. El equipo de PerceptionBench, cuyo preprint de 33 páginas apareció en arXiv, se propuso aislar el problema de la percepción. Analizaron los primeros puntos de fallo en las respuestas de los modelos en 42 benchmarks existentes y construyeron una taxonomía de errores. El equipo examinó dónde fallaban primero los modelos en un conjunto diverso de tareas, asegurando que la taxonomía reflejara errores reales. A partir de esa taxonomía, derivaron diez capacidades perceptuales atómicas, cada una una habilidad mínima necesaria para interpretar una escena visual.
El benchmark contiene 3.000 preguntas verificadas, cada una diseñada para evaluar una sola capacidad. La dificultad proviene de la demanda perceptual en sí misma, no de instrucciones complejas o conocimiento del dominio. Las respuestas son cortas e inequívocas: un número, una palabra de color, o un sí o no. Esto elimina la ambigüedad en la calificación y hace que la prueba sea reproducible entre grupos de investigación.
Los resultados son aleccionadores. Ningún modelo alcanzó el 60% de precisión en general. La alucinación relacionada con la percepción fue la capacidad más débil en todos los casos. Más revelador aún, los modelos con puntuaciones generales similares a menudo tenían perfiles de capacidad marcadamente diferentes. Un modelo podía sobresalir en detección de colores pero fallar en conteo. Otro podía ser fuerte en relaciones espaciales pero débil en textura. Un modelo que se desempeña bien en conjuntos de datos de respuesta a preguntas visuales aún puede ser incapaz de contar elementos en una escena desordenada. La puntuación agregada oculta la verdadera distribución de fallos.
Esta granularidad diagnóstica es lo que distingue a PerceptionBench de los benchmarks holísticos anteriores. En lugar de clasificar modelos con un solo número, permite a los investigadores ver qué habilidades perceptuales faltan y orientar cambios en el entrenamiento o la arquitectura en consecuencia. Los autores señalan una fuerte correlación entre la precisión de la percepción y la frecuencia de alucinaciones, lo que sugiere que corregir la percepción fundamental podría reducir las alucinaciones en general.
El benchmark también destaca un problema más profundo: los métodos de entrenamiento actuales no enseñan explícitamente a los modelos a percibir antes de razonar. Estos modelos aprenden percepción como un subproducto de objetivos alineados con el lenguaje, y los resultados sugieren que este enfoque indirecto deja lagunas fundamentales. Puede ser necesario un preentrenamiento de percepción directa o módulos especializados de codificadores de visión para cerrar la brecha.
La comunidad de investigación ha reaccionado con interés cauteloso. Las discusiones iniciales en canales de preprint destacan la minuciosidad de la metodología y la amplitud de modelos probados. Un comentarista calificó el artículo como lectura obligada para cualquiera que trabaje en sistemas multimodales de próxima generación, aunque señaló que el diseño del benchmark merece un escrutinio cercano antes de una adopción más amplia.
PerceptionBench no pretende resolver ningún problema de percepción. Proporciona una forma de medirlo. Para los equipos que trabajan en modelos multimodales, el benchmark ofrece un conjunto de herramientas de diagnóstico que revela puntos ciegos que los benchmarks de razonamiento pasan por alto. La implicación es clara: antes de arreglar lo que un modelo no puede pensar, los investigadores necesitan saber lo que no puede ver. El conjunto de datos completo y el código de evaluación están disponibles con el preprint, permitiendo a otros equipos ejecutar sus propios modelos a través de las mismas pruebas detalladas.
- Fuente : Frontier AI vision models fail at basic perception, new benchmark shows — 2026-07-29
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.