AIME 2025
2 published articles
Investigación en IA
Las cadenas de pensamiento más largas chocan contra un muro. ThinkRetrieve inyecta la solución a mitad del razonamiento
El escalado secuencial en tiempo de prueba suele toparse con rendimientos decrecientes o incluso negativos, sostiene un nuevo preprint. ThinkRetrieve recupera ejemplos resueltos a mitad del razonamiento y los inyecta en la traza, con ganancias relativas de hasta el 60% en AIME 2025 en cinco modelos pequeños de razonamiento.
2026-08-18
Puntos de Referencia de IA
GPT-5.4 Lidera el Conjunto de Puntos de Referencia de Matemáticas en 2026 a Medida que los Puntajes de la Frontera se Saturan
GPT-5.4 supera a sus rivales con un barrido de las principales filas de matemáticas de competición, pero GPT-5.2 Pro empata en cada celda y GPT-5.3 Codex ofrece puntajes casi idénticos a un costo menor. El verdadero diferenciador: el rendimiento de los modelos en puntos de referencia de próxima generación como FrontierMath y HMMT Feb 2026.
2026-07-01