SevenTnewS

IA

Inteligencia artificial: LLMs, agentes, difusión, visión, PLN y lo último de los principales laboratorios.

347 published articles

4 min read

Puntos de Referencia de IA

GPT-5.4 Lidera el Conjunto de Puntos de Referencia de Matemáticas en 2026 a Medida que los Puntajes de la Frontera se Saturan

GPT-5.4 supera a sus rivales con un barrido de las principales filas de matemáticas de competición, pero GPT-5.2 Pro empata en cada celda y GPT-5.3 Codex ofrece puntajes casi idénticos a un costo menor. El verdadero diferenciador: el rendimiento de los modelos en puntos de referencia de próxima generación como FrontierMath y HMMT Feb 2026.

2026-07-01

2 min read

Actualización de API

Anthropic aumenta los límites de tasa de la API de Claude y simplifica los niveles a tres

Anthropic aumenta los límites de tasa de la API de Claude para Sonnet y Haiku, simplifica los niveles de uso a tres (Starter, Development, Scale) y garantiza que ninguna organización vea límites más bajos. Los cambios son automáticos.

2026-07-01

3 min read

Investigación en IA

Un análisis a nivel de token revela que los LLM híbridos destacan en palabras con significado, pero quedan rezagados en repeticiones

Investigadores del Allen Institute for AI compararon Olmo 3 y Olmo Hybrid token por token, encontrando que los híbridos sobresalen en palabras con significado pero no en tokens repetidos. El trabajo sugiere pérdidas de token filtradas como un método de evaluación más rico para arquitecturas de modelos de lenguaje.

2026-07-01

2 min read

Microsoft Build 2025

Microsoft Discovery ya está disponible de forma general para flujos de trabajo de IA agentiva en ciencia e ingeniería

Microsoft Discovery ya está disponible de forma general, ofreciendo a las organizaciones una plataforma para construir y gobernar flujos de trabajo de IA agentiva para la investigación científica y de ingeniería. La vista previa de la aplicación complementaria Microsoft Discovery tiene como objetivo democratizar el descubrimiento impulsado por IA para los expertos del dominio.

2026-07-01

4 min read

Benchmark

El GauntletBench de Oxford somete a los agentes de IA a 100 tareas reales. Fallaron el 81% de ellas.

El GauntletBench de Oxford somete a los agentes de IA a 100 tareas desafiantes del mundo real. Los sistemas de frontera apenas alcanzan un 19.1% de éxito, muy por debajo del rendimiento humano. El benchmark se enfoca en capacidades pasadas por alto: percepción temporal, comprensión gráfica y razonamiento 3D en cinco aplicaciones profesionales.

2026-07-01

Featured4 min read

Inteligencia Artificial

GPT-Live de OpenAI finalmente deja de esperar a que termines de hablar

GPT-Live de OpenAI introduce audio full-duplex para que la IA pueda escuchar y hablar al mismo tiempo. Puede decir 'mjm', esperar durante las pausas y delegar el razonamiento complejo a GPT-5.5 en segundo plano, manteniendo el flujo de la conversación.

2026-07-01

3 min read

Inteligencia Artificial

El nuevo modelo de DeepSeek pone la eficiencia en el frente de la carrera armamentista de la IA

DeepSeek ha lanzado un nuevo LLM que agudiza su competencia con los principales laboratorios de IA al apostar por la eficiencia sobre la fuerza bruta. El modelo busca ofrecer un rendimiento sólido con un uso optimizado de recursos, reflejando un giro más amplio de la industria hacia una IA rentable.

2026-06-30

Featured3 min read

Lanzamiento de producto

Claude Sonnet 5 ya está aquí, y Anthropic apuesta por la ciencia y la empresa

Anthropic lanzó Claude Sonnet 5, un modelo más rápido y capaz para codificación y agentes, junto con Claude Science para investigadores y Claude Tag para equipos. La compañía también publicó un marco de política sobre el crecimiento exponencial de la IA.

2026-06-30

3 min read

contexto efectivo, límites de salida y el impuesto oculto de las ventanas largas

Su modelo de IA dice que puede leer 1 millón de tokens. Miente. Aquí están las matemáticas reales.

Los cuatro LLMs de frontera anuncian contextos de más de 1 millón de tokens, pero la recuperación efectiva, los límites de salida y el costo real difieren considerablemente. DeepSeek V4 Pro lidera en límite de salida y costo, Gemini sobresale por debajo de 200K tokens y Claude Opus gana en almacenamiento en caché para revisión interactiva de código. Este análisis desglosa las cifras de abril de 2026.

2026-06-30

Featured5 min read

Análisis del lanzamiento de Anthropic

Claude Sonnet 5 hace más difícil justificar la brecha de precio con Opus

Claude Sonnet 5 promete un razonamiento y rendimiento agente casi al nivel de Opus a un costo menor. Los primeros evaluadores reportan mejoras drásticas en la finalización autónoma de tareas y en el seguimiento de operaciones complejas de múltiples pasos. Con precios introductorios hasta agosto de 2026, el modelo hace más difícil justificar la brecha de precio con Opus.

2026-06-30

Featured5 min read

Análisis de evaluación de agentes

ProgramBench: todas las IAs públicas obtienen un 0% en la prueba de codificación más difícil hasta el momento

ProgramBench desafía a los agentes de IA a reconstruir programas solo a partir de binarios, sin código fuente ni descripciones de problemas. Todos los modelos públicos fallan al resolver completamente cualquier tarea, exponiendo debilidades en la exploración, arquitectura y juicio de parada. El benchmark es una prueba de estrés para agentes de codificación que avanzan más allá de los flujos de trabajo basados en parches.

2026-06-29

4 min read

Datos sintéticos

Sin jefe, sin cuello de botella: por qué un marco peer-to-peer está repensando la generación de datos sintéticos

Matrix es un marco descentralizado que utiliza mensajes serializados enviados a través de colas distribuidas para la generación de datos sintéticos multiagente. Al eliminar el orquestador central, logra un rendimiento entre 2 y 15 veces mayor en hardware idéntico.

2026-06-06

← PreviousPage 28 / 29 · 347 articlesNext →