Finanzas Agénticas
Se abre la caja negra de tu cartera: dentro del primer rastreador de finanzas agénticas en vivo
NextFund registra cada decisión que un agente de trading de IA toma en mercados en vivo, permitiendo a los usuarios comparar modelos, inspeccionar fundamentos y diagnosticar fallos. Una prueba con ocho LLM en acciones de EE. UU., China y Hong Kong muestra que señales intermedias similares pueden divergir en comportamientos de cartera notablemente diferentes, y que las clasificaciones trimestrales varían según la métrica que más importe.
Emmanuel Fabrice Omgbwa Yasse Asistido por IA
2026-07-27 · 6 min de lectura

Los grandes modelos de lenguaje ahora escriben operaciones, no solo leen informes de ganancias. Pero las herramientas para evaluar si lo hacen bien se han quedado estancadas en la era oscura: pruebas estáticas y rendimientos de cartera que no revelan nada sobre cómo se realizó una orden. Una plataforma publicada esta semana por Paradoox AI Research pretende cambiar eso.
NextFund combina fuentes de mercado en vivo de Hong Kong, EE. UU. y acciones A de China con un registro persistente de extremo a extremo de cada observación, señal de analista y acción ejecutada. También incluye una Arena de Trading basada en web que permite a los usuarios profundizar desde las puntuaciones del ranking hasta la justificación textual detrás de una orden de compra o venta de un solo día. La demostración está disponible en paradoox.cn/nextfund/.
Tres brechas que la plataforma soluciona
El documento detalla tres problemas estructurales que comparten los sistemas de evaluación de finanzas agénticas existentes. Primero, la mayoría de los puntos de referencia prueban conocimientos estáticos o reportan solo la ganancia o pérdida final, dejando invisibles las pruebas intermedias y los pasos de ejecución. Segundo, cuando un agente maneja mal una herramienta o se desvía de su mandato, los desarrolladores a menudo no pueden determinar si la falla está en la recuperación, el análisis, la síntesis o la ejecución. Tercero, los registros de decisiones, los casos de error y los historiales de llamadas a herramientas se descartan rutinariamente después de una ejecución, por lo que las instituciones acumulan pocos datos reutilizables para revisiones posteriores de indicaciones o adaptación de modelos.
NextFund aborda los tres incorporando un seguimiento de escritura directa en el flujo de trabajo multiagente. Cada vez que un analista emite una señal o el gestor de decisiones asigna una asignación objetivo, el registro, junto con su justificación y el contexto de la indicación, se persiste inmediatamente bajo un reloj compartido con marca de tiempo.
Lo que revelan las primeras pruebas en vivo
Los autores ejecutaron ocho LLM de frontera, DeepSeek-V4-Flash, DeepSeek-V4-Pro, Gemini-3.5-Flash, GLM-5.1, GPT-5.4-Mini, Kimi-K2.6, MiniMax-M3 y Qwen3.5-Flash, a través de la misma pila multiagente, universo y restricciones durante el primer y segundo trimestre de 2026. Los resultados pintan un panorama mucho más matizado de lo que cualquier métrica única puede capturar.
En acciones de EE. UU. durante el primer trimestre, todos los modelos perdieron dinero. Kimi-K2.6 fue el que más se acercó al punto de equilibrio con un rendimiento de -2.89%, registrando también la mejor volatilidad (5.04%) y reducción máxima (-4.39%). DeepSeek-V4-Flash tuvo el ratio Sharpe menos negativo. Para el segundo trimestre, el panorama se invirtió: Qwen3.5-Flash lideró en rendimiento con un 12.23%, aunque GPT-5.4-Mini dominó en Sharpe (3.16), volatilidad (13.03%) y reducción máxima (-6.36%). La lección es clara: un modelo de mayor rendimiento no es automáticamente el más eficiente, el más estable o el menos activo.
La comparación entre modelos con la misma entrada produce un hallazgo aún más sorprendente. Al comparar Kimi-K2.6 con Qwen3.5-Flash en datos del primer trimestre de EE. UU., las señales de los analistas coincidieron aproximadamente en el 92.9% de los casos, lo que significa que ambos modelos produjeron opiniones especializadas similares a partir de los mismos precios y resúmenes de noticias. Pero las acciones finales de compra/venta/mantenimiento coincidieron solo en el 36.4% de los días-ticker. Kimi-K2.6 se mantuvo conservador (396 mantener, 29 compras, 23 ventas), mientras que Qwen3.5-Flash operó de manera mucho más agresiva (152 mantener, 160 compras, 136 ventas). Pruebas intermedias similares no implican un comportamiento de cartera similar, un modo de fallo que los números de P&L terminales por sí solos no pueden sacar a la luz.
El patrón se mantiene en todos los mercados. En acciones A de China, GLM-5.1 lideró el rendimiento en el primer trimestre con un 9.76%, mientras que Kimi-K2.6 lideró en Sharpe. En Hong Kong, Kimi-K2.6 obtuvo un rendimiento del 30.94% en el primer trimestre con un Sharpe de 3.21, pero Gemini-3.5-Flash tomó la delantera en el segundo trimestre con un rendimiento del 23.41%. El mismo protocolo produce clasificadores cualitativamente diferentes en cada plaza, confirmando que el seguimiento entre mercados es necesario para una comparación justa.
La inspección estilo arena como herramienta de diagnóstico
Donde NextFund más innova es en la capa de inspección que proporciona. La Arena de Modelos permite a los usuarios seleccionar un mercado, un período de evaluación y un conjunto de ejecuciones de modelos para comparar lado a lado. Las curvas de rentabilidad, Sharpe, volatilidad, reducción máxima y rotación se presentan juntas, y cada ejecución está vinculada a su rastro de ejecución completo. Un usuario que note, por ejemplo, que un modelo tiene mayor rendimiento pero mayor rotación puede hacer clic en la vista de Seguimiento de Detalles para ver si la diferencia surge de acciones más frecuentes o de diferentes elecciones de asignación.
A nivel de decisión, cada día de trading y ticker está vinculado a resultados de especialistas, decisiones del gestor de cartera, acciones ejecutadas y justificaciones textuales a lo largo de una línea de tiempo compartida. Los rastros alineados permiten a los inspectores determinar si dos agentes divergieron durante el análisis inicial, la síntesis de la decisión o la ejecución. Los autores ilustran esto con una comparación concreta del primer trimestre: la postura conservadora de Kimi-K2.6 parece impulsada no por señales de analistas diferentes sino por un paso de síntesis diferente. El gestor de decisiones en Kimi-K2.6 ponderó el riesgo sobre la convicción, mientras que el gestor de Qwen3.5-Flash ponderó la convicción sobre el riesgo.
Lo que aún falta
La versión actual se centra en el rebalanceo de acciones en tres mercados con un equipo fijo de analistas. El soporte para derivados, cobertura multidivisa y reglas de cumplimiento más ricas se deja para trabajos futuros. Incluso con relojes sincronizados y registros estructurados, las justificaciones textuales pueden permanecer incompletas o solo vagamente alineadas con el cálculo latente del modelo. Aún se requiere revisión humana para decisiones consecuentes. La evaluación en vivo también depende de fuentes de mercado de terceros cuyas licencias pueden prohibir la redistribución de datos brutos; los artefactos públicos enfatizan esquemas, rastros e interfaces en lugar de descargas de datos propietarios del mercado.
NextFund está pensado como una ayuda de auditoría y comparación, no como un asesor de inversiones. Los autores son explícitos al respecto: los resultados de la demostración no deben ser la única base para decisiones de inversión o regulatorias, y los usuarios deben examinar la procedencia, los historiales de decisiones y las métricas de riesgo al interpretar los resultados del ranking como evidencia comparativa bajo un protocolo establecido, no como pronósticos de rendimiento futuro.
Un sustrato para la mejora sistemática
Quizás la elección de diseño más trascendental es que los rastros son completos, alineados en el tiempo y reutilizables. El mismo sustrato que soporta la comparación entre modelos y la atribución de fallos también proporciona material para la revisión de indicaciones, la adaptación supervisada y el aprendizaje por refuerzo. Las decisiones históricas y los resúmenes pueden leerse en ejecuciones posteriores como memoria, cerrando el ciclo entre el registro y el razonamiento.
A medida que los agentes basados en LLM pasan de demostraciones de investigación a flujos de trabajo de gestión de carteras, la brecha entre la promesa de un modelo y su comportamiento auditable se convertirá en la cuestión de gobernanza central para los adoptantes institucionales. NextFund no resuelve esa cuestión, pero proporciona la primera infraestructura para plantearla sistemáticamente, y eso solo puede ser su contribución más valiosa.
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.