SevenTnewS

智能体金融

你的投资组合黑箱即将打开:首个实时智能体金融追踪器内部解析

NextFund记录AI交易智能体在实时市场中做出的每一项决策,让用户比较模型、检查理由并诊断失败。一项针对美国、中国和香港股票的八款大语言模型测试显示,相似的中间信号可能分化为截然不同的投资组合行为,且季度排名会根据最关键的指标而翻转。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-07-27 · 阅读需 6 分钟

你的投资组合黑箱即将打开:首个实时智能体金融追踪器内部解析
来源 : NextFund: A Uni…

大型语言模型现在不仅阅读财报,还在撰写交易指令。但评判它们表现的工具仍停留在黑暗时代:静态测验和终端投资组合回报率,无法揭示订单是如何下达的。Paradoox AI Research本周发布的一个平台旨在改变这一现状。

NextFund将香港、美国和中国A股市场的实时行情与每项观察、分析师信号和已执行操作的端到端持久日志相结合。它还提供了一个基于网页的交易竞技场,让用户可以从排行榜分数深入到单个交易日买入或卖出订单背后的文本理由。演示可在paradoox.cn/nextfund/查看。

平台修复的三大缺陷

论文详细阐述了现有智能体金融评估系统共有的三个结构性问题。首先,大多数基准测试仅测试静态知识或仅报告最终损益,中间证据和执行步骤不可见。其次,当智能体处理工具不当或偏离其任务时,开发者往往无法判断故障在于检索、分析、综合还是执行。第三,决策日志、错误案例和工具调用历史通常在运行后被丢弃,因此机构积累了很少的可重复使用数据供后续提示修订或模型适配。

NextFund通过将写透跟踪直接嵌入到多智能体工作流中来解决所有三个问题。每次分析师发出信号或决策管理器提交目标分配时,该记录及其理由和提示上下文都会立即在共享时间戳时钟下持久化。

首次实时测试揭示的内容

作者将八款前沿大语言模型, , DeepSeek-V4-Flash、DeepSeek-V4-Pro、Gemini-3.5-Flash、GLM-5.1、GPT-5.4-Mini、Kimi-K2.6、MiniMax-M3和Qwen3.5-Flash, , 通过相同的多智能体架构、市场和约束条件在2026年第一和第二季度运行。结果描绘了一幅比任何单一指标所能捕捉的更为细致入微的画面。

在美国股票市场第一季度,所有模型都亏损。Kimi-K2.6以-2.89%的回报率最接近盈亏平衡,同时录得最佳波动率(5.04%)和最大回撤(-4.39%)。DeepSeek-V4-Flash的夏普比率负值最小。到第二季度,情况逆转:Qwen3.5-Flash以12.23%的回报率领先,但GPT-5.4-Mini在夏普比率(3.16)、波动率(13.03%)和回撤(-6.36%)上占优。教训很明显:回报率较高的模型并非自动最有效率、最稳定或最不活跃。

在同一输入流上进行跨模型比较得出了更惊人的发现。当比较Kimi-K2.6和Qwen3.5-Flash在美国第一季度数据上的表现时,分析师信号在大约92.9%的情况下一致,意味着两个模型从相同价格和新闻摘要中产生了相似的专业观点。但最终的买入/卖出/持有行动仅在36.4%的股票-日期上一致。Kimi-K2.6保持保守(396个持有、29个买入、23个卖出),而Qwen3.5-Flash交易更加激进(152个持有、160个买入、136个卖出)。相似的中间证据并不意味着相似的投资组合行为, , 这是一个仅靠终端损益数字无法暴露的故障模式。

这种模式在不同市场中也成立。在中国A股市场,GLM-5.1第一季度以9.76%的回报率领先,而Kimi-K2.6在夏普比率上领先。在香港,Kimi-K2.6第一季度回报率为30.94%,夏普比率为3.21,但Gemini-3.5-Flash在第二季度以23.41%的回报率领先。相同的协议在每个市场中产生了不同的排行榜,证实了公平比较需要跨市场跟踪。

竞技场式检查作为诊断工具

NextFund最大的突破在于其提供的检查层。模型竞技场让用户选择市场、评估期和一组模型运行进行并排比较。权益曲线、夏普比率、波动率、回撤和周转率一起呈现,每次运行都链接到其完整执行轨迹。用户如果注意到某个模型回报率较高但周转率也较高,可以点击进入详细跟踪视图,查看差异是否源于更频繁的操作还是不同的配置选择。

在决策层面,每个交易日和股票都链接到专家输出、投资组合管理者决策、已执行操作以及沿共享时间轴的文本理由。对齐的轨迹允许检查者确定两个智能体是在上游分析、决策综合还是执行阶段出现分歧。作者通过一个具体的第一季度比较说明了这一点:Kimi-K2.6的保守立场似乎并非由不同的分析师信号驱动,而是由不同的综合步骤驱动。Kimi-K2.6的决策管理者将风险置于信念之上,而Qwen3.5-Flash的管理者则将信念置于风险之上。

尚待完善之处

当前版本侧重于固定分析师阵容下跨三个市场的股票再平衡。对衍生品、多货币对冲和更丰富合规规则的支持留待未来工作。即使拥有同步时钟和结构化日志,文本理由可能仍不完整或仅与潜在模型计算松散对齐。对于重要决策仍需人工审核。实时评估还依赖于第三方行情源,其许可证可能禁止重新分发原始数据;公开工件强调模式、轨迹和接口,而非专有市场数据转储。

NextFund旨在作为审计和比较辅助工具,而非投资顾问。作者对此明确说明:演示结果不应成为投资或监管决策的唯一依据,用户在解释排行榜结果时应检查来源、决策历史和风险指标,将其视为规定协议下的比较证据,而非对未来表现的预测。

系统性改进的基础

或许最重要的设计选择是轨迹完整、时间对齐且可重复使用。支持跨模型比较和故障归因的同一基础也为提示修订、监督适配和强化学习提供了素材。历史决策和摘要可以在后续运行中作为记忆读回,从而在记录与推理之间形成闭环。

随着基于大语言模型的智能体从研究演示进入投资组合管理工作流,模型的承诺与其可审计行为之间的差距将成为机构采用者面临的核心治理问题。NextFund并未解决这个问题,但它提供了首个用于系统性提出此问题的基础设施,而这本身可能就是其最有价值的贡献。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。