Qwen3
3 published articles
实验室与研究3 min read
AI研究
记忆解码器:6.9B附加记忆让410M模型击败Pythia-12B
《Memory Decoder at Scale》将LLM中的长期记忆与推理分离开来。一个6.9B预训练记忆以少39%的参数让Pythia-410M在17项基准测试中超越Pythia-12B;在每一个测试规模下,1.7B领域记忆都为Qwen3 Base增加了9个点以上的分数。
2026-07-31
大语言模型与模型2 min read
竞技编程
NousCoder-14B以开源RL流程挑战奥林匹克编程
Nous Research发布NousCoder-14B,一个基于Qwen3-14B通过RL构建的竞技编程模型。完整开源栈:权重、环境和评估套件。目标针对奥林匹克级别编码基准。
2026-07-16
大语言模型与模型3 min read
长上下文大语言模型
Jet-Long双焦注意力机制一举打破长上下文LLM的固定缩放权衡
Jet-Long根据序列长度动态调整RoPE重缩放,使用局部窗口和远程窗口,通过包含-排除机制合并。在Qwen3模型上,最高支持128K上下文,在RULER基准测试中超过现有零样本基线2个百分点以上,并在PG-19数据集上取得最低困惑度,同时生成开销增加不到4%。
2026-07-12