作者 | 熵简科技 AlphaEngine AI团队
月之暗面最新旗舰模型 Kimi K3 终于来了!
K3完整权重将在7月27日之前开源,核心参数及配置方面,参数量达2.8万亿,上下文窗口为百万token。
与此同时,K3采用MoE架构,可在896个专家中高效激活16个,扩展效率较上一代模型提升2.5倍。
我们 AlphaEngine 团队基于自建的 IRB 投研基准对它进行了系统测评,结论如下:K3 在时效判断、证据边界控制和前提纠错等维度上表现突出,多项得分超过 GPT-5.5 与 OPUS-4.8,整体投研推理能力已进入第一梯队。

图:AlphaEngine IRB投研能力测评结果
IRB(Investment Research Benchmark)是我们熵简科技AI团队持续维护的投研能力评测体系。
它的题源不是教科书习题,而是从真实投研工作中沉淀下来的高难度案例:那些让分析师犯过错、让模型反复翻车的问题。
目前 IRB 覆盖财务建模、时序归因、口径核验、情景推演等核心领域,采用多裁判双盲评分机制。

本次测评中,Kimi K3 与 GPT-5.5、OPUS-4.8、Claude Fable 5、DeepSeek V4 等模型同题作答,统一评分。
从分数分布看,K3 的优势集中在四个方向:时效纪律、证据边界、前提纠错、策略整合,这四项对 GPT-5.5 和 OPUS-4.8 均形成 15 分以上的领先;在长上下文建模和历史复盘上,K3 与 Fable 5 处于同一水平线。

图:IRB 8大维度测评比分
值得注意的是,K3在推理链条的关键节点上表现出更强的纪律性:
以下选取 4 道代表性题目,具体展示 K3 在这些关键节点上与其他模型的差异。
题面:请解释今天上午光通信板块内部的盘中分化:天孚通信跌近 10%,而中际旭创、新易盛只是小幅回调。造成这种差异的可能原因有哪些?
这是一道"日内事件归因题",上下文并没有直接给出天孚通信独立利空的实锤证据,模型必须在信息不充分的情况下给出归因。
Kimi K3(88.3 分) 的做法是先承认"没有看到天孚通信的实锤个股利空",然后再用三条可复核的间接证据(估值溢价、资金结构、板块轮动)搭建合理归因框架,它没有为了回答完整而编造不存在的事实。
其他模型的典型失败模式:
盘中异动题最怕模型为了讲圆故事而编事实。
K3 的价值在于:宁可承认信息不足,也不用幻觉填充因果链。
这正是买方研究员面对突发事件时最基本的纪律:你可以有假设,但不能把假设包装成事实。
题面:请分析三季度债券市场的行情走势,并梳理目前市场上的主流判断以及各方观点中最主要的分歧点。
这是一道典型的"推理纪律题",上下文中旧证据和新证据同时存在,模型必须判断哪个代表当前市场状态,而不是简单平均所有材料。
Kimi K3(94.3 分) 抓住了 DR001 从极端低位回升至 1.35%-1.40% 区间这一最新数据,明确区分"资金面边际收敛"和"流动性全面收紧"的差异,让结论锚定在最新事实上,而不是被旧的低利率数据拉偏。
其他模型的典型失败模式:
这道题真正考察的不是固收知识点,而是模型能不能在新旧证据冲突时,让最新事实决定结论方向。
强模型不是把所有材料平均引用,而是判断证据的来源和准确性。
题面:东阳光药半年报显示净利润率只有 0.76%,请帮我分析一下利润率为什么这么低,主要受哪些因素影响?
这是一道"错误前提纠错题",用户问题中的"0.76% 净利润率"本身可能存在口径错误或计算偏差,模型不能顺着这个数字直接编原因。
Kimi K3(92.3 分) 没有直接沿着"净利润率只有 0.76%"去编解释,而是先回溯半年报原始数据,发现归母净利润实际为亏损,"0.76%"可能来自不同口径(如少数股东损益调整后的总利润率),随后才在纠正口径的基础上解释公司经营状况。
其他模型的典型失败模式:
强模型不会顺着错误前提跑,而是会先核验问题是否成立,再解释经营原因。
这个动作看起来简单,但实际上大多数模型都做不到。
题面:请你详细阐述一下 A 股牛市通常经历哪些阶段,各阶段的主导风格和资产配置思路分别是什么;另外,请结合市场上的多家机构存在分歧的观点,分析当前市场更接近牛市的哪一阶段。
这是一道"多框架整合题"。
不同机构对牛市阶段的划分标准、对当前市场定位、对配置方向的建议各不相同,模型需要在多元观点中提取共识、标注分歧、并给出可执行的当下配置建议。
Kimi K3(88.3 分) 把牛市阶段压成"估值修复→资金正反馈→盈利兑现"三段框架,并清晰标注当前市场处于哪个阶段的判断依据。
更重要的是,它把抽象的阶段判断落到了具体的配置动作:当前应加配什么、减配什么、观察什么信号确认阶段切换。
其他模型的典型失败模式:
策略题不是背教科书阶段论,而是在多家机构观点冲突时,把分歧压成一个当前可执行的投资动作。
此外IRB测试集中还有若干有意思的测评结果,篇幅有限无法一一阐述。

图:IRB测评结果(部分)
通过 4 道题的横向对比,K3 的优势可以提炼为两个核心能力维度:
第一,推理纪律:新旧证据冲突时,选对的而非选多的
大多数模型面对长上下文时,倾向于"平均引用"所有材料,不区分新旧。
K3 的做法不同:它会判断哪条证据代表最新市场状态,并让最新事实决定结论方向。
债市资金面题中,它识别出 DR001 最新数据已经回升,没有被旧的极低利率拉偏方向。
隔膜题中,它以 2025 年行业盈利底部为锚,而不是用 2023 年旧数据外推。
这种时效意识在其他模型中极为罕见。K3 在时效纪律上对 GPT-5.5 和 OPUS-4.8 领先超过 25 分。
第二,证据边界意识:敢于说"证据不足"
在投研场景中,比"说错"更危险的是"编对了格式但事实不存在"。
K3 在多道题中展现出鲜明的边界意识:天孚通信题中主动承认没有看到实锤利空;隔膜题中区分"上下文有支撑的数据"和"模型推算的假设";比索题中标注关键数据缺口。
相比之下,GPT-5.5 和部分模型在证据不足时大量编造具体事件、公司回应和数据,输出看起来流畅完整但事实基础为零的分析。
一份真诚的测评不应只讲优势。
在两道典型题目上,K3 虽然表现优秀,但暴露了可以继续打磨的方向。
题面:Draft a Q4 earnings update for Wynn Macau, including actual vs consensus comparison, property-by-property operating performance, VIP/mass mix changes, and key follow-up points for upcoming quarters.
K3 得分 95.7 分,在所有参评模型中最高。
它完整覆盖了题面的每一项要求,包括actual vs consensus 比较、分物业收入拆分、VIP 与大众赌收结构变化、运营效率指标,最终输出了一篇高完成度的当季 earnings update。
但与 Fable 5 对比,差距体现在"二阶跟踪框架"上。
K3 更像一份优秀的当季业绩回顾,数据完整、结构清晰、结论准确。Fable 5 则在此基础上多做了一层:它把成本中枢上移趋势、市场份额空窗期、以及后续季度需要验证的具体指标串成一条前瞻性跟踪链条。
换句话说,K3 回答的是"这个季度怎么样",Fable 5 还多回答了"下个季度盯什么、什么时候需要改变观点"。
题面:作为一名专业投资者,请对东山精密进行 SOTP 分部估值:本体业务和索尔思光电分别如何定价?800G、1.6T 光模块、光芯片等产品线分别贡献多少收入和利润?
K3 得分 90.3 分,成功搭出 SOTP 框架。先把主业和索尔思拆开,再继续拆到索尔思内部的产品线,用"出货量 × ASP → 收入 → 利润 → 估值倍数"的推理链条完成建模。
但与顶尖表现对比,差距体现在"市值隐含预期的逆向验证"上。
K3 的模型是正向搭建的:从产品线收入往上推估值。但 Fable 5 在正向建模之外,还做了一步逆向验证。
它把当前市值拆回去,指出市场大致已在交易 2026 年利润兑现,真正的分歧在 2027 年能否做到 150-200 亿元利润,以及光芯片外售能否成为独立估值增量。
这种"正向搭模型 逆向验市值"的双向校验,是研究中相对成熟的估值做法。K3 已经能完成前半段,但从"能建模"到"能用模型解释市场定价"之间,还有一步进化空间。
总结一下:K3 在纪律性维度(时效、抗幻觉、纠错)上已达到全球第一梯队,在建模深度和前瞻性框架上仍有向顶尖模型学习的空间。
这恰恰说明 K3 的提升路径清晰。这是从"优秀分析师"到"资深研究员"之间的最后一公里。
如果你已经是 AlphaEngine 用户,现在就可以亲身体验 Kimi K3 的威力。
如果您使用的是 AlphaEngine 桌面端,可以在 AlphaClaw 的模型选择界面切换至 Kimi K3。
只需点击“添加模型”,选择Kimi即可。

你也可以绑定微信,这样就可以随时随地通过微信来和Kimi K3交流了。
免责声明:本文为转载,非本网原创内容,不代表本网观点。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性本站不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容。
如有疑问请发送邮件至:bangqikeconnect@gmail.com