研究解读 · 进化解读
桥水训了个专做金融信息筛选的模型,准确率 84.7%,方法公开
联合 Thinking Machines,用专家标注数据微调开源模型:比前沿最优错误率降 29.8%,推理成本仅 1/14
速览
- Thinking Machines Lab 联合桥水(Bridgewater)旗下 AIA Labs,用自家微调平台 Tinker,训练了一个专门做金融信息筛选的定制模型。
- 顶级大模型(Gemini、Claude、GPT 系列)用简单提示词做 6 项财经筛选任务,平均准确率只有约 50%,反复优化提示词后最高到 78.2%,仍够不到投资者要求的 80% 可信门槛。
- 训练数据最初来自非专家标注、错误很多。团队设计了一套办法:只把「模型判断和标签对不上」的分歧样本送专家复核,其余沿用,压住了标注成本。
- 以开源的 Qwen3-235B 为基座,标准 GRPO 强化学习微调把准确率打到 73.48%,再叠加交错批次训练、CISPO 非对称裁剪损失、动态提拔教师的在线策略蒸馏,最终做到 84.66%。
- 最终模型准确率 84.7%,比测试过的最优前沿模型(78.2%)错误率少 29.8%,单任务推理成本只有对应前沿模型的 1/13.8。
⚑ 立场提示:本文是 Thinking Machines Lab 与桥水 AIA Labs 联合发布的官方博客,模型、数据、对比结果均为发布方自评,用的是其内部数据的公开子集。下文数字均按原文口径转述。
1投资经理一眼能看懂,AI 却只能蒙
投资经理一秒判断的新闻,AI 却只能蒙
Thinking Machines Lab 与桥水(Bridgewater)旗下 AIA Labs 联合发文,公布了一套用自家微调平台 Tinker 训练金融信息筛选模型的方法和结果。
要自动化的不是写投研报告,而是投资经理每天重复无数遍的「信息分拣」:从新闻、研报、公司文件、邮件里挑出真正值得读的那部分。读本身不难,难的是这一层层贴身的判断,它吃掉了大量时间。团队想看看:这活儿能不能交给模型。
结果先摆出来:顶级大模型直接上手,平均准确率只有约 50%,跟抛硬币差不多;而这个定制小模型做到了 84.7%,推理成本还只有前沿模型的 1/13.8。
◆
为什么值得看:一个开源基座微调出来的小模型,在具体判断任务上把最强前沿大模型(78.2%)的错误率压低了 29.8%,同时把单任务推理成本砍到它的 1/13.8。不是「更聪明的通用模型」,而是「为一件具体的事专门调过的小模型」赢了。
2要自动化的六件小事
投资经理每天在做的六件「小事」
这六件事对投资经理是本能,一秒判完;可一旦要讲清「我凭什么这么判」,人就卡壳了,也正因如此难教给 AI。团队把它们逐条拆出来做评测。
TASK 01
财经文章相关性
一篇财经文章,值不值得投资高管看。难在「相关」不等于「有意义」,需要投资判断力,不是关键词匹配。
TASK 02
央行文件方向
一份央行文件,是否暗示未来利率的走向。要读出字缝里的政策倾向,人凭经验就懂。
TASK 03
研报是否答题
给定一个投资者的问题和一份研究文档,这份文档能不能帮上忙。判断的是「有没有答案」,不是「有没有提到」。
TASK 04
常规内容标记
研报是纯套模板(重复样板),还是模板里夹了一次性的新分析。要分清哪种,还要找出新分析在第几页结束。
TASK 05
文档截断
找出文档从哪里开始变成套话样板。人扫一眼就知道正文到哪结束,模型要精确定位。
TASK 06
邮件截断
找出邮件正文从哪里开始变成签名、免责声明这类样板。同样是「正文到哪为止」的一秒判断。