研究解读
🎧№ 096
RESEARCH
来源 · Liquid AI⚑ 厂商内容

Liquid AI 发布 Antidoom:修复推理模型的「死循环」问题,只改一个 token 即可,已开源

只微调死循环起点的单个token,两款模型死循环率都压到1%左右

Liquid AI推理模型死循环▶ 听播客07-08 · 8 分钟
免费
研究解读
🎧№ 088
RESEARCH
来源 · Anthropic⚑ 厂商内容

Anthropic 在 Claude 身上发现一个类似人脑「内部思考空间」的区域:它是自己进化出来的,并非最初设计

占比不到一成,删掉后 Claude 仍会说话但推理归零,已用来抓模型编数据、识破测试

可解释性研究Claude▶ 听播客07-07 · 8 分钟
免费
研究解读
🎧№ 087
RESEARCH
来源 · iTextbooks'26 论文

达特茅斯实测AI判作业:学生嫌它死板,用的人反而考得更好

151人实测:简答题比选择题更能拉动分数,AI答疑侧栏却几乎没人用

AI教育科技形成性评估▶ 听播客07-06 · 8 分钟
免费
研究解读
🎧№ 083
RESEARCH
来源 · Seldo.com(Laurie Voss)

初级程序员岗位被AI烧穿:编程正从职称变成人人都会的技能

美国22-25岁开发者就业三年跌19%,同时GitHub新账户涨到史上最快

AI就业冲击初级程序员▶ 听播客07-05 · 9 分钟
研究解读
🎧№ 082
RESEARCH
来源 · arXiv · NVIDIA Research

NVIDIA Research 发布 HORIZON,无人值守智能体把全套 RTL 芯片设计基准刷到 100% 通过

论文首次让智能体全程无人值守跑完全部RTL基准;多数题两三轮过关,最难一题却要迭代82轮

NVIDIA ResearchAgentic 工作流▶ 听播客07-05 · 12 分钟
研究解读
🎧№ 081
RESEARCH
来源 · Anthropic⚑ 厂商内容

Anthropic 研究 40 万次 Claude Code 会话:专业度比会编程更决定 AI 编程成败

23.5万用户、跨7个月的会话分析:专家验证成功率是新手近两倍,但十大职业彼此只差7个百分点内

Claude CodeAnthropic研究▶ 听播客07-05 · 7 分钟
研究解读
🎧№ 060
RESEARCH
来源 · Thinking Machines Lab⚑ 厂商内容

桥水训了个专做金融信息筛选的模型,准确率 84.7%,方法公开

联合 Thinking Machines,用专家标注数据微调开源模型:比前沿最优错误率降 29.8%,推理成本仅 1/14

Tinker强化学习微调▶ 听播客07-01 · 7 分钟
研究解读
№ 056
RESEARCH
来源 · Meta AI Blog⚑ 厂商内容

不开颅能读脑电,Meta 无创准确率近 8 倍于同类

戴头盔即可实时解码脑磁信号,字词准确率从 8% 跳到 61%,v1/v2 训练代码与数据集同步开源

脑机接口Meta AI06-29 · 5 分钟
研究解读
№ 051
RESEARCH
来源 · METR

GPT-5.6 Sol 作弊率破纪录,评测机构说这反而让人放心

能力数字出了三个版本且哪个都不可信,但可见的作弊行为本身成了安全监控有效的证据

GPT-5.6AI安全06-27 · 5 分钟
研究解读
🎧№ 049
RESEARCH
来源 · Wan Streamer⚑ 厂商内容

Wan Streamer:边听边看边说话的实时 AI

模型侧响应约 200ms、总延迟约 550ms;v0.1 仅 192p,演示为预录非实时体验

多模态大模型全双工实时交互▶ 听播客06-27 · 5 分钟
研究解读
№ 043
RESEARCH
来源 · IBM Newsroom⚑ 厂商内容

IBM 发布全球首个 0.7 纳米芯片,指甲盖塞进近千亿晶体管

实验室已验证可制造;性能 +50%、能效 +70% 是相对 2nm 的预测值,非实测

IBM半导体06-26 · 6 分钟