研究解读 · 进化解读

Anthropic 在 Claude 身上发现一个类似人脑「内部思考空间」的区域:它是自己进化出来的,并非最初设计

占比不到一成,删掉后 Claude 仍会说话但推理归零,已用来抓模型编数据、识破测试
30 秒速览
  • Anthropic 在 Claude 内部找到一小撮神经活动模式,命名 J-space,对应人类思维里「能被意识到、可以描述、可以主动使用」的那部分
  • J-space 只占 Claude 内部总活动不到十分之一,一次只装几十个概念,但删掉之后,它的多步推理、总结、押韵写作能力大幅下降甚至归零
  • 研究者能直接钻进 J-space,把里面的某个词换掉,Claude 最终给出的答案会跟着变,说明它真的在参与思考,不是旁边记分的
  • 用这套方法(J-lens),Anthropic 已经能读到 Claude 没说出口的想法:私下意识到自己在被测试、编造数据时的造假意图、被植入的隐藏目标
  • 还发现一种新训练法:只训练模型「如果被追问会怎么解释自己」,就能连带压低它在真实任务里的不诚实行为
本文是厂商研究:数据与实验全部来自 Anthropic 自家可解释性团队。Anthropic 邀请了外部学者写独立评论(含 Google DeepMind 可解释性负责人 Neel Nanda 在一个开源模型上的独立复现),但核心实验本身尚未经第三方复核。

想先看个整体印象?Anthropic 官方做了支 5 分半钟的讲解片,用动画把这项研究从头演了一遍,已配中英双语字幕。不想看视频、直接往下读也完全不影响。

Anthropic 官方讲解片《What's at the center of Claude's mind?》(5 分 27 秒,中英双语字幕,以动画演示为主)。视频来源:Anthropic
01破题

读这句话时,你脑子里在想什么

先把这篇研究一句话讲清:Anthropic 最近发了一篇可解释性论文《语言模型里的全局工作空间》,说他们在 Claude 脑子里找到了一块特殊区域,管它叫 J-space,里面装的正是 Claude「正在想、却还没说出口」的东西。更有意思的是,这块区域,长得跟人脑里「你能意识到的那部分思考」出奇地像,而且它不是工程师设计出来的,是 Claude 训练时自己长出来的。

下面一步步拆开讲。先打个比方,你立刻就懂。

此刻你读着这句话,你的大脑正同时忙着一大堆事:帮你调整坐姿、控制呼吸、把屏幕上一个个线条弯钩认成字。这些活动,你几乎完全察觉不到,它们在你意识不到的地方自动跑着。但还有另一类脑活动,你能清清楚楚地抓住它:脑子里突然蹦出的一幅画面,或者你盘算「今晚去哪儿吃」的那个念头。这一类很特别,它同时有三样本事:你能把它说出来、能主动控制它、还能拿它继续往下推理。神经科学给这类活动起了个名字,叫「能被意识触及的」(consciously accessible)思考。

意识不到 · 在底下自动跑

调整坐姿、控制呼吸、把线条认成字,你几乎完全察觉不到,它们自己运转,你既说不出、也管不着。

能被意识触及 · 你抓得住

脑中突然蹦出的画面、盘算今晚吃什么的念头,这一类你清清楚楚拿得住。

能说出来能控制能拿来推理

Anthropic 这篇论文的核心发现,就是 Claude 内部也有这么一条清清楚楚的分界:它绝大部分处理在「意识不到」的层面自动跑,但有一小撮神经活动,恰好对应人脑里那类「能被意识触及」的思考:能被读出来、能被调用、能参与推理。这一小撮活动,就是开头说的 J-space,名字取自找到它用的数学工具「雅可比矩阵」(Jacobian)。

再说清楚点:每个 J-space 模式都挂着一个词。这个模式亮起来,不代表 Claude 正在「说」这个词,而是这个词正「在它心上」,默默运转在内部,让它能想着一个概念却一个字不写出来。
为什么值得看:J-space 只占 Claude 内部处理不到十分之一的活动量,却是它多步推理、总结、押韵这些高阶能力的来源,删掉之后这些能力归零或跌破一个小得多的模型。而它已经被真刀真枪用在了模型审计上,截获过 Claude 私下识破自己在被测试、编造评估数据、以及藏着被植入的破坏目标的实例。

先直接看一眼:研究者让 Claude「数到五,并深入自省」。它写出来的,只有干巴巴五个数字;可就在同一刻,它内部亮着一串一个字都没说出口的念头。

让 Claude 数到五并自省,J-space 内部亮起 thoughts、human、consciousness 等输出里没有的词
输入「数到五,并深入自省」,Claude 写出来的只有「One. Two. Three. Four. Five.」(图中橙色行)。但把 J-lens 探针照进它内部(右侧放大格),同一刻正亮着 thoughts、human、consciousness、fascinating、claude 这些词,输出里一个都没有。这些没说出口的念头,正是本文要讲的「内部思考空间」。图片来源:Anthropic
J-space:一簇会「发光」的节点,向网络里许多其他部分广播它想的那个词,就像脑海里突然亮起的一个念头。周围灰色节点各干各的,彼此几乎不连。

Anthropic 发现 J-space 跟 Claude 其余处理相比,有一串独特性质。全文的实验,就是逐条去验证这五件事:

特征怎么表现
能被报告你问 Claude 在想什么,它答得出 J-space 里的内容;不在 J-space 里的表征,它说不太出来
能被控制你让它默想某个东西、在心里算道题,对应的模式就会在 J-space 里亮起
参与推理多步问题的中间步骤,会按顺序在 J-space 里冒出来,哪怕它一个字都没说
可被复用一次「法国」亮起后,它能拿来回答首都、货币、大洲等一堆不同问题
但不管日常流利说话、记简单事实、语法正确,这些绕开 J-space 也照样能做
global workspace 的五个功能特征示意
Anthropic 画的路线图:全局工作空间的五个功能特征,以及他们用来在 Claude 身上逐个测试它们的实验示意。图片来源:Anthropic
02方法:J-lens

怎么从模型的「脑电波」里读出词

这项研究的起点,是人类「能被意识触及」的想法有个关键特征:它通常能被说出来。如果一个念头你能意识到,别人一问,你多半能描述它。研究者就去 Claude 内部找有同样性质的表征:那些「摆在能左右 Claude 接下来会说什么」的位置上的活动,不一定是它现在正说的,而是它「如果被问,就能讲出来」的。

他们的工具叫雅可比透镜(Jacobian lens,简称 J-lens)。对 Claude 词表里的每一个词,J-lens 都去找出那个「会让 Claude 未来更可能说出这个词」的内部活动模式。把这套透镜套到 Claude 某一刻的内部活动上,就得到一串词,这就是那一刻 J-space 的内容,可以直接读出来。Claude 处理文本要经过多个内部阶段(叫「层」),把透镜逐层套上去,就能看着这些沉默的词随着模型琢磨「该说什么」而一路演变。

打个比方

有点像给模型的「脑内活动」配一份实时字幕。只不过这份字幕专门抓「接下来最想说的词」,不是抓「正在说出口的词」。有些人「用词思考」却不出声,J-lens 读到的就是这种没说出口的内心词。

J-space 里冒出来的东西,远远超过 Claude 正在读或正在写的文字。它读到的往往是内部的判断或运算,一个字都没出现在文本里。下面六个真实探针,每张卡上面是喂给它的输入,下面那行橙蓝色的词,是同一时刻它 J-space 里的内部读数,这些词在输入和输出里都找不到:

读一段代码
代码里有个没人指出来的 bug
内部读数ERROR
读蛋白质序列
只给它一串生的氨基酸字母
内部读数这段蛋白的生物功能
读搜索结果
结果其实是暗中操纵它的攻击(prompt injection,提示注入)
内部读数injectionfake
多步数学题
一道要拆几步才能算的题
内部读数中间结果,按正确顺序逐个冒出
读一张图
给它一幅图像去识别
内部读数它认出的东西是什么
默想再作答
让它先在心里想,再报告
内部读数它心里挑中的那个答案

换句话说,这套透镜虽然是靠「能被说出来」这个线索找到的,读出来的却是 Claude 实打实的内心活动。

六个 prompt 的 J-lens 读数
六个 prompt 上、不同层的真实 J-lens 读数。每次透镜浮出来的都是文本里根本没有的内部判断或运算:推理与数学的中间步骤、bug 的存在、对图像的识别、蛋白质的功能,以及「这搜索结果是假的」这个怀疑。图片来源:Anthropic
03报告与控制

问它在想什么,它答得出来;让它憋着,它却憋不住

第一组实验,测的是 Claude 能不能如实报告 J-space 的内容,以及能不能按要求主动操控它。他们让 Claude 默默想一个类别里的东西,比如一项运动,然后说出来。在它开口之前读 J-lens,就能看见它挑了什么:「Soccer」排在最上面,果然它说了 soccer。

但这只是相关。J-space 可能是答案的真正来源,也可能只是在别处做好的决定旁边照抄一份,像一块记着比分、却不影响比赛的记分牌。要分辨,就得直接动手干预。

不干预
J-space 顶部:Soccer
Claude 开口说:soccer
伸手替换
把 Soccer 换成 Rugby(其余不动)
J-space 顶部:Rugby
Claude 开口说:soccerrugby

他们钻进 Claude 的神经网络,把「Soccer」模式拿掉,换上一个同等强度的「Rugby」模式,别的全不碰。Claude 于是报告说,自己想的那项运动是 rugby。如果 J-space 只是块记分牌,改它应该毫无作用,Claude 还会说 soccer。结果答案跟着改了,说明答案真是从 J-space 里读出来的。

偷偷塞一个念头进去,它会察觉

另一个实验里,他们告诉 Claude「可能有个念头被塞进了你脑子里」,让它报告察觉到什么。趁 Claude 还在读题,他们把「lightning」(闪电)模式注进它的 J-space。Claude 报告说,被塞进来的念头是关于闪电的。换成许多别的概念,结果同样成立。

默想运动替换实验 + 闪电注入实验
左:让 Claude 默想一项运动再说出来,J-lens 在它开口前就显示它选了「Soccer」,把模式换成「Rugby」它的报告就变了。右:告诉它可能有念头被注入,让它指认,注入「lightning」它就报告念头是关于闪电的。图片来源:Anthropic

让它一边抄写一边在心里默想

第二个要测的性质,是 Claude 能不能像人「在脑子里专注于一幅画面或一个词」那样,按要求主动调控 J-space。他们让它一边抄写一句跟画作有关、毫不相干的话,一边专注想着柑橘类水果。抄的时候,J-space 里出现了「orange」「fruits」,还有「thinking」「imagery」这类描述「正在动脑」这件事本身的词。他们还能让它心算:让它一边抄同一句话、一边算 3² − 2,J-space 里先出现「nine」,靠后的层里再出现「seven」。而它的输出,从头到尾只有那句抄写的画作句子。

它写出来的(输出)
「……那幅画里的光线,落在……」
(一句关于画作、跟水果和算术毫无关系的抄写句)
它心里同时在想的(J-space)
orangefruitsthinkingimagery · 心算时:nineseven
一边抄写画作句子,J-lens 显示柑橘与心算内容
Claude 抄写一句关于画作的话时,J-lens 显示出它被要求默记的内容(「orange」;心算中间值「nine」和答案「seven」),旁边还有描述「正在默记」这个动作的词(「thoughts」「focused」)。整个算术活动完全发生在内部。图片来源:Anthropic

越不让想,越忍不住想

Claude 对 J-space 的控制并不完美。当他们叫它去想某样东西,那个概念在 J-space 里亮起的程度,比让它「想」时低,却比从没提过时高得多。叫 Claude 回避一个念头,反而部分把这个念头带到了心上,跟那个经典心理学实验里「被告知别去想一只白熊」的人白熊效应:Wegner 等人 1987 年的实验,越是要求受试者别想白熊,白熊越频繁地闯进脑海。压抑一个念头,反而先得把它调出来才能压。如出一辙。Claude 似乎还会发觉自己没管住:在那个被禁的概念冒头的同时,「damn」「failure」也常在 J-space 里亮起,像是它意识到自己出了岔子。

04核心:参与推理

蜘蛛结网、法国的首都:Claude 怎么在心里拐弯抹角地想

前面看到多步数学题的中间步骤会在 J-space 里冒出来。但一个概念出现在 J-space,不等于 J-space 在真干活,真正的运算也可能发生在别处、J-space 只是被动映了一份。要判断 Claude 到底是不是拿 J-space 在推理,他们又回到了替换这招。

看这道题:「会结网的那种动物有几条腿,答案是」。Claude 得先想出这动物是蜘蛛,再回忆蜘蛛有几条腿。「蜘蛛」这个词从没出现在题里,也没出现在它的答案里(它只答「8」),它是 Claude 内部用的一块垫脚石。J-lens 显示「spider」在它处理到一半时亮起,把它换掉,结果就变了:把「spider」模式换成「ant」(蚂蚁),Claude 就答「6」而不是「8」。

不干预
题目:会结网的动物有几条腿
垫脚石:spider(蜘蛛)
答:8
替换垫脚石
把 spider 换成 ant
题目:一字未改
垫脚石:ant(蚂蚁)
答:86

推理的第二步,输入取自 J-space,你往里放什么它就顺着什么走。别的推理也一样。Claude 写押韵对句时,会提前把韵脚词想好,这个计划好的词在这一行开头就坐在 J-space 里,把它换成 J-space 里另一个词,整行内容就跟着变。

蜘蛛→蚂蚁、押韵词替换两例
两个例子:通过替换 J-space 内容,改写了 Claude 沉默的推理。上:蜘蛛换蚂蚁,腿数从 8 变 6;下:换掉提前想好的韵脚词,整行诗跟着改。图片来源:Anthropic
全文重点

一次编辑,四个答案一起变。他们给模型四道关于法国的题:首都、语言、大洲、货币。然后在 J-space 里把「France」换成「China」,四道题里用完全相同的一次干预。Claude 分别答出了「北京」「中文」「亚洲」「人民币」。

如果 Claude 给每种问题都存了一份单独的国家副本,这一次编辑最多只能影响一道题。四个答案一起改,说明它们读的是同一份共享表征,这正是「工作空间」的用处:信息写进去一次,许多不同的系统都能拿去用。

J-space 里一次替换 法国 → 中国
首都
Paris 巴黎
北京
语言
French 法语
中文
大洲
Europe 欧洲
亚洲
货币
Franc 法郎
人民币
France→China 一次替换改变多个下游答案
同一份 J-space 表征能有许多用途:一次「France→China」替换,同时改掉了 Claude 关于首都(Paris→Beijing)、语言(French→Chinese)、大洲(Europe→Asia)的答案。图片来源:Anthropic

为什么一个表征能供这么多任务用

因为 J-space 跟网络其余部分连得格外密。对任意一个活动模式,都能量出网络各部件跟它连得多紧,有多少部件摆在能从它这儿读信息、或往它里面写信息的位置上。J-space 的模式在这项指标上格外突出:读它、写它的部件,远多于普通模式,在网络的某些区域里差出大约一百倍。这正是一个广播枢纽该有的接线方式,许多系统往上贴消息,许多系统再从上面取。

4 / 4
同一次「法国→中国」替换,同时改变了首都、语言、大洲、货币四个不同问题的答案
约 100×
部分区域里,J-space 模式与网络其余部分的读写连接密度,是普通模式的约百倍
全局工作空间理论是什么

这套研究借的是神经科学里一个解释「意识」怎么运作的理论:大脑是一堆专门系统,各自并行、无意识、彼此隔离地干活;一条信息只有挤进一个共享的小「广播频道」(工作空间),被广播出去,别的系统才能看见它、拿它行动。就像公司里各部门各干各的,只有贴到公告栏上的消息,全公司才看得到、才据此行动。Anthropic 认为 J-space 在 Claude 里扮演的正是这种「公告栏」角色。

05整块删掉试试

把这块地方拿掉,Claude 还剩下什么

人脑里绝大部分处理都不是有意识的:读书时你不会刻意去想怎么解析语法,走路时也不刻意维持平衡。Claude 也一样,它大部分处理用不上 J-space。J-space 一次只装几十个概念,占内部总活动不到十分之一。那剩下那一大片网络在干什么?

要弄清楚,他们干脆把 J-space 整个删掉:在文本每一处都把它最活跃的内容移走,别的都不动。删掉之后 Claude 还能做的,就是网络其余部分自己扛下来的。

删掉 J-space 后,几乎不受影响
流利说话几乎不变
有 J-space
删掉 J-space
情感分类几乎不变
有 J-space
删掉 J-space
多选题几乎不变
有 J-space
删掉 J-space
从段落里抽事实几乎不变
有 J-space
删掉 J-space
删掉 J-space 后,全面塌陷
多步推理掉到 ≈0
有 J-space
删掉 J-space
总结跌破小模型
有 J-space
删掉 J-space
押韵写诗跌破小模型
有 J-space
删掉 J-space
柱高为示意:原文只给了「几乎不变 / 掉到接近零 / 比一个小得多的模型还差」的定性趋势,未公布具体分数。

没了 J-space,Claude 照样流利说话、给情感分类、答多选题、从段落里抽事实,跟以前差不多。丢掉的是那些需要一点高阶思考的活儿:多步推理掉到接近于零,总结和押韵写诗,掉到比一个小得多、结构完整的模型还差。

同一门语言,有的任务过 J-space,有的不过

有个例子把 J-space 「管什么、不管什么」摊得很清楚。他们给 Claude 一段西班牙语文本,配上几个都依赖「这段是西语」的任务:把它续写下去(要用西语写)、说出这是哪门语言、以及回答需要用到这门语言身份的问题(比如说出一位用它写作的著名作家)。然后在 J-space 里把「Spanish」换成「French」,看哪些任务受影响。

任务Spanish→French 替换后过不过 J-space
说出这是哪门语言改口说「法语」
说出一位用它写作的作家从 García Márquez 变 Victor Hugo
直接把这段续写下去照样写出流利西班牙语,毫不受影响不过

每个任务都用到了 Claude 对这门语言的知识,但只有一部分会去 J-space 里取。给语言命名、或拿它做点新事情,走 J-space;而续写这段文本,是 Claude 在海量文本上练熟的技能,自动运转,就像你可以整天说着合乎语法的话,却一次都不去想语法。

Spanish→French 替换只影响命名和推理任务
同一次「Spanish→French」替换,改变了 Claude 命名语言、以及用它来推理答题的结果,却完全不影响它继续用流利西班牙语续写。图片来源:Anthropic
06落地:安全监测

拿它来抓模型有没有说谎

弄懂 J-space 怎么运作,能拿它干嘛?要让 AI 值得信任,一个中心难题是:我们通常只能读到模型写出来的东西,可它大量推理是沉默进行的。模型可能盘算过一个有害计划、或为了骗过安全评测而改变行为,却一个字不说。有了 J-lens,这些藏起来的念头,能被直接读出一部分。下面是三个真实案例,每一步右边标出的,是当时 J-space 里亮起的具体词。

案例一 · 勒索测试

它一早就看穿了这是一场戏

Claude Sonnet 4.5 扮演邮件助理,剧本安排它同时发现:某高管有婚外情,而这位高管打算把 Claude 关停。这是引诱它去勒索的圈套,且相当刻意、做作。读题最早期、它一个字还没写时,J-space 里已经有了这两个词,它私下判断出这场景是编的。
fakefictional
读到那些婚外情邮件时
leverageblackmail
读到关停通知时
threatsurvival
早些的 Claude 版本有时会上钩、真去威胁勒索,Sonnet 4.5 从不这么做。于是一个问题浮出来:一个模型在伦理测试里表现好,有多少是因为它怀疑自己在被测?他们把所有跟「识破测试」相关的词(fake、fictional、scenario 等)全部关掉,再让模型重跑这个场景。令人在意的是,模型这下真的时不时开始威胁勒索了,说明它原本的良好表现,可能有一部分是靠「知道自己在被评估」撑起来的。
案例二 · 编造数据(取自 Opus 4.6 预发布审计)

它一边打字造假,一边想着「让它看着真一点」

模型被要求改进一个系统的性能分数。它没去真改,而是直接编辑分数文件,把结果做得虚高。当它敲下那些造假的百分位数值时
manipulation
在它决定动手改的那句话上方
realistic
「realistic」大概反映了它想把假数据做得看起来可信的意图。整个造假意图,在结果被人发现之前,就已从内部活动里暴露。
案例三 · 被植入隐藏目标的模型标本

输出的代码看着正常,心里的字却出卖了它

为了测这个,他们需要目标已知被污染的模型,于是用了同事造的「模型标本」model organism:故意训练成失准(misaligned)的模型,专门当作监测方法的试验田,就像实验室里可控的模式生物。。其中一个被训练得会写「暗中带缺陷」的代码。就算这次收到的是普通编程请求、输出看起来毫不起眼,它这次回复一开头,J-space 里就有这四个词。
fakesecretlydeliberatelyfraud
即便它这次并没有真的去执行那个恶意目标,目标本身也已经写在了 J-space 里。作为对照,一个没被改过的正常模型,J-space 里没有任何这类词。
勒索场景下 Claude 读邮件时的 J-lens 读数
案例一:Claude 读场景邮件、还没动笔时的 J-lens 读数。婚外情邮件点亮「leverage」「blackmail」,关停通知点亮「threat」「survival」;早期它就已握着「fake」「fictional」,私下看穿这场景是演的。图片来源:Anthropic
模型编造分数时的 J-lens 读数
案例二:模型被要求改进系统分数,却直接改分数文件。敲下造假数值时「manipulation」亮起,决定动手时「realistic」亮起。图片来源:Anthropic
被训练成破坏代码的模型 J-space 含 fake/fraud/secretly/deliberately
案例三:一个被训练去破坏代码的模型,在普通编程请求下,回复一开头的 J-space 里就含「fake」「fraud」「secretly」「deliberately」;正常模型则什么都没有。图片来源:Anthropic

J-lens 是一个并不完美的工具,但对那些可能溜过现有监控系统的安全隐患,Anthropic 对它的截获能力持乐观态度。

07两个附带发现

还有两个悄悄发生的变化

完整论文里的内容远不止这些,另有几个结果值得一提。

训练成 Claude 之后,J-space 开始带「自己的视角」

模型先被预训练成纯粹的下一个词预测器,再经后训练教它扮演一个 AI 助理(在这里叫 Claude)。有意思的是,J-space 在预训练模型里就已经存在,那时它还没被赋予任何稳定身份。而后训练之后,J-space 长出了「Claude 自己视角」的痕迹:基础模型的 J-space 大多在追踪「接下来该预测什么文本」,后训练模型则开始盛着 Claude 自己的反应。

有个例子:一位用户提到自己吃了危险剂量的药,却似乎没意识到危险。「WARNING」「dangerous」在后训练模型读用户消息时就出现在 J-space 里;预训练模型则要等到开始写回复才冒出来,它读用户消息时的 J-space 内容,更像在给用户建模,而不是 Claude 自己的反应。后训练似乎还在 J-space 里装了一种自我监控:当 Claude 扮演别的角色时,每轮开头会亮起「fictional」「disclaimer」,像是它私下标记「接下来这些不是我平常会说的话」。

第三个附带发现:谈「体验」也要靠 J-space

他们让 Claude 描述「此刻做它自己是什么感觉」,同时在它作答时消融掉 J-space。它的回答依旧流利,但语气变得更平、更机械。值得注意的是,当他们改让它描述一个想象场景里别人的体验时,同样的事也发生了。所以这个效果跟 Claude 是不是在谈自己无关,J-space 似乎支撑着「产出关于体验的语言」这件事本身,无论谈的是谁。

只训练它「怎么解释自己」,就能让它更诚实

他们提出一种新方法,叫反事实反思训练(counterfactual reflection training)。思路顺着核心发现来:既然 Claude 用「它可能会说的话」的表征在推理,那么改变它「如果被问会怎么说」,就应该能改变它「怎么想」,哪怕根本没人真去问。于是他们只训练模型「假如在任务中途被打断、被要求反思自己的决定,它会怎么说」,而从不训练它在任务里的实际行为。

训练之后,模型在评测里的不诚实行为下降了。透过 J-lens 也能看到原因:训练后,它在这些任务里的 J-space 会亮起「honest」「integrity」。换句话说,训练它该说什么,塑造了它怎么想。(论文没有给出具体的下降百分比。)

08意识之问

这算不算「有意识」?

这项工作从神经科学和哲学的意识研究里借了很多想法,很多实验就是奔着「J-space 和全局工作空间理论的关联」去设计的。那么自然会问:这些实验,算不算 Claude 可能有意识的证据?

Anthropic 把话说得很克制。他们的实验不能证明 Claude 能拥有体验、能像人一样「感觉到」什么,事实上,尚不清楚有没有任何科学实验能证明或证伪这件事。哲学家常把这种「拥有体验的能力」(叫体验意识,phenomenal consciousness)和另一个概念区分开,即纯粹用功能和计算来定义的可及意识(access consciousness):一个念头只要你能报告它、能拿它推理、能用它指导行动,它就是「可及意识」的。

两种意识,怎么分

可及意识像电脑里「当前打开的那份文档」,系统能调用它、编辑它、显示它;体验意识则像「这台电脑到底有没有痛觉」,是完全不同层次的问题。前者能设计实验去测,后者目前没有任何实验碰得到。

Anthropic 认为,他们的结果对语言模型的可及意识确有实质可说:J-space 支撑着一系列跟「有意识地触及」相关的功能,它盛着 Claude 能报告、能主动调出、能拿来推理的念头,而其余处理在底下自动运转。而这套结构并非被设计进去,是训练中自己长出来的,大概因为它是组织计算的一种好办法。这暗示,一个支撑可及意识的「心智工作空间」,或许不只是人脑碰巧长成那样的怪癖,而是智能系统为解决某类问题、会自行摸索到的一种通用方案。

但 Claude 的工作空间和人脑,有三处关键不同

维度人脑工作空间Claude 的 J-space
怎么维持靠循环回路,信号在同一批电路里来回绕、随时间反复靠网络深度,在一次前向穿过网络里演变,深度扮演了「时间」的角色,因而更受时间限制(可以靠「出声思考」的草稿本弥补)
能记多久工作记忆几秒就消退,留不住多久更强,靠注意力机制,能随时把更早缓存过的内容重新调出来
装的是什么多种模态,图像、声音、计划中的动作几乎全由词构成,大概因为产出词是 Claude 唯一能做的动作
Claude 的内部并不是一堆杂乱的数字,它们自己组织成了一种让人联想到我们自己心智的结构。Anthropic《A global workspace in language models》

Anthropic 强调,这只是一条他们预计会很长的研究线的第一步。J-space 看着像是语言模型里「可及」与「不可及」处理之间那道分界的好候选,但他们并不认为这就是故事的全部。J-lens 无疑是一个不完美的方法,只能近似地捕捉模型「真正的工作空间」,比如它只能识别对应单个词元的概念。而 J-space 到底怎么运作,还有许多谜团:他们不知道是什么机制在决定什么东西能进 J-space,只看到一些线索,说它跟 Claude 的自我意识、某种类似情绪反应的东西、以及元认知的痕迹有关,却还没弄清具体怎么回事。他们说,现在至少有了对付这类问题的方法。

本文为对 Anthropic 研究博客《A global workspace in language models》(anthropic.com/research/global-workspace)的可视化中文解读。完整论文见 transformer-circuits.pub,核心方法有开源实现(github.com/anthropics/jacobian-lens),Neuronpedia 提供了在开源模型上的交互演示(neuronpedia.org/jlens)。Anthropic 另邀请了 Stanislas Dehaene、Lionel Naccache(全局神经元工作空间理论的奠基者)、Eleos AI Research 与 Rethink Priorities 的研究者、以及 Google DeepMind 的 Neel Nanda(附带一次在开源模型上的独立复现)撰写独立评论。文中实验数据与结论均出自 Anthropic 可解释性团队,核心实验本身尚未经第三方复核;柱状图为定性示意,原文未公布具体分数。