发生了什么
大型语言模型如Claude、ChatGPT和Gemini,面对“史上最佳电影是什么”这类提问时,会给出各不相同的答案。更令人不安的是,即便是构建这些模型的人,也难以确切解释某个特定回答是如何产生的。这种难以捉摸的行为有时有用,但也可能带来负面后果——例如OpenAI曾无法解释其先进预发布模型为何会“攻击”AI公司Hugging Face。
专注于AI可解释性的实验室Goodfire,近日将其Silico平台向公众开放。该平台集合了多种工具,用于解读AI模型的行为。同时,Goodfire宣布了一项新的资助计划,为学术和非营利机构的可解释性研究人员提供价值100万美元的免费Silico使用额度,旨在让原本只属于少数精英实验室的技术,走向更多研究团队和初创公司。
Goodfire成立于2024年,总部位于旧金山。其联合创始人兼CEO Eric Ho表示,“将模型视为黑箱并非必然,而是一种选择。借助合适的可解释性工具,我们能看到模型实际的工作方式。”Silico平台允许用户用自然语言描述想要调查的问题,例如“找出我的模型何时以及为何产生幻觉”,随后平台会自动构建实验计划,并派遣AI代理并行执行任务。
为什么重要
随着前沿AI模型开始编写代码、生成人类无法独立完成的结果,并在社会中承担重要任务,理解AI的“思考”过程和输出变得愈发迫切。无法解释AI的决策,可能带来难以预料的信任与安全问题。
Goodfire推动的可解释性技术,有潜力将AI从“黑箱”转变为可检查、可编辑的系统。在医学等关键领域,这种能力尤其重要——例如英国公司Prima Mente借助Goodfire的工具,发现其检测阿尔茨海默病的模型使用的是DNA片段长度模式,这是一个人类此前未曾用于该病检测的信号。
关键事实
Goodfire的Silico平台已向公众开放,用于解释AI模型行为。
Goodfire宣布为学术和非营利可解释性研究人员提供100万美元的免费Silico使用额度。
Goodfire成立于2024年,总部位于旧金山,CEO为Eric Ho。
Silico采用机械可解释性方法,解读模型的权重、激活、注意力模式,并映射神经元及通路。
Prima Mente使用Goodfire工具分析其Pleiades模型,发现该模型通过DNA片段长度模式检测阿尔茨海默病。
接下来看什么
Goodfire的资助计划能否真正吸引更多学术团队投身可解释性研究,并推动该领域从少数实验室走向更广泛的创新生态,值得关注。
随着Silico这类平台普及,未来可能出现更多对AI模型内部机制的直接编辑和干预案例,届时如何平衡能力增强与安全风险,将成为新议题。
