应用介绍
想弄清楚大模型内部到底是怎么「想」的,某个注意力头在做什么,普通框架很难深入到每一层的激活。TransformerLens 是一个专门用于 GPT 类语言模型机制可解释性研究的库。
它可以加载几十种开源模型,方便地读取和修改任意层的激活,是可解释性研究的常用工具。
激活读取:任意层可见。
钩子干预:修改中间结果。
多模型:几十种开源模型。
研究常用:社区标准工具。
它可以加载几十种开源模型,方便地读取和修改任意层的激活,是可解释性研究的常用工具。
软件功能
激活读取:任意层可见。
钩子干预:修改中间结果。
多模型:几十种开源模型。
研究常用:社区标准工具。

