TransformerLens

TransformerLens

GPT类模型的机制可解释性研究库

AI官网

应用介绍

想弄清楚大模型内部到底是怎么「想」的,某个注意力头在做什么,普通框架很难深入到每一层的激活。TransformerLens 是一个专门用于 GPT 类语言模型机制可解释性研究的库。

它可以加载几十种开源模型,方便地读取和修改任意层的激活,是可解释性研究的常用工具。

软件功能



激活读取:任意层可见。

钩子干预:修改中间结果。

多模型:几十种开源模型。

研究常用:社区标准工具。

应用截图