明敏 发自 凹非寺
量子位 | 公众号 QbitAI
没想到,打开AI黑盒这件事,可能还要靠AI自己来实现了。
OpenAI的最新研究来了一波大胆尝试:
让GPT-4去解释GPT-2的行为模式。
结果显示,超过1000个神经元的解释得分在0.8以上——也就是说GPT-4能理解这些神经元。
还有人开始畅想,AI理解AI会快速发展为AI训练AI(已经开始了),然后再过不久就是AI创造新的AI了。
当然这也引发了不少担忧,毕竟GPT-4本身不还是个黑盒嘛。
人类拿着自己不理解的东西,让它解释另一个自己不理解的东西,这个风险emm……
这项研究由OpenAI负责对齐的团队提出。
他们表示,这部分工作是他们对齐研究的第三大支柱的一部分:
我们想要实现自动化对齐。这种想法一个值得思考的方面是,它可能随着AI的发展而扩展更多。随着未来AI模型变得越来越智能,我们也能找到对AI更好的解释。
论文地址:https://openaipublic.blob.core.windows.net/neuron-explainer/paper/index.html
参考链接:[1]https://openai.com/research/language-models-can-explain-neurons-in-language-models[2]https://www.globalvillagespace.com/tech/openais-tool-explains-language-model-behavior/
— 完 —
量子位 QbitAI · 头条号签约
关注我们,第一时间获知前沿科技动态
相关文章
猜你喜欢