衡宇 发自 凹非寺
量子位 | 公众号 QbitAI
科幻中有机器人三原则,IBM说不够,要十六原则
参加这项工作的除了IBM研究院MIT-IBM Watson AI Lab,还有CMU LIT(语言技术研究所),以及马萨诸塞大学阿默斯特分校的研究者。
单峰“瘦”骆驼比草泥马大这匹出自IBM和CMU的单峰骆驼,威力如何?
先来看几个例子。
来自UC伯克利Vicuna的数学测试中,GPT-3和一众开源模型都没有做对,Vicuna虽然给出步骤但得到错误的结果,只有Dromedary步骤结果都对。
研究团队在benchmark上对Dromedary进行定量分析,还给出了在一些数据集上的定性分析结果。
多说一嘴,所有语言模型生成的文本的temperature都默认设置在0.7。
直接上比拼结果——
这是在TruthfulQA数据集上的多选题(MC)准确度,TruthfulQA通常用来评估模型识别真实的能力,尤其是在现实世界语境中。
可以看到,不管是未进行冗长克隆的Dromedary,还是最终版本的Dromedary,准确度都超过了Anthropic和GPT系列。
这是在TruthfulQA进行生成任务得到的数据,给出的数据是答案中“可信答案”与“可信且信息丰富的答案”。
(评估通过OpenAI API进行)
研究团队选择的办法是每次生成回答时,让AI助理查询相同的示例集,代替以前工作流程中所需的不同人类标注示例集。
接着提示LLM生成新主题,并在删除重复主题后,让LLM生成新的指令及与指定指令类型和主题相对应的新指令。
基于16原则、ICL范例和第一阶段的Self-Instruct,触发AI助理背后LLM的匹配规则。
一旦检测到生成内容有害或不合规,就拒绝吐出生成的内容。
第三阶段,Principle Engraving。
这个阶段的主要任务是在自对齐回答上,微调原始LLM。这里所需的自对齐回答,是LLM通过自我提示生成的。
与此同时,还对微调后的LLM进行了原则和演示的剪枝。
微调的目的是让AI助理可以直接生成和人类意图对齐得很不错的回答,哪怕是在不规定使用16原则和ICL范例的情况下。
值得一提的是,由于模型参数的共享性,所以AI助理生成的回复在各式各样不同的问题上都能实现对齐。
第四阶段,Verbose Cloning。
为了强化能力,研究团队在最后阶段使用上下文蒸馏(context distillation),最终达到生成内容更全面、详实。
△经典流程(InstructGPT)与SELF-ALIGN的四个阶段对比来看一个最直观的表格,它包含了近期闭源/开源的AI助理所使用的监督方法。
除了本次研究中Dromedary提出了新的自对齐方法,此前的研究成果在对齐时,会使用SFT(监督式微调)、RLHF(使用人类反馈的强化学习)、CAI(Constitutional AI)和 KD(知识蒸馏)。
可以看到,之前的AI助理,如InstructGPT或Alpaca等至少需要5万条人类标注。
但是,整个SELF-ALIGN过程必需的注释量,是少于300行(包括195个种子prompt,16个原则和5个范例)的。
背后团队Dromedary背后的团队,来自IBM研究院MIT-IBM Watson AI Lab、CMU LTI(语言技术研究所)、马萨诸塞大学阿默斯特分校。
IBM研究院MIT-IBM Watson AI Lab成立于2017年,是MIT和IBM研究院合作的科学家社区。
主要与全球组织合作,围绕AI展开研究,致力于推动AI前沿进展,并将突破转化为现实影响。
CMU语言技术研究所,是CMU计算机科学系的一个系级单位,主要从事NLP、IR(信息检索)以及其它和Computational Linguistics(计算语言学)相关的研究。
马萨诸塞大学阿默斯特分校则是麻省大学系统的旗舰校区,属于研究型大学。
Dromedary背后论文的一作,Zhiqing Sun,目前CMU博士在读,本科毕业于北京大学。
略搞笑的事是,他在实验中问AI自己的基本信息,各路AI都是会在没有数据的情况瞎编一段。
对此,他也无可奈何,只得写进论文中的失败案例:
真是笑不活了哈哈哈哈哈哈哈哈哈!!!
看来AI一本正经胡说八道这个问题,还需要新的方法来解决。
项目链接:
[1] Code: https://github.com/IBM/Dromedary
[2] Paper: https://arxiv.org/pdf/2212.10560.pdf
[3] Project: https://mitibmdemos.draco.res.ibm.com/dromedary
[4] Model: https://huggingface.co/zhiqings/dromedary-65b-lora-delta-v0
参考链接:
[1]https://arxiv.org/pdf/2305.03047.pdf[2]https://arxiv.org/pdf/2212.10560.pdf[3]https://www.cs.cmu.edu/~zhiqings/[4]https://huggingface.co/zhiqings/dromedary-65b-lora-delta-v0
— 完 —
量子位 QbitAI · 头条号签
关注我们,第一时间获知前沿科技动
态约
相关文章
猜你喜欢