百倍提升7B模型推理能力 昆仑万维携手新加坡南洋理工大学发布Q*算法

近日,昆仑万维携手新加坡南洋理工大学成功开发了一个名为Q*的算法,能够显著提升现有大模型的推理能力。在GSM8K数据集上,Q*帮助Llama-2-7b提升至80.8%的准确率,超越了ChatGPT;在MATH数据集上,Q*帮助DeepSeek-Math-7b提升至55.4%的准确率,超越了Gemini Ultra;在MBPP数据集上,Q*帮助CodeQwen1.5-7b-Chat提升至77.0%的准确率,缩小了与GPT-4的编程水平差距。

Q*能够帮助小模型达到参数量比其大数十倍、甚至上百倍模型的推理能力,这一算法不仅大幅提升了小模型的性能,还显著降低了计算资源的需求,为人工智能的广泛应用带来了全新可能,开创了高效智能的新纪元。

项目论文《Q*: Improving Multi-step Reasoning for LLMs with Deliberative Planning》已公开发布。

论文链接:https://arxiv.org/abs/2406.14283

百倍提升7B模型推理能力 昆仑万维携手新加坡南洋理工大学发布Q*算法

打破OpenAI封锁 提升现有模型能力

自OpenAI的Q*项目曝光后,引发业内众多讨论。据现有信息汇总,Q*项目被视作OpenAI在探索人工通用智能(Artificial General Intelligence, AGI)道路上的一次重大尝试,有望在包括数学问题解决能力、自主学习和自我改进等多个层面对人工智能技术带来革新性突破。

百倍提升7B模型推理能力 昆仑万维携手新加坡南洋理工大学发布Q*算法

百倍提升7B模型推理能力 昆仑万维携手新加坡南洋理工大学发布Q*算法

(英伟达科学家Jim Fan、图灵奖得主Yann LeCun等参与讨论OpenAI的Q*实现方式)

百倍提升7B模型推理能力 昆仑万维携手新加坡南洋理工大学发布Q*算法

(Meta科学家田渊栋则认为Q*是Q-learning和A*的结合,且天然地适合推理任务,尤其在数学推理方面)

不过迄今为止OpenAI没有公开关于Q*算法的具体细节,其效果究竟如何我们并不得而知。

昆仑万维自Q*项目曝光以来,一直密切关注Q*的动向,且在第一时间就成立研究小组尝试开发自己的Q*算法,希望打破OpenAI的封锁,提升现有开源模型的推理能力。经过数月的尝试,团队提出了一种新颖的Q*框架,并且帮助现有开源模型在GSM8K、MATH和MBPP数据集上,分别超越了ChatGPT和Gemini Ultra。

复杂推理任务全盘规划

在《Q*: Improving Multi-step Reasoning for LLMs with Deliberative Planning》论文中,研究人员首先将大语言模型的推理轨迹分解为若干个状态,对于每一个状态,参考DeepCubeA中的设计,通过将定义Path Cost的g(s_t)函数和定义Accumulated Reward的Q*(s_t, a_t)集成到同一个f(s_t)函数内,实现了对历史状态收益和未来期望收益的综合考虑。最后利用A*搜索算法对状态进行最佳优先搜索,实现了对复杂推理任务的全盘规划,从而提升开源模型在推理任务上的性能。

百倍提升7B模型推理能力 昆仑万维携手新加坡南洋理工大学发布Q*算法

其中g(s_t)表示当前轨迹中的多个历史状态,既{s1,…,s_t},的聚合收益。

百倍提升7B模型推理能力 昆仑万维携手新加坡南洋理工大学发布Q*算法

具体g(s_t)的函数形式可以通过人为定义,例如判断当前代码是否符合语法规则等,或者通过构建Process Reward Model (PRM) 进行监督学习得到;g(s_t)中的聚合方式可以为求和,最大值,最小值等。

百倍提升7B模型推理能力 昆仑万维携手新加坡南洋理工大学发布Q*算法

百倍提升7B模型推理能力 昆仑万维携手新加坡南洋理工大学发布Q*算法

为了获得状态-动作对(s_t, a_t)

的最优Q值以实现规划,研究人员在当前LLM策略生成的数据上通过监督学习的方式训练了一个代理Q值模型

百倍提升7B模型推理能力 昆仑万维携手新加坡南洋理工大学发布Q*算法

。训练过程中的真实标签

百倍提升7B模型推理能力 昆仑万维携手新加坡南洋理工大学发布Q*算法

可以由三种不同的方式得到,包括离线强化学习,蒙塔卡罗采样估计和利用更强大的语言模型补全。

实验结果表明,昆仑万维本次所提出的Q*框架,可以显著地提升LLM的推理能力,在GSM8K数据集上,Q*帮助Llama-2-7b提升至80.8%的准确率,超越了ChatGPT;在MATH数据集上,Q*帮助DeepSeek-Math-7b提升至55.4%的准确率,超越了Gemini Ultra; 在MBPP数据集上,Q*帮助CodeQwen1.5-7b-Chat提升至77.0%的准确率,缩小了与GPT-4的编程水平差距。

百倍提升7B模型推理能力 昆仑万维携手新加坡南洋理工大学发布Q*算法

百倍提升7B模型推理能力 昆仑万维携手新加坡南洋理工大学发布Q*算法

百倍提升7B模型推理能力 昆仑万维携手新加坡南洋理工大学发布Q*算法

研究证明,Q*能够帮助参数量仅为7b的小模型达到参数量比其大数十倍甚至百倍模型的推理能力,大幅提升模型的性能,并显著降低了计算资源的需求。目前,Q*的研究尚在初级阶段,算法在各个环节还有进一步的改进空间。未来,昆仑万维会继续深入此项研究,不断提升国产开源模型推理能力,打破OpenAI闭源封锁,为人工智能前沿技术发展带来全新可能。

本文来自投稿,不代表创造权威IP 赋能创业者——IP百创立场,如若转载,请注明出处:创造权威IP 赋能创业者——IP百创

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
上一篇 2024年6月25日
下一篇 2024年6月25日

相关推荐

  • 说说短视频

    短视频已经无孔不入,目之所及,新闻资讯、社交网络、电商等皆被短视频全面入侵,某个性化新闻资讯平台为了拉动日活,默认为用户打开的“发现”频道全是短视频内容,就连过去最重要的“新闻”版块都靠边站。 去年,另外一家互联网巨头也曾出现过因为对短视频的不同态度而出现分歧,这家巨头负责长视频业务线的CEO曾提到称,“个性化分发太厉害了,你喜欢猪食看到的就全是猪食。” “…

    2022年8月23日
  • 璩静名下文化公司改为健康管理公司

    #璩静公司更名为星光健康管理# 天眼查App显示,近日,深圳市哇咔哇咔文化有限公司发生多项工商变更,企业名称变更为深圳市星光健康管理有限公司,璩静由执行董事、总经理变更为董事、经理,邹少欢退出股东行列,新增莫梦怡为股东,同时公司经营范围新增个人商务服务、远程健康管理服务、健康咨询服务、品牌管理、养生保健服务、企业管理咨询等。 该公司成立于今年4月,法定代表人…

    2024年8月27日
  • 流血、止血、再造血,AI独角兽们何时涅槃?

    配图来自Canva可画 今年,格灵深瞳、云从科技先后成功挂牌上海交易所,给AI行业增添了不少热闹之气。一个自成立以来就带有“明星”光环,一个有“国家队”背景,怎么看这两者均是AI行业中不容小觑的种子选手。 然而,这次理想和现实的转变来得太快。格灵深瞳上市首日股价破发,走势不容乐观;云从因为招股书中明示的烧钱能力而成为了市场质疑的焦点。 但实际上,此类情况已经…

    2022年9月13日
  • 九芝堂换帅完成工商变更

    天眼查App显示,近日,ST九芝完成工商变更,李振国卸任法定代表人、董事长,由孙光远接任,徐向平卸任总经理,由李振国接任,同时多位其他主要人员也发生变更。今年7月,九芝堂曾发布公告称,选举孙光远为新任董事长,李振国为副董事长,并聘任李振国为公司总经理。 九芝堂股份有限公司成立于1999年5月,注册资本约8.56亿人民币,经营范围含药品生产、药品批发、药品零售…

    互联网 2024年8月29日
  • 写在AITO问界重磅OTA升级:软件定义汽车时代真的来了!

    “升级后,我的车就像换了个新车!” 邻居小张在自己的问界M5刚刚经历一次OTA升级后这样感慨。 从7月15日起,AITO问界的问界M5增程版、问界M5纯电版、问界M7陆续收到了这次OTA升级,升级力度很大,覆盖了驾乘体验、智能座舱、人车交互等领域的十余项体验优化。 说实话,OTA升级对于不少智能汽车的车主来说已经算不上新鲜事物,但是在笔者看来,AITO问界这…

    2023年7月18日

发表回复

您的电子邮箱地址不会被公开。 必填项已用*标注

联系我们

邮件:939297903@qq.com

工作时间:周一至周五,9:30-18:30,节假日休息

关注微信