Bendi新闻
>
AlphaGo核心算法增强,7B模型数学能力直逼GPT-4,阿里大模型新研究火了

AlphaGo核心算法增强,7B模型数学能力直逼GPT-4,阿里大模型新研究火了

1月前
鱼羊 发自 凹非寺
量子位 | 公众号 QbitAI

把AlphaGo的核心算法用在大模型上,“高考”成绩直接提升了20多分。

在MATH数据集上,甚至让7B模型得分超过了GPT-4。

一项来自阿里的新研究引发关注:

研究人员用蒙特卡洛树搜索(MCTS)给大语言模型来了把性能增强,无需人工标注解题步骤,也能生成高质量数据,有效提升大模型的数学成绩

论文发布,让不少网友重新关注到了蒙特卡洛树搜索这个在前大模型时代的明星算法。

有人直言:

蒙特卡洛树搜索+LLM是通往超级智能之路。

因为“树搜索本身更接近人类思维”。

用蒙特卡洛树搜索增强大模型

具体来说,阿里的研究人员提出了一种名为AlphaMath的方法,用大语言模型+MCTS来自动生成数学推理数据,并提升大模型在完成数学推理任务时的性能表现。

嗯,名字就很有蒙特卡洛树搜索内味儿了。

这里有个前情提要:

思维链(CoT)、思维程序(PoT)等方法已经被证明能够有效提高大模型的数学能力,但问题在于,它们都需要人类手动喂详细的解题步骤,即训练当中需要用到人工标注的高质量数学推理数据。

AlphaMath的一个核心目的就在于,在这个步骤中去人工化——数据格式就是简单的数学问题-答案对。

AlphaMath的技术路线主要涵盖三个阶段:

首先,研究人员收集了一个数学数据集,其中包含数学问题及其对应的正确答案。

然后,利用预训练的大模型(即策略模型)根据问题生成初始的解题路径,并通过MCTS对解题路径进行探索和改进,搜索更优的解题思路。

在MCTS过程中,同时训练一个价值模型来预测解题路径的质量,引导搜索方向。

最后,第二阶段获得的数据会被用来优化策略模型和价值模型。

这三个阶段会通过迭代优化地方式执行,以实现无需人工标注的自动数据生成和模型数学能力优化。

另外,研究人员还基于价值模型提出了Step-level Beam Search方法,以提高大模型的数学推理效率,平衡推理时的解题质量和运行时间。

简单来说,Step-level Beam Search是将MCTS推理过程做了个简化:

  • 利用价值模型对候选路径进行评估,以更准确地选择高质量的解题路径。

  • 通过逐步扩展和剪枝,在搜索过程中动态调整候选路径集合,提高搜索效率。

  • 搜索过程中考虑了完整的解题路径,而不仅仅是局部的下一步动作,可以得到更全局优化的解题方案。

MATH成绩超GPT-4

为了验证AlphaMath的效果,研究人员设计了这样的实验:

对开源的数学大模型DeepSeekMath-Base-7B,用AlphaMath方法进行训练,并在GSM8K、MATH和Gaokao2023基准上,与GPT-4为代表的闭源模型、Llama2为代表的开源模型,以及专门做过数学SFT的MathCoder等模型进行对比。

结果显示,不依赖于人类(或GPT-4)标注的高质量数据,AlphaMath调教下的7B数学大模型,已经能在MATH上取得63%的分数,超过了GPT-4原版的42.5%和外挂代码解释器版的51.8%。

另外,在执行3轮MCTS并训练策略模型和价值模型的情况下,AlphaMath能让大模型在涵盖小学数学题的GSM8K上提升10多分,在MATH和Gaokao2023上提升20多分。

还可以看到,Step-level Beam Search在MATH数据集上取得了良好的效率和准确率平衡。

论文的共同一作是Guoxin Chen、Mingpeng liao、Chengxi Li和Kai Fan。

通讯作者Kai Fan本硕毕业于北京大学,2017年从杜克大学博士毕业,2018年加入阿里巴巴达摩院。

论文地址:
https://arxiv.org/abs/2405.03553

—  —

点这里👇关注我,记得标星哦~

一键三连「分享」、「点赞」和「在看」

科技前沿进展日日相见 ~ 

微信扫码关注该文公众号作者

来源:量子位

相关新闻

OpenAI爆炸更新:GPT-4免费了!新模型GPT-4o发布,视觉、语音能力大幅增强,速度起飞,API打骨折性能超越 GPT-4 Turbo!「商汤日日新」大升级,国产大模型超市开张了GPT-4单项仅得7.1分,揭露大模型代码能力三大短板,最新基准测试来了中文创意写作能力超GPT-4,「最会写」的中文大模型Weaver来了大模型实时打《街霸》捉对PK,GPT-4居然不敌3.5,新型Benchmark火了刚刚,这个全面超越 GPT-4 的大模型,正式推出了 iOS 应用 | 附下载链接最接近GPT-4的国产大模型诞生了谷歌AI通过图灵测试,大模型医生来了?GPT-4竟诊断出难倒17个医生的怪病最强中文大模型又易主了!击败GPT-4 Turbo,首款AI助手发布英伟达 Nemotron-4 340B 火了!合成数据能否将大模型带入下一个阶段?中国版Sora震撼登场,原生16秒直出超清视频!国产黑马火了,世界模型签约多个大客户国产GPTs来了,基于智谱第4代大模型!模型性能均达GPT-4九成以上文心一言用户达3亿!文心大模型4.0 Turbo发布,支持API,真GPT-4 Turbo国产来了!神秘大模型一夜“征服”所有人,超GPT-4却无人认领?网友:OpenAI 要有大麻烦了GPT-4级模型Grok开源可商用!卷底层大模型的公司危了最强开源大模型Llama 3来了!4000亿参数狙击GPT-4,训练数据达Llama 2七倍大模型自我奖励:Meta让Llama2自己给自己微调,性能超越了GPT-4全网删库跑路!斯坦福团队抄袭中国大模型火了开源大模型火了!(附99个大模型微调模型/数据/工具)!AlphaFold 3不开源,统一生物语言大模型阿里云先开了!会颠勺的国产机器人来了:大模型加持,家务能力满分Meta无限长文本大模型来了:参数仅7B,已开源马斯克大模型Grok1.5来了:推理能力大升级,支持128k上下文阿里大模型员工也自曝了996作息表
logo
联系我们隐私协议©2024 bendi.news
Bendi新闻
Bendi.news刊载任何文章,不代表同意其说法或描述,仅为提供更多信息,也不构成任何建议。文章信息的合法性及真实性由其作者负责,与Bendi.news及其运营公司无关。欢迎投稿,如发现稿件侵权,或作者不愿在本网发表文章,请版权拥有者通知本网处理。