国际科技财经移民娱乐民生时事体育

>

最佳开源模型刷新多项SOTA，首次超越Mixtral Instruct！「开源版GPT-4」家族迎来大爆发

最佳开源模型刷新多项SOTA，首次超越Mixtral Instruct！「开源版GPT-4」家族迎来大爆发

1年前

新智元报道

编辑：桃子

【新智元导读】Mixtral 8x7B模型开源后，AI社区再次迎来一大波微调实践。来自Nous Research应用研究小组团队微调出新一代大模型Nous-Hermes 2 Mixtral 8x7B，在主流基准测试中击败了Mixtral Instruct。

Mixtral 8x7B开源模型的诞生，正如Llama一样，为开源社区了带来曙光。

前段时间，Mixtral刚刚发布了8x7B模型的论文。在基准测试结果中，其性能达到或超过 Llama 2-70B和GPT-3.5。

甚至，Mixtral在数学、代码生成和多语言理解任务方面表现亮眼。

最近，一个开源研究小组Nous Research推出了新一代旗舰大模型Nous-Hermes 2 Mixtral 8x7B。

这是首个通过RLHF训练的模型，并在主流基准测试中超越Mixtral Instruct，成为最佳开源模型。

此外，Nous Research团队发布的SFT和SFT+DPO模型，以及DPO适配器将为用户提供更多选择。

在所有的基准测试中，Nous-Hermes 2 Mixtral 8x7B模型也略不逊色。

目前，这些模型同样在Hugging Face上开源上线。

最佳开源模型诞生

据介绍，最新模型是在Mixtral 8x7B MoeLLM微调训练而来。

具体来说，Nous-Hermes 2 Mixtral 8x7B是在1,000,000个条目进行了训练（主要是GPT-4生成的数据），以及整个AI领域开放数据集等其他高质量数据集。

研究人员同时还发布了SFT Only版本，以及SFT+DPO版本。

模型演示

那么，Nous Research团队最新的模型能力有多强？

编写可视化数据代码完全是小菜一碟。

它还能写赛博朋克的迷幻诗。

可以执行反向翻译，从输入文本中创建提示信息。

基准测试

与Mixtral基础模型相比，Mixtral 8x7B上的Nous-Hermes 2在以下基准测试中取得了全面提升，也是MistralAI首次击败旗舰型号Mixtral Finetune。

在GPT4All中，Nous-Hermes Mixtral 8x7B（SFT+DPO）拿下了75.7分，位列榜单第三。

在AGIEval的排行中，Nous-Hermes Mixtral 8x7B（SFT+DPO）拿下了46.05的成绩。

此外，在BigBench Reasoning Test中，Nous-Hermes 2 Mixtral 8x7B（SFT+DPO）霸榜第一。

背后团队

成立于2023年，Nous Research是一个在大模型领域发布开源研究而闻名的私人应用研究小组。

去年12月，这个研究团队成员曾发布了一款轻量的视觉语言模型——Nous Hermes 2 Vision。

这个模型以希腊神使赫尔墨斯的名字命名。它通过用户上传的图像数据，通过自然语言提供详细的答案。

就在前几天，Nous Research宣布了一轮520万美元的种子融资，涉及了多位天使投资人。

到目前为止，Nous Research已经发布了40多个开源模型，包括Hermes、YaRN、Capybara、Puffin和Obsidian系等系列。

Mixtral模型，会将成为开源版GPT-4

继2023年年初Llama发布之后，一系列羊驼家族瞬间爆发。年底，Mixtral的开源MoE发布，更是为开源年做了一个完美的收尾。

有网友表示，Mixtral或将有实力将于今年接管GPT-4。

在Chatbot Arena排行榜上，Mixtral成为（继GPT-4、Claude和Mistral Medium之后）唯一能打的开源模型，也是仅有7B参数的最小模型，甚至比谷歌的Gemini Pro还要好！

而且它是开源的！任何人可以获取该模型，并将其部署到自己的设备，而且可以对其进行微调，可以随心所欲地使用它。

现在，在Mixtral-7B上进行微调、部署的模型案例，也是非常的多。

比如，有网友用树莓派在本地跑起了Phi-2、Mistral和LLaVA等模型。

还有人出了一款APP，名为Offline Chat：Private AI，能够在iPhone上离线跑Mistral 7B模型。

这样一来，模型生成的内容，可以保障安全和隐私。

还有人用直接偏好微调了Mistral-7B模型。

具体来说，研究人员将使用一种类似RLHF的技术：直接偏好优化(DPO)对OpenHermes-2.5进行微调，从而创建NeuralHermes-2.5。

为此，他们还引入了一个偏好数据集，描述DPO算法的工作原理，并将其应用到模型中。我们将看到它显著提高了OpenLLM排行榜上基本模型的性能。

有网友进行的海底捞针实验中， Mistral-7B-Instruct-v0.2在80000 token情况下，召回率下降。

相信未来，Mixtral模型会向羊驼家族一样，迎来大爆发。

参考资料：

https://twitter.com/NousResearch/status/1746988416779309143

微信扫码关注该文公众号作者

来源：新智元

相关新闻

“苦日子要熬过去了！”美团大涨5%！阿里大涨4%！腾讯大涨3%！港股率先启动，能否迎来大爆发？ACL 2024最佳论文开奖，多模态大模型爆火出圈！百年来首次！纽约4月将迎来罕见奇观，最佳观测点在这里首次敲开“国家队”大门，这一医疗赛道已到爆发前夜？大模型中文微调最佳神器！「弱智吧」吊打小红书、知乎、豆瓣...昨晚，悉尼迎来盛大游行，现场却爆发大骚乱，多人被捕！州长现身Mardi Gras！支持巴勒斯坦人士这样说 CVPR最佳论文颁给自动驾驶大模型！LLM能突破行业技术“天花板”吗？一年斩获三轮融资！要打造AI最佳载体，雷鸟将推AR版“GPT Store”加拿大多省疫情爆发！安省“重灾区”，已12例确诊！严重致死，“罪魁祸首”大面积召回！罕见极光大爆发！新西兰大范围可见，包括奥克兰！全网都在“追光”！20年来首次！大模型“价格战”爆发，谁能抢占商业化制高点？巴黎突发！极右翼政党得票率领跑，街头爆发抗议！法国股市开盘大涨超2%！马克龙呼吁……奇瑞迎来自己的「爆发期」现实版“釜山行”！国外爆发“僵尸”病毒！7旬老人疑似感染、竟出现攻击性！特大地磁暴来袭！澳洲将迎来这个大爆发，就在这两天！20年一遇！夏季是消灭腋臭的最佳时机！快来以“毒”攻“毒”热浪袭击美国「高温+风暴+山火」齐爆发！多地宣布进入紧急状态！大家做好准备开年最佳，这部“神仙阵容”的电影值得吗？突发！悉尼城铁遭大批黑衣人闯入！蒙面还带盾牌！数十名警员赶到紧急疏散乘客！悉尼爆发“入侵日”大游行，抗议者要求废除“澳洲日”扎心！多伦多被“全球最佳城市排名”踢出榜单，加拿大其他城市也无一上榜！车规级存储芯片需求大爆发！本土玩家突围「掘金」增存量市场大爆发！国产通信中间件「反攻」OpenAI秘密武器「草莓」计划曝光！Q*推理能力大爆发，逼近AGI L2里程碑突发！澳洲宣告“沦陷”？致命病毒大爆发，此前全澳无一人感染！美国已禁止进口这类澳洲商品…