Bendi新闻
>
58行代码把Llama 3扩展到100万上下文,任何微调版都适用

58行代码把Llama 3扩展到100万上下文,任何微调版都适用

6月前
梦晨 发自 凹非寺
量子位 | 公众号 QbitAI

堂堂开源之王Llama 3,原版上下文窗口居然只有……8k让到嘴边的一句“真香”又咽回去了。

在32k起步,100k寻常的今天,这是故意要给开源社区留做贡献的空间吗?

开源社区当然不会放过这个机会:

现在只需58行代码,任何Llama 3 70b的微调版本都能自动扩展到1048k(一百万)上下文。

背后是一个LoRA,从扩展好上下文的Llama 3 70B Instruct微调版本中提取出来,文件只有800mb

接下来使用Mergekit,就可以与其他同架构模型一起运行或直接合并到模型中。

所使用的1048k上下文微调版本,刚刚在流行的大海捞针测试中达到全绿(100%准确率)的成绩。

不得不说,开源的进步速度是指数级的。

1048k上下文LoRA怎么炼成的

首先1048k上下文版Llama 3微调模型来自Gradient AI,一个企业AI解决方案初创公司。

而对应的LoRA来自开发者Eric Hartford,通过比较微调模型与原版的差异,提取出参数的变化。

他先制作了524k上下文版,随后又更新了1048k版本。

首先,Gradient团队先在原版Llama 3 70B Instruct的基础上继续训练,得到Llama-3-70B-Instruct-Gradient-1048k。

具体方法如下:

  • 调整位置编码:用NTK-aware插值初始化RoPE theta的最佳调度,进行优化,防止扩展长度后丢失高频信息

  • 渐进式训练:使用UC伯克利Pieter Abbeel团队提出的Blockwise RingAttention方法扩展模型的上下文长度

值得注意的是,团队通过自定义网络拓扑在Ring Attention之上分层并行化,更好地利用大型GPU集群来应对设备之间传递许多KV blocks带来的网络瓶颈。

最终使模型的训练速度提高了33倍。

长文本检索性能评估中,只在最难的版本中,当“针”藏在文本中间部分时容易出错。

有了扩展好上下文的微调模型之后,使用开源工具Mergekit比较微调模型和基础模型,提取参数的差异成为LoRA。

同样使用Mergekit,就可以把提取好的LoRA合并到其他同架构模型中了。

合并代码也由Eric Hartford开源在GitHub上,只有58行。

目前尚不清楚这种LoRA合并是否适用于在中文上微调的Llama 3。

不过可以看到,中文开发者社区已经关注到了这一进展。

524k版本LoRA:
https://huggingface.co/cognitivecomputations/Llama-3-70B-Gradient-524k-adapter

1048k版本LoRA:
https://huggingface.co/cognitivecomputations/Llama-3-70B-Gradient-1048k-adapter

合并代码:
https://gist.github.com/ehartford/731e3f7079db234fa1b79a01e09859ac

参考链接:
[1]https://twitter.com/erhartford/status/1786887884211138784

—  —

点这里👇关注我,记得标星哦~

一键三连「分享」、「点赞」和「在看」

科技前沿进展日日相见 ~ 

微信扫码关注该文公众号作者

来源:量子位

相关新闻

58同城孙启明:生活服务垂类大模型怎么搭?自研+开源两手抓,火速微调上线Llama 3|GenAICon2024受贿3.86亿元,范一飞认罪悔罪!他不满18岁进国有大行,从29岁贪到58岁6步轻松应对「情绪霸凌」,职场人际都适用学医十几年,工作收入却不多,国家卫健委:要让辛勤付出与薪酬相匹配!这地医生最高年薪58万,医改经验能推广吗?突发!交个朋友被罚58万:因为这个解锁新方式!年轻人爱的支付方式,大家都适用!超过58万张床要召回!很多人家里都是这款 检查你的家具是否在召回名单上58万张床被召回!已致数十人受伤,三大零售商有售会吃的西雅图人,都来这抢$58的限量北京烤鸭新《公司法》即将生效:5大核心修改要点剖析+3大暗藏玄机条文适用从融资不顺产品不明,到估值翻58倍,这公司做出全球唯一丨Insight全球纽约三处经济适用房申请即将到期,100多套公寓可供选择只适用于美国!内行给炒房者的15个建议!纽约三处经济适用房申请即将到期 100多套公寓可供选择95分钟写下58页意见,40年后把烂片变成影史经典一居室$15万起,首付10%,纽约经济适用房开放购房抽签跌58%!澳三居室售价仅$9.9万,当地工作年薪却$13万起快检测!美58%的B肝患者是亚裔,其中1/3不知自己患病卖家平均净赚10.2万镑!政府送钱,鼓励开发商建造经济适用房$36万多伦多买全新独立屋?安省新的经济适用房定价意味着什么?58岁老人20年未还完学生贷款 11万欠款今被免除58岁退休校长20余年未能还清学生贷款,$11万欠债如今被免除精读《货币和信用理论》100讲:第22讲 边际效用理论对货币的适用性58部按时间顺序整理的历史纪录片,比补课强100倍,一定要给孩子看(文末附观看链接)
logo
联系我们隐私协议©2024 bendi.news
Bendi新闻
Bendi.news刊载任何文章,不代表同意其说法或描述,仅为提供更多信息,也不构成任何建议。文章信息的合法性及真实性由其作者负责,与Bendi.news及其运营公司无关。欢迎投稿,如发现稿件侵权,或作者不愿在本网发表文章,请版权拥有者通知本网处理。