云开YUNapp「中国」Kaiyun·官方网站-登录入口

新闻资讯 你的位置:云开YUNapp「中国」Kaiyun·官方网站-登录入口 > 新闻资讯 > 开云提款靠谱官网入口使其能处理更海量的信息-云开YUNapp「中国」Kaiyun·官方网站-登录入口

开云提款靠谱官网入口使其能处理更海量的信息-云开YUNapp「中国」Kaiyun·官方网站-登录入口

发布日期:2026-08-20 21:32    点击次数:136

开云提款靠谱官网入口使其能处理更海量的信息-云开YUNapp「中国」Kaiyun·官方网站-登录入口

机器之心报谈

裁剪:+0,冷猫

资格了前段时刻的多事之秋,扎克伯格的投资似乎终于初见收效。

近期,Meta Superintelligence Labs 连合建议了一个名为 REFRAG 的高效解码框架,旨在处治 LLM 在处理长凹凸文输入时面对的效劳瓶颈,尤其是在 RAG 等应用场景下。

论文标题:REFRAG:Rethinking RAG based Decoding论文地址:https://arxiv.org/abs/2509.01092

为什么长凹凸文处理如斯难题?

在刻下的 AI 应用中,诈欺 LLM 处理包含无数外部常识的长文本输入,是升迁问答、对话和智能体应用能力的枢纽。然则,这一过程也带来了严峻的挑战:在传统 LLM 中,缓慢力机制的计较和内存支拨会跟着输入长度的宽阔(N²)增长。

这意味着文本长度翻一倍,速率可能会慢 4 倍,这会导致显耀的系统延伸,并破费无数内存用于存储 KV Cache,进而指责系统蒙胧量。这使得竖立者不得不在常识丰富度与系统效劳之间作念出祸殃的量度。

Meta 的谈判指出,在 RAG 应用中,LLM 处理的凹凸文中包含了无数从外部常识库检索拼接而成的段落,但其中惟有一小部分与用户查询风雅相干。这些不相干的段落导致了计较资源的奢侈。REFRAG 的中枢想想恰是基于这一不雅察,通过识别并跳过对这些非相干凹凸文的无效计较,来优化解码过程。

REFRAG 是何如处治问题的?

REFRAG 框架通过一个小巧的四步经由,诈欺缓慢力稀少结构,达成了显耀的性能升迁。它与传统 RAG 的枢纽互异在于,它幸免了让 LLM 径直处理冗长的原始文本。

压缩:领先,一个轻量级的编码器会读取检索到的文档,将每 16 个 token 压缩成一个浓缩了语义精华的「块向量」。指责:接下来,主模子不再读取原始的 token,而是径直处理这些块向量。输入序列的长度因此坐窝指责了 16 倍。加快:由于输入变得极短,缓慢力机制的计较支拨大幅指责,同期动作显存破费大头的 KV cache 也变得更小。这恰是其能达成惊东谈主速率升迁的根底原因。遴荐:为了退守在压缩过程中丢失枢纽信息,框架引入了一个基于 RL 的政策充任「质检员」,它能智能地挑出信息密度最高、与任务最相干的枢纽片断,确保它们不被压缩,从而保留中枢信息。

Meta 暗示,该框架的灵验性已在包括 RAG、多轮对话和长文档纲领在内的多种长凹凸文任务中得到考证,取得了冲破性的舍弃:

速率升迁: 将首个 token 生成时刻(TTFT)加快高达 30.8 倍。在 16k tokens 的场景下,比较 CEPE 等基线要领,达成了超过 16 倍的 TTFT 加快。从性能图表可以看出,文本越长,REFRAG 的上风越领悟,其加快效果随凹凸文畛域加多呈指数级升迁,而基线要领仅为线性增长。

凹凸文扩张: 省略将现存 LLM 的灵验凹凸文大小扩张 16 倍,使其能处理更海量的信息。精度不降反升: 在大幅升迁速率和扩张凹凸文的同期,作念到了模子的准确率莫得死亡。更枢纽的是,在 GSM8K 基准测试上,REFRAG 不仅能处理 8 倍更长的凹凸文(80 个 chunk vs 10 个 chunk),运行速率还升迁了一倍,最终得益更是险些翻倍,从 6.71 升迁到 12.08。

简而言之,REFRAG 让「大凹凸文 RAG」从设想造成了执行。

天然其效果听起来额外可以,但挑剔区也暗示,它最终的价值仍需要在更无为的骨子应用场景中进行历练。

还有东谈主对该谈判中的 RL 政策建议了质疑。

要领

为达成编码器与解码器的灵验对都,本谈判解任 Yen et al. (2024) 的使命,接收了一种基于「下一段落展望」任务的合手续预熟练要领。

在熟练中,每个数据点包含臆测 s+o=T 个词元(token)。通过这一预熟练过程,模子省略学习何如诈欺块镶嵌(chunk embeddings)来高效践诺卑鄙任务。

为了进一步升迁模子性能,该要领还引入了通过 RL 达成的遴荐性压缩机制。在完成 CPT 对都后,模子会经过监督微调 ,以相宜具体的卑鄙应用场景,举例 RAG 和多轮对话。

合手续预熟练决策

为确保 CPT 阶段的得胜,谈判者建议了一个包含重建任务和课程学习要领的熟练决策。消融谈判标明,该决策关于达成优异的 CPT 性能至关遑急。

该任务主要达成两个见地:

高效压缩:熟练编码器将 k 个词元压缩成一个块镶嵌,同期最猛进程地保留原始信息。空间映射:熟练投影层灵验地将编码器输出的块镶嵌映射到解码器的词元空间中,使解码器省略「拯救」并准确重建原始信息。

蓄意重建任务的一个特定意图是,饱读吹模子在熟练时更多地依赖其凹凸文牵记(即从输入中获得信息),而非其固有的参数化牵记(即模子自己照旧学到的常识)。一朝通过此任务初步对都了编码器与解码器,便会解冻解码器,负责驱动 CPT。

遴荐性压缩。为了进一步升迁谜底展望的准确性,该要领(REFRAG)引入了遴荐性词元压缩机制。其中枢想想是,关于凹凸文中非凡遑急的信息块,可以不进行压缩,而所以原始情势保留,从而幸免枢纽信息丢失。

一个强化学习政策被用来决定哪些块应当被保留。该政策以下一段落展望的困惑度动作负向奖励信号进行引导(即困惑度越低,奖励越高),从而学习识别并保留枢纽信息。编码器息争码器都经过微调,以相宜这种压缩块与未压缩块搀杂的输入情势。该政策集合诈欺块镶嵌和掩码本领来优化块的扩张规定,既保留了解码器的自追想特质,又达成了压缩位置的无邪安排。

更多本领细节请参看原论文。

#优质图文扶合手谋略#开云提款靠谱官网入口



Powered by 云开YUNapp「中国」Kaiyun·官方网站-登录入口 @2013-2022 RSS地图 HTML地图