让知识彼此相连
知识图谱
沿着人物与判断,回到原始证据。
1 位人物 · 1 个来源 · 3 条观点
放回语境
Kyle Wiggers
选择一条判断,追溯到它所在的原始对话。
扩专家池,稳吞吐量
等分区块用于阅读定位,不表示排名或权重。
当前 1–3 / 共 3 条判断 · 按来源日期由新到旧
1 / 1
当前判断
扩专家池,稳吞吐量
该文章报告称,将专家池从 8 个增加到 128 个,同时每个 token 仅选择四个专家,使每个 token 的激活参数大致保持在约 32 亿;总参数容量从 46 亿增长到 470 亿,而训练吞吐量下降不到 5%。
这些是个人表达的观点,并非共识度量。原始资料保持其原始语言。
支持这项说法
发布 Olmo-core 3:面向大型 MoE 模型的开放、可扩展训练基础设施
在一项基准测试中,我们将专家池从 8 个增加到 128 个,同时仍为每个 token(即语言模型处理的小段文本单元)仅选择四个专家,使每个 token 的激活参数数量大致保持在约 32 亿。总参数容量从 46 亿增长到 470 亿,而训练吞吐量下降不到 5%。
原始摘录
In one benchmark, we increased the expert pool from 8 to 128 while still selecting only four experts per token – the small units of text a language model processes – keeping the number of active parameters per token roughly fixed at about 3.2B. Total parameter capacity grew from 4.6B to 47B, while training throughput fell by less than 5%.
上下文
Olmo-core 3 正是为了弥合这一差距而构建的。
原始上下文
Olmo-core 3 is built to close that gap.
日期表示来源发表时间,不代表观点发生变化。 缺少审核合格译文的内容保留原文。