让知识彼此相连

知识图谱

沿着人物与判断,回到原始证据。

1 位人物 · 1 个来源 · 3 条观点

放回语境

Kyle Wiggers

选择一条判断,追溯到它所在的原始对话。

扩专家池,稳吞吐量

放回语境Kyle Wiggers3 条观点
2026-10-012026-10-012026-10-01

等分区块用于阅读定位,不表示排名或权重。

当前 1–3 / 共 3 条判断 · 按来源日期由新到旧

1 / 1

当前判断

扩专家池,稳吞吐量

该文章报告称,将专家池从 8 个增加到 128 个,同时每个 token 仅选择四个专家,使每个 token 的激活参数大致保持在约 32 亿;总参数容量从 46 亿增长到 470 亿,而训练吞吐量下降不到 5%。

这些是个人表达的观点,并非共识度量。原始资料保持其原始语言。

支持这项说法

发布 Olmo-core 3:面向大型 MoE 模型的开放、可扩展训练基础设施

在一项基准测试中,我们将专家池从 8 个增加到 128 个,同时仍为每个 token(即语言模型处理的小段文本单元)仅选择四个专家,使每个 token 的激活参数数量大致保持在约 32 亿。总参数容量从 46 亿增长到 470 亿,而训练吞吐量下降不到 5%。

原始摘录
In one benchmark, we increased the expert pool from 8 to 128 while still selecting only four experts per token – the small units of text a language model processes – keeping the number of active parameters per token roughly fixed at about 3.2B. Total parameter capacity grew from 4.6B to 47B, while training throughput fell by less than 5%.
上下文

Olmo-core 3 正是为了弥合这一差距而构建的。

原始上下文

Olmo-core 3 is built to close that gap.

日期表示来源发表时间,不代表观点发生变化。 缺少审核合格译文的内容保留原文。