PENSÉES EN RELATION

Atlas des connaissances

Explorez les personnes, leurs points de vue et les sources originales.

1 personnes · 1 sources · 1 opinions exprimées

EN CONTEXTE

MoE scaling efficiency

Choisissez un point de vue et retrouvez la conversation originale.

Maintaining throughput while scaling expert count

EN CONTEXTEMoE scaling efficiency1 opinions exprimées
2026-10-01

Les secteurs égaux servent de repères, pas de classement.

Points de vue 1–1 sur 1 · Sources les plus récentes en premier

1 / 1

Point de vue sélectionné

Maintaining throughput while scaling expert count

The post reports that increasing the expert pool from 8 to 128 while selecting only four experts per token kept active parameters per token roughly fixed at ~3.2B; total parameter capacity grew from 4.6B to 47B with less than 5% drop in training throughput.

Il s’agit de points de vue individuels, non d’une mesure du consensus. Le matériel source reste dans sa langue d’origine.

Éléments favorables

Introducing Olmo-core 3: Open, scalable training infrastructure for large MoEs

Extrait original

In one benchmark, we increased the expert pool from 8 to 128 while still selecting only four experts per token – the small units of text a language model processes – keeping the number of active parameters per token roughly fixed at about 3.2B. Total parameter capacity grew from 4.6B to 47B, while training throughput fell by less than 5%.
Contexte

Olmo-core 3 is built to close that gap.

Les dates concernent les sources, pas des changements d’opinion. Les textes sans traduction révisée restent dans leur langue originale.