PENSÉES EN RELATION
Atlas des connaissances
Explorez les personnes, leurs points de vue et les sources originales.
1 personnes · 1 sources · 3 opinions exprimées
EN CONTEXTE
Kyle Wiggers
Choisissez un point de vue et retrouvez la conversation originale.
Maintaining throughput while scaling expert count
Les secteurs égaux servent de repères, pas de classement.
Points de vue 1–3 sur 3 · Sources les plus récentes en premier
Point de vue sélectionné
Maintaining throughput while scaling expert count
The post reports that increasing the expert pool from 8 to 128 while selecting only four experts per token kept active parameters per token roughly fixed at ~3.2B; total parameter capacity grew from 4.6B to 47B with less than 5% drop in training throughput.
Il s’agit de points de vue individuels, non d’une mesure du consensus. Le matériel source reste dans sa langue d’origine.
Éléments favorables
Extrait original
In one benchmark, we increased the expert pool from 8 to 128 while still selecting only four experts per token – the small units of text a language model processes – keeping the number of active parameters per token roughly fixed at about 3.2B. Total parameter capacity grew from 4.6B to 47B, while training throughput fell by less than 5%.
Contexte
Olmo-core 3 is built to close that gap.
Les dates concernent les sources, pas des changements d’opinion. Les textes sans traduction révisée restent dans leur langue originale.