PENSÉES EN RELATION
Atlas des connaissances
Explorez les personnes, leurs points de vue et les sources originales.
1 personnes · 1 sources · 1 opinions exprimées
EN CONTEXTE
training infrastructure performance
Choisissez un point de vue et retrouvez la conversation originale.
2.7× throughput gain with DDP-based MoE stack
Les secteurs égaux servent de repères, pas de classement.
Points de vue 1–1 sur 1 · Sources les plus récentes en premier
Point de vue sélectionné
2.7× throughput gain with DDP-based MoE stack
The post reports that on eight NVIDIA B300 GPUs, Olmo-core 3’s new distributed data parallelism (DDP)-based MoE training stack achieved 52,000 tokens/sec/GPU versus 19,400 tokens/sec/GPU with the prior FSDP-based implementation — a ~2.7× throughput improvement.
Il s’agit de points de vue individuels, non d’une mesure du consensus. Le matériel source reste dans sa langue d’origine.
Éléments favorables
Extrait original
In a preliminary test on eight NVIDIA B300 GPUs, a 47-billion-parameter MoE processed 52,000 tokens per second per GPU with the new stack, compared with 19,400 using our earlier implementation—about 2.7× the throughput.
Contexte
NVIDIA’s Megatron-Core is an established option for training large MoEs. Olmo-core 3 brings an integrated MoE training stack to the framework behind Olmo, with a redesign that improves throughput over our earlier FSDP-based implementation.
Les dates concernent les sources, pas des changements d’opinion. Les textes sans traduction révisée restent dans leur langue originale.