Reflection treina modelo Beam de 501B parâmetros com 10.500 GPUs NVIDIA GB300
A Reflection treinou o Beam, um modelo esparso Mixture of Experts (MoE) de pesos abertos com 501 bilhões de parâmetros, ativando apenas 23 bilhões por vez. O treinamento de reforço ocorreu durante quatro semanas em 10.500 GPUs NVIDIA GB300, processando 1,3 bilhão de sandboxes no total. A arquitetura incorporou técnicas como SandwichNorm, gating de atenção e desacoplamento do pipeline entre rollout workers e learner engines.
O que se sabe
- O laboratório de IA Reflection, apoiado pela NVIDIA, desenvolveu o modelo de pesos abertos Beam, com 501 bilhões de parâmetros.1
- O Beam é um modelo esparso Mixture of Experts (MoE) que ativa apenas 23 bilhões de parâmetros a qualquer momento.1
- O aprendizado por reforço do Beam abrangeu 1 milhão de ambientes de programação, agentes e STEM, envolvendo 100 milhões de rollouts.1
- A Reflection alegou que o Beam é de 3 a 4 vezes mais eficiente que o GLM 5.2 e mais de 4 vezes mais eficiente que modelos abertos ocidentais líderes.1
- O Beam utiliza normalização SandwichNorm, gating de atenção e escalonamento residual baseado em profundidade para evitar outliers numéricos e instabilidade.1
- O modelo utiliza acumulação residual em FP32 para evitar o acúmulo de erros de arredondamento causados por operações de menor precisão.1
- O treinamento desacoplou Rollout Workers (que geram tokens continuamente) e Learner Engines (que atualizam pesos continuamente), contornando descompassos de dados com técnicas de estabilização.1
- O desempenho do Beam equivale em grande parte ao do GLM-5.2 consumindo cerca de 3 a 4 vezes menos computação de inferência, embora fique atrás do Qwen 3.8 Max.1
“3-4x more efficient than GLM 5.2 and over 4x more efficient than leading Western open models”Reflection1
Cronologia
- Divulgação dos detalhes técnicos e do uso de 10.500 GPUs NVIDIA GB300 no treinamento do modelo Beam pela Reflection