Fontes acompanhadas em tempo real
compartilhei. NVIDIA

Reflection treina modelo Beam de 501B parâmetros com 10.500 GPUs NVIDIA GB300

A Reflection treinou o Beam, um modelo esparso Mixture of Experts (MoE) de pesos abertos com 501 bilhões de parâmetros, ativando apenas 23 bilhões por vez. O treinamento de reforço ocorreu durante quatro semanas em 10.500 GPUs NVIDIA GB300, processando 1,3 bilhão de sandboxes no total. A arquitetura incorporou técnicas como SandwichNorm, gating de atenção e desacoplamento do pipeline entre rollout workers e learner engines.

Confirmado Quando: 5 de outubro de 2026 Detectado em 5 de outubro de 2026 1 fonte

Ler a matéria completa →

O que se sabe

  • O laboratório de IA Reflection, apoiado pela NVIDIA, desenvolveu o modelo de pesos abertos Beam, com 501 bilhões de parâmetros.1
  • O Beam é um modelo esparso Mixture of Experts (MoE) que ativa apenas 23 bilhões de parâmetros a qualquer momento.1
  • O aprendizado por reforço do Beam abrangeu 1 milhão de ambientes de programação, agentes e STEM, envolvendo 100 milhões de rollouts.1
  • A Reflection alegou que o Beam é de 3 a 4 vezes mais eficiente que o GLM 5.2 e mais de 4 vezes mais eficiente que modelos abertos ocidentais líderes.1
  • O Beam utiliza normalização SandwichNorm, gating de atenção e escalonamento residual baseado em profundidade para evitar outliers numéricos e instabilidade.1
  • O modelo utiliza acumulação residual em FP32 para evitar o acúmulo de erros de arredondamento causados por operações de menor precisão.1
  • O treinamento desacoplou Rollout Workers (que geram tokens continuamente) e Learner Engines (que atualizam pesos continuamente), contornando descompassos de dados com técnicas de estabilização.1
  • O desempenho do Beam equivale em grande parte ao do GLM-5.2 consumindo cerca de 3 a 4 vezes menos computação de inferência, embora fique atrás do Qwen 3.8 Max.1
“3-4x more efficient than GLM 5.2 and over 4x more efficient than leading Western open models”Reflection1

Cronologia

  1. Divulgação dos detalhes técnicos e do uso de 10.500 GPUs NVIDIA GB300 no treinamento do modelo Beam pela Reflection

Quem está envolvido

B Beammodelo de IA treinado
G GB300GPU de treinamento
N Nvidiaapoiadora
R Reflectiondesenvolvedora

Fontes

  1. 1NVIDIA-Backed Reflection Used 10,500x GB300 GPUs And 46.4 Million Sandboxes Per Day For 4 Weeks To Train Beam, A 501B Open-Weight Model That Is Insanely Efficient wccftech.com · 06 out 2026