O laboratório de inteligência artificial Reflection, apoiado pela NVIDIA, desenvolveu o Beam, um modelo de pesos abertos com 501 bilhões de parâmetros. A arquitetura opera sob o modelo esparso Mixture of Experts (MoE, ou mistura de especialistas), no qual apenas 23 bilhões de parâmetros permanecem ativos simultaneamente durante o processamento.1

O treinamento do sistema desacoplou os Rollout Workers (trabalhadores de execução responsáveis por gerar tokens de maneira contínua) e os Learner Engines (motores de aprendizado focados em atualizar os pesos), empregando técnicas de estabilização para mitigar divergências nos dados. A etapa de aprendizado por reforço cobriu 1 milhão de ambientes voltados a programação, agentes e áreas STEM (ciência, tecnologia, engenharia e matemática), somando 100 milhões de execuções (rollouts).1

Para conter a instabilidade do sistema e evitar discrepâncias numéricas (outliers), o Beam integra a técnica de normalização SandwichNorm, gating de atenção e escalonamento residual guiado por profundidade. O projeto também adota acumulação residual em FP32 (ponto flutuante de precisão simples de 32 bits), o que impede a propagação de erros de arredondamento vindos de cálculos em formatos de menor precisão.1

“3-4x mais eficiente que o GLM 5.2 e mais de 4x mais eficiente que os principais modelos abertos ocidentais” No original, em inglês: “3-4x more efficient than GLM 5.2 and over 4x more efficient than leading Western open models” Reflection1

Em testes práticos, o rendimento geral do Beam equivale ao registrado pelo GLM-5.2 consumindo de 3 a 4 vezes menos computação na inferência. Apesar dessa taxa de processamento reduzida, o modelo permanece posicionado atrás do Qwen 3.8 Max.1