Soofi S enfrenta críticas por sobretreinamento após liderar benchmarks abertos
Dias depois de um consórcio alemão lançar o modelo aberto Soofi S, de 30B, críticos argumentaram que ele foi muito sobretreinado pelos padrões das leis de escala de Chinchilla, usando cerca de 27 trilhões de tokens para 30 bilhões de parâmetros, centenas de vezes acima do ponto ideal. Contando apenas os 3,2 bilhões de parâmetros ativos por token, a proporção sobe para a casa dos milhares.
O líder técnico do projeto rejeitou a crítica, argumentando que as leis clássicas de escala de modelos densos não valem para arquiteturas mixture-of-experts. O modelo ativa 3,2 de seus 31,6 bilhões de parâmetros por token e supera o Olmo 3 32B e o Apertus 70B em tarefas de alemão, inglês e programação.
Ver resumo completo de 17 de julho de 2026