
SLM
Roteamento SLM→LLM: A Arquitetura que Manda 80% do Tráfego para o Modelo Pequeno
O padrão dominante em produção não é trocar de modelo, é colocar um roteador leve na frente e mandar a maior parte do tráfego para um SLM. A NVIDIA estima que servir um 7B é 10 a 30 vezes mais barato em FLOPs, energia e latência. O que dá certo, o que quebra e como calibrar.









