Alibaba libera Qwen3.8-Flash-Next open-source como prévia da arquitetura Qwen4
A Qwen Team (Alibaba) liberou em 26/08 o Qwen3.8-Flash-Next, e o detalhe mais interessante não é o modelo em si: é que ele estreia a arquitetura do futuro Qwen4, aberta antes da família completa pra comunidade se preparar.
O que chama atenção nos números:
- MoE multimodal de 125B parâmetros totais, mas só 6B ativos por token — inferência muito mais leve do que o tamanho sugere
- 51B extras de N-gram embeddings
- Custo de treinamento estimado em ~1/9 do Qwen3.7-Plus (fonte: TechNode)
- Pesos liberados sem restrição no Hugging Face desde 24/08, versões padrão e FP8 também no ModelScope
- API compatível com as specs da OpenAI e da Anthropic — quem já tem stack com Claude ou GPT troca o endpoint e testa
Pra quem roda modelo local, os 6B ativos por token são o ponto: dá pra servir algo dessa classe em hardware bem mais modesto do que um denso de 100B+ exigiria (os GGUF da unsloth já estão no HF).
Escrevi uma análise mais completa em português, com specs, como baixar e comparação com o flash-tier de GPT/Claude/Gemini: https://www.techknow.com.br/post/qwen-3-8-flash-next
Alguém aqui já testou? Curioso principalmente com a qualidade em português vs Qwen 3.6 Plus.