1

Alibaba libera Qwen3.8-Flash-Next open-source como prévia da arquitetura Qwen4

A Qwen Team (Alibaba) liberou em 26/08 o Qwen3.8-Flash-Next, e o detalhe mais interessante não é o modelo em si: é que ele estreia a arquitetura do futuro Qwen4, aberta antes da família completa pra comunidade se preparar.

O que chama atenção nos números:

  • MoE multimodal de 125B parâmetros totais, mas só 6B ativos por token — inferência muito mais leve do que o tamanho sugere
  • 51B extras de N-gram embeddings
  • Custo de treinamento estimado em ~1/9 do Qwen3.7-Plus (fonte: TechNode)
  • Pesos liberados sem restrição no Hugging Face desde 24/08, versões padrão e FP8 também no ModelScope
  • API compatível com as specs da OpenAI e da Anthropic — quem já tem stack com Claude ou GPT troca o endpoint e testa

Pra quem roda modelo local, os 6B ativos por token são o ponto: dá pra servir algo dessa classe em hardware bem mais modesto do que um denso de 100B+ exigiria (os GGUF da unsloth já estão no HF).

Escrevi uma análise mais completa em português, com specs, como baixar e comparação com o flash-tier de GPT/Claude/Gemini: https://www.techknow.com.br/post/qwen-3-8-flash-next

Alguém aqui já testou? Curioso principalmente com a qualidade em português vs Qwen 3.6 Plus.

Carregando publicação patrocinada...