
Qwen3.8-Max Chegou: 2.4T de Parâmetros, 1M de Contexto, e os Pesos Ainda Não Saíram
$1.4728. Foi isso que custaram 40 chamadas de API ao vivo com o Qwen3.8-Max e seus dois predecessores em 2026-08-04, um dia depois de a Alibaba lançá-lo. A surpresa não foram os 2.4 trilhões de parâmetros. Foi isto: o 3.8-Max cobra 35.6% mais por token que o Qwen3.7-Max e, ainda assim, saiu cerca de 4x mais barato por resposta, porque parou de pensar demais. Mais uma coisa que boa parte da cobertura do lançamento está errando: não é open source. Não hoje.
Este post foi publicado originalmente em 2026-07-19, quando o Qwen3.8 era uma prévia sem especificações publicadas. Foi reescrito em 2026-08-04 com base no lançamento GA e nos nossos próprios testes de API.
Principais Conclusões
- Em 2026-08-04, o Qwen3.8-Max está disponível apenas via API. A Alibaba prometeu os pesos para "a próxima semana", ou seja, a semana de 2026-08-10, no Hugging Face e no ModelScope.
- Medimos $0.001592 por chamada curta contra $0.006428 no Qwen3.7-Max, apesar de um preço por token mais alto.
- As cinco pontuações de benchmark da Alibaba são reportadas pelo próprio fornecedor. Não encontramos nenhuma avaliação independente publicada até 2026-08-04.
- Entrada de imagem e vídeo é real e nova. Verificamos ambas contra a API e contra a recusa do 3.7-Max.
O Que Mudou Entre a Prévia e o GA
O Qwen3.8-Max ficou geralmente disponível em 2026-08-03, e o lançamento respondeu a todas as perguntas em aberto que esta página listava há duas semanas. A era de prévia nos deu uma contagem de parâmetros e uma promessa. O lançamento GA trouxe uma janela de contexto confirmada de 1M tokens, entrada de texto mais imagem mais vídeo, cinco pontuações de benchmark publicadas e um preço por token.
Aqui está a antiga lista de incógnitas, resolvida:
| O que esta página dizia em 2026-07-19 | Status em 2026-08-04 |
|---|---|
| Qualquer pontuação de benchmark publicada: nenhuma | Cinco pontuações reportadas pela Alibaba publicadas |
| Parâmetros ativos / configuração MoE: não divulgado | Amplamente reportado como ~95B ativos, MoE esparso. Reportagens conflitantes, veja abaixo |
| Janela de contexto e saída máxima: não anunciado | 1M de entrada, 131,072 de saída, confirmado pela API ao vivo |
| Modalidade: não anunciado | texto + imagem + vídeo na entrada, texto na saída. Verificamos isso nós mesmos |
| Preço por token: não detalhado | $2.00 / M entrada, $6.00 / M saída |
| Data de lançamento dos pesos abertos: "em breve", sem data | "Próxima semana", Hugging Face e ModelScope nomeados |
| Qwen3.8-Max-Preview está disponível agora | A prévia acabou. O GA foi lançado |
Um item não se resolveu. A divisão de parâmetros continua contestada. A matéria de lançamento do MarkTechPost afirma claramente que a contagem de parâmetros ativos não foi divulgada pela Alibaba, enquanto SiliconANGLE, The Decoder e Coursiv publicam todos ~95 bilhões ativos. Relemos o artigo do MarkTechPost em 2026-08-04 e ele ainda diz não divulgado. A fonte de alguém está errada, e o correto a dizer é que a cobertura sobre esse número específico entrou em conflito no dia do lançamento.
Não conseguimos verificar de nenhuma das duas formas. A resposta do /models da OpenRouter não expõe nenhum campo de contagem de parâmetros, então nada em nossos testes confirma ou refuta os 2.4T totais ou os 95B ativos.
O Qwen3.8-Max é Open Source? Não em 4 de Agosto
Não. Em 2026-08-04, o Qwen3.8-Max está disponível apenas via API. A Alibaba agendou o lançamento dos pesos para "a próxima semana" no Hugging Face e no ModelScope, e não anunciou nenhuma licença. A cobertura continua confundindo "disponível" com "aberto", e essa distinção é toda a história. Não há pesos para baixar hoje, não importa o que diga uma manchete.
Três estados estão sendo misturados em uma única palavra. Eles não são a mesma coisa:
| Estado | Qwen3.8-Max em 2026-08-04 |
|---|---|
| Disponível via API | Sim. Alibaba Cloud Model Studio, além de revendedores e roteadores |
| Pesos para download | Não. Prometido para "a próxima semana", sem data definida |
| Termos de licença | Não anunciado. Não existe texto para ler |
Verificamos a evidência mais concreta disponível em vez de confiar na palavra de alguém: uma busca no Hugging Face por Qwen3.8 em 2026-08-04 não retorna nenhum model card da Alibaba. O que retorna são quatro uploads de comunidade chamados Qwen3.8_4B_Distilled e variantes, que são destilações de terceiros, não o modelo principal. Se você estiver navegando rápido por essa página, é fácil confundi-los com o lançamento real.
Uma nota sobre a licença, porque precedente continua sendo relatado como compromisso. O Qwen 3.5 e o Qwen 3.6 foram lançados sob Apache 2.0. Uma licença comunitária restritiva em um modelo de 2.4T ainda seria tecnicamente "pesos abertos", mas mudaria o que você pode construir com eles. Até existir o texto da licença, qualquer um que lhe disser o que você pode fazer com esses pesos está apenas chutando. É também por isso que o Qwen3.8-Max não está no nosso levantamento dos melhores LLMs open source para rodar em 2026: ele ainda não se qualifica.
O Que Medimos: 4x Mais Barato por Chamada Apesar de um Aumento de 35.6% no Preço
Fizemos 40 chamadas cobradas contra qwen3.8-max, qwen3.7-max e qwen3-max via OpenRouter em 2026-08-04, gasto total de $1.4728. Cada custo abaixo foi calculado a partir do objeto usage retornado e conferido cruzadamente com o valor faturado pela própria OpenRouter. Todos bateram. O resultado principal vai na direção oposta à mudança de preço.
Comece pelo preço. O preço ao vivo do GET /models em 2026-08-04 coloca o 3.8-Max em $2.00 de entrada / $6.00 de saída por milhão de tokens, contra o 3.7-Max em $1.475 / $4.425. Isso é um aumento de 35.6% nos dois lados, e a proporção é idêntica de qualquer forma (2.000/1.475 = 6.000/4.425 = 1.3559). Você pode conferir os valores atuais na página do modelo na OpenRouter.
Agora o mesmo prompt trivial enviado aos três modelos, três execuções cada, temperature: 0, em streaming:
| Modelo | Primeiro token (3 execuções) | Primeiro conteúdo visível | Tempo total (3 execuções) | Tokens de conclusão | dos quais de raciocínio | Custo médio por chamada |
|---|---|---|---|---|---|---|
| qwen3.8-max | 2.249s / 0.874s / 1.054s | 5.414s / 5.058s / 4.209s | 6.338s / 6.734s / 5.130s | 242 / 287 / 243 | 156 / 194 / 157 | $0.001592 |
| qwen3.7-max | 4.871s / 1.157s / 1.670s | nunca / 22.358s / 25.998s | 31.147s / 24.013s / 27.661s | 1502 / 1281 / 1443 | 1500 / 1174 / 1346 | $0.006428 |
| qwen3-max | 2.617s / 2.892s / 2.386s | 2.617s / 2.892s / 2.386s | 4.401s / 4.601s / 4.081s | 105 / 105 / 107 | 0 / 0 / 0 | $0.000431 |
Duas colunas separadas de primeiro token são necessárias porque os dois modelos de raciocínio transmitem raciocínio oculto antes de qualquer texto de resposta. No 3.8-Max, um token chega em menos de um segundo em duas das três execuções, mas a primeira palavra que um usuário consegue realmente ler chega de quatro a cinco segundos depois. Na execução 1 do 3.7-Max, ela nunca chegou. Se você constrói uma interface de streaming sobre um modelo de raciocínio, o indicador de carregamento continua girando bem depois de a conexão provar que está viva.
Leia a coluna de raciocínio duas vezes. Em um prompt pedindo uma explicação de três frases sobre um filtro de Bloom, o 3.7-Max gastou entre 1,174 e 1,500 tokens de raciocínio. O 3.8-Max gastou entre 156 e 194. Isso é aproximadamente 7x menos pensamento para a mesma resposta, e tokens de raciocínio são cobrados na taxa de saída. O resultado: o 3.8-Max sai cerca de 4x mais barato por chamada e é de 4 a 5 vezes mais rápido em tempo total a partir da nossa máquina, incluindo o round-trip de rede, enquanto custa 35.6% mais por token. O preço de tabela subiu e a conta caiu.
Isso se inverte à medida que os prompts crescem. Modelado a partir do preço ao vivo, e não medido, uma chamada de 30,000 tokens com 500 tokens de saída custa $63.00 por mil chamadas no 3.8-Max, contra $46.46 no 3.7-Max. Em 100,000 tokens de entrada, são $203.00 contra $149.71. Quando a maior parte dos seus tokens é de entrada, a vantagem de eficiência de raciocínio deixa de compensar o aumento de preço, e o 3.8-Max se torna o mais caro dos três. Qual modelo é mais barato depende genuinamente da sua proporção entrada/saída, que é exatamente a lição que nossa comparação de preços de APIs de LLM continua reforçando.
O reasoning_effort é Novo, e o 3.7-Max o Ignora Silenciosamente
reasoning_effort aparece entre os parâmetros suportados do 3.8-Max e não nos do 3.7-Max. No 3.8-Max, ele move a agulha de forma modesta: em três execuções cada, minimal produziu 67, 108 e 124 tokens de raciocínio contra high em 163, 136 e 173. Medianas de 108 contra 163, no mesmo prompt, na temperatura 0.
O achado que custa dinheiro está no modelo mais antigo. Enviar reasoning_effort: "low" para o 3.7-Max é aceito em vez de rejeitado, e depois ignorado: essa chamada ainda queimou 1,401 tokens de raciocínio, cobrando os mesmos $0.006689 da chamada de formato idêntico que registramos. Sem erro, sem aviso, sem efeito. Se você está ajustando custo reduzindo o esforço de raciocínio, verifique se isso está realmente fazendo alguma coisa no modelo que você está chamando de fato, porque um parâmetro não suportado aqui falha silenciosamente em vez de gritar.
A Armadilha da Resposta Vazia Que Você Deveria Checar Antes de Migrar
Nossa primeira execução de teste usou max_tokens: 400 e travou nosso próprio script. O motivo acabou valendo mais do que o teste em si. O Qwen3.7-Max pode gastar todo o seu orçamento de tokens em raciocínio e retornar uma string vazia, com finish_reason: "length", cobrada integralmente.
Isso aconteceu com a gente três vezes separadas. Em max_tokens: 400: 402 tokens de conclusão, 400 deles de raciocínio, zero caracteres de resposta, $0.001822 cobrados. Em max_tokens: 1500: 1,502 tokens, 1,500 de raciocínio, zero caracteres, $0.006689 por nada. E mais uma vez em uma chamada posterior, $0.006735. Sem erro, sem exceção, apenas um objeto de resposta com aparência fluente e uma string de conteúdo vazia.
Se você está migrando uma integração existente com o 3.7-Max e seu código define um max_tokens modesto, reserve tempo para testar esse caminho. O raciocínio muito mais curto do 3.8-Max o torna significativamente menos exposto a isso. Mas ele não é imune.
Um Pequeno Overhead de Tokens Que Ninguém Menciona
O mesmo prompt de 12 palavras contou 67 tokens de prompt no 3.8-Max e 29 no 3.7-Max, de forma consistente em todas as execuções (27 no qwen3-max). Isso é aproximadamente 38 tokens de overhead fixo, presumivelmente um template de sistema ou de chat maior. Em uma chamada RAG de 100,000 tokens, isso arredonda para nada. Em um classificador de alto volume disparando prompts curtos, isso mais do que dobra sua conta de entrada antes mesmo de você escrever uma palavra.
O Qwen3.8-Max Realmente Aceita Imagens e Vídeo?
Sim, e a entrada multimodal é genuinamente nova nesta geração, não uma simples remarcação. A API reporta text+image+video->text para o 3.8-Max e apenas texto para o 3.7-Max. Verificamos a diferença enviando a mesma imagem para ambos, e o modelo mais antigo a rejeitou na camada de roteamento.
Geramos a imagem de teste localmente com um codificador PNG escrito à mão, para que a verdade fundamental fosse conhecida por construção: 750x270 pixels, dígitos em bloco pretos 4739 em fundo branco, com uma barra horizontal vermelha no topo. Enviada em base64, o qwen3.8-max retornou DIGITS: 4739 e TOPBAR: red. Correto nos dois casos, 6.99s, $0.002146. A mesma requisição para o qwen3.7-max voltou como HTTP 404 {"error":{"message":"No endpoints found that support image input"}} (nenhum endpoint encontrado que suporte entrada de imagem).
Vídeo também funciona, com uma ressalva que quase reportamos como falha. Duas das três URLs públicas de MP4 que testamos retornaram HTTP 400 "Failed to download multimodal content" (falha ao baixar conteúdo multimodal). Isso é a Alibaba falhando ao buscar o arquivo, não a rota recusando vídeo. Com uma URL que ela conseguiu buscar, o 3.8-Max descreveu um clipe do Big Buck Bunny com precisão, incluindo o nome do personagem, em 24.24s por $0.006528.
Duas notas práticas antes de você construir em cima disso. O vídeo foi cobrado como 696 tokens de prompt comuns para um clipe de cerca de 10 segundos, e usage.prompt_tokens_details.video_tokens reportou 0, então você não consegue separar o custo de vídeo desse campo. E uma parte de conteúdo malformada falha silenciosamente: enviar {"type": "video", "video": [url]} em vez de video_url retornou HTTP 200 com o modelo dizendo educadamente que não conseguia ver nenhum vídeo, mais a cobrança. Use video_url.
Vale saber: quando pedimos ao 3.8-Max para descrever suas próprias capacidades, ele respondeu Input modalities: text. Isso está errado, como o próximo teste em nossa própria execução demonstrou. A autodescrição de um modelo é uma saída de linguagem, não uma ficha técnica.
Quão Bem a Janela de Contexto de 1M Tokens Se Sustenta?
Plantamos três fatos únicos em profundidades de 10%, 50% e 90% em um preenchimento gerado e pedimos os três em uma única chamada. 18 de 18 agulhas voltaram corretas em seis execuções em dois modelos, em tamanhos de prompt de 5,723 até 247,911 tokens, avaliadas por correspondência exata de substring no código, e não por leitura das respostas.
Nossas execuções do qwen3.8-max (as duas execuções do qwen3.7-max em 83,380 e 247,873 tokens, e uma execução do qwen3-max em 78,255, também retornaram todas as agulhas):
| Tokens de prompt (qwen3.8-max) | Latência | Custo | Agulhas encontradas |
|---|---|---|---|
| 5,723 | 9.24s | $0.01409 | 3 de 3 |
| 25,703 | 13.43s | $0.05453 | 3 de 3 |
| 83,418 | 17.63s | $0.16965 | 3 de 3 |
| 247,911 | 38.54s | $0.49828 | 3 de 3 |
A latência escala sublinearmente, que é a parte praticamente útil: 43x mais tokens de entrada custam apenas 4.2x mais tempo total.
Agora os limites honestos, porque esse é o lado mais fácil da avaliação de contexto longo. Recuperar um fato plantado literalmente diz muito pouco sobre raciocínio em um documento grande, e testamos cada tamanho apenas uma vez. Não fizemos uma chamada de 1M tokens. A $2.00 por milhão de tokens de entrada, uma teria custado cerca de $2.00, mais do que toda essa rodada de testes, e uma única amostra não nos diria muita coisa. O teto anunciado de 1M é, portanto, não verificado por nós. E o 3.7-Max igualou exatamente o 3.8-Max nos dois tamanhos que comparamos, então recuperação de contexto longo não é onde esta geração se diferencia.
Uma armadilha de preços apareceu aqui que a cobertura de lançamento ignora completamente. O qwen3-max carrega sobretaxas de preço escalonadas que dobram sua taxa acima de 32,000 tokens de prompt e a elevam novamente acima de 128,000, enquanto o 3.8-Max e o 3.7-Max têm taxa fixa em qualquer tamanho. Confirmamos o escalão a partir da cobrança real: nossa chamada de 78,255 tokens para o qwen3-max foi cobrada $0.12227, a taxa de $1.56/M, não o valor anunciado de $0.78/M. Nesse comprimento, custa quase exatamente o mesmo que o 3.7-Max custa ($0.12523). Seu preço anunciado é menos da metade. Seu preço real a 80 mil tokens é uma diferença de arredondamento.
As Cinco Pontuações de Benchmark da Alibaba, e Por Que Nenhuma Delas Está Verificada
A Alibaba publicou cinco pontuações de benchmark com o lançamento GA. Todas elas vêm das execuções internas da própria Alibaba, e não encontramos nenhuma avaliação independente publicada até 2026-08-04. Essa frase merece ficar ao lado dos números, e não três parágrafos abaixo deles.
| Benchmark | Pontuação reportada pela Alibaba | Verificado por terceiros? |
|---|---|---|
| Terminal-Bench 2.1 | 86.6 | Não, até 2026-08-04 |
| GPQA Diamond | 92.6 | Não, até 2026-08-04 |
| PaperBench | 93.0 | Não, até 2026-08-04 |
| OSWorld-Verified | 86.1 | Não, até 2026-08-04 |
| DeepSWE 1.1 | 56.6 (predecessor: 21.6) | Não, até 2026-08-04 |
A Alibaba também reportou um agregado interno de 0.725, subindo de 0.474, e posicionou o modelo como próximo ou acima do Claude Opus 4.8, do Fable 5 e do GPT-5.6 Sol. Colocações em arena também circularam: 5º na Text Arena e 2º na Vision Arena conforme o próprio anúncio da Alibaba de 2026-08-03, que não reconfirmamos no leaderboard ao vivo. Os rankings de arena mudam diariamente. Trate qualquer ranking que você leia nesta semana como um retrato com uma data anexada.
O que ninguém mediu ainda, nós incluídos: throughput sob concorrência, desempenho em idiomas além do inglês, avaliações de segurança e alinhamento, e confiabilidade de chamadas de ferramentas. Nossos próprios números cobrem latência, custo, modalidade e recuperação de contexto longo em uma única rota, e nada mais. A reportagem de lançamento da Bloomberg repetiu as alegações de benchmark sem testes independentes, que é onde praticamente toda a cobertura está agora.
Para números que já foram checados, nossa comparação Qwen vs DeepSeek vs GLM é a referência melhor, e o Kimi K3, com aproximadamente 2.8T, é o rival de tamanho contra o qual todo mundo o compara em benchmarks.
Qwen3.8 vs Qwen3-8B, e a Reviravolta de Pesos Abertos por Trás Deste Lançamento
O Qwen3.8 é o modelo principal da Alibaba, com 2.4 trilhões de parâmetros. O Qwen3-8B é um modelo denso de 8 bilhões de parâmetros da série Qwen3, disponível para download desde 2025. Nomes parecidos, cerca de 300x de diferença em tamanho. Buscadores ainda confundem os dois, e um número surpreendente de respostas em fóruns também.
O problema de nomenclatura piorou nesta semana, não melhorou. As únicas coisas no Hugging Face carregando o nome "Qwen3.8" agora são destilações de comunidade de 4B. Se você for procurar pesos e pegar uma dessas, estará baixando algo sem nenhuma relação com o modelo de 2.4T.
Dois Modelos Principais Fechados, e Agora Isto
A promessa de pesos abertos é a verdadeira notícia aqui, e ela se lê de forma diferente quando você vê o histórico da família. A Alibaba passou duas gerações mantendo uma divisão deliberada: modelos de trabalho de pesos abertos para todo mundo, modelo principal fechado no topo.
| Geração | Pesos | Notas |
|---|---|---|
| Qwen 3.5 (0.8B a 397B-A17B) | Aberto, Apache 2.0 | Família completa lançada publicamente |
| Qwen 3.6 (27B denso, 35B-A3B MoE) | Aberto, Apache 2.0 | O mesmo padrão se manteve |
| Qwen3.7-Max | Fechado | Apenas API. Sem GGUF, sem checkpoint no Hugging Face |
| Qwen3.8-Max | Prometido aberto, ainda não lançado | "Próxima semana" a partir de 2026-08-03. Licença não anunciada |
A Alibaba manteve o nível principal fechado por duas gerações seguidas e agora diz que vai abrir o maior modelo que já construiu. Se os pesos chegarem como prometido, isso é uma verdadeira reviravolta e pressiona todo laboratório que trata "o topo da fronteira permanece fechado" como algo consolidado. Se atrasarem, este se torna o terceiro lançamento Max fechado seguido. Os dois desfechos ainda estão em aberto em 2026-08-04. Vimos a mesma dinâmica se repetir com o GLM 5.2, onde a licença efetivamente lançada importou mais do que o anúncio.
Você Consegue Rodar o Qwen3.8-Max Você Mesmo? (Ainda Não)
Não, e as especificações do GA deixam isso mais claro, não menos. Com 2.4 trilhões de parâmetros totais, este não é um modelo que você hospeda no seu próprio hardware, nem mesmo depois que os pesos forem liberados. O DeepSeek-V3.2, com 685B, já é descrito por quem já fez isso como um projeto de infraestrutura sério. Este é várias vezes maior que isso.
Então o que um modelo de 2.4T de pesos abertos realmente traz de vantagem?
- Provedores de inferência podem hospedá-lo, o que significa competição de preços, o que significa que o seu custo por token cai
- Implantações soberanas, regulamentadas e air-gapped se tornam possíveis nesse nível pela primeira vez
- Pesquisadores e quem faz fine-tuning ganham um modelo-base de escala de fronteira para trabalhar
- Isso não significa que ele roda na sua máquina, na sua única A100, ou no orçamento de GPU da sua startup
Se você quer a matemática do que rodar grandes modelos de pesos abertos realmente exige, nosso guia de requisitos de VRAM para LLMs faz essa conta direito. A versão curta para este modelo: não faça.
Você Deve Trocar, Testar ou Esperar?
| Sua situação | O que faríamos em 2026-08-04 |
|---|---|
| Rodando o Qwen3.7-Max em produção | Teste o 3.8-Max primeiro no tráfego de prompts curtos. Foi ali que apareceu nossa diferença de 4x no custo. Depois verifique como seu max_tokens lida com o caso de resposta vazia |
| Carga de trabalho de contexto longo ou RAG pesado | Fique onde está por enquanto. O 3.8-Max custa 35.6% mais por token e empatou exatamente com o 3.7-Max no nosso teste de recuperação |
| Você precisa de entrada de imagem ou vídeo | Esse é o motivo para migrar. O 3.7-Max não consegue receber imagem alguma, e confirmamos o 404 |
| Esperando pelos pesos abertos | Marque 2026-08-10 na agenda. Não há nada a fazer até existir um model card e uma licença para ler |
| Satisfeito com Claude ou GPT | Nada muda hoje. As pontuações de benchmark da Alibaba não estão verificadas, e números não verificados não são motivo para migração |
O método importa mais do que o veredicto. Todo modelo que testamos em produção se comportou de forma diferente da sua posição no leaderboard, porque os seus prompts, a sua base de código e a sua tolerância a retentativas não estão no benchmark de ninguém. Duas tarefas de código na nossa rodada ilustram bem isso: o 3.8-Max e o 3.7-Max pontuaram 11 de 11 em uma tarefa de truncamento de largura de string, e ambos passaram em 5,000 de 5,000 casos aleatórios de aritmética de datas. Em corretude, não conseguimos diferenciá-los. A diferença que medimos está na latência e no gasto de tokens em prompts fáceis, não na capacidade em prompts difíceis.
Está avaliando uma migração e quer uma segunda opinião sobre o modelo de custo? Peça para nossa equipe testar isso na sua carga de trabalho.
Todos os números verificados em 2026-08-04. Preços, rankings de arena e o cronograma dos pesos mudam com frequência. Nossas medições vêm de uma única rota (OpenRouter para a Alibaba), uma máquina, um dia, com n=3 para latência e n=1 para a maioria das sondagens funcionais.
Perguntas Frequentes
O Qwen3.8-Max é open source?
Não em 2026-08-04. Está disponível apenas via API. A Alibaba agendou os pesos para "a próxima semana" no Hugging Face e no ModelScope, e não anunciou nenhuma licença. Manchetes que o chamam de open source estão à frente dos fatos. Uma busca no Hugging Face retorna apenas destilações de terceiros de 4B, não um model card da Alibaba.
Quanto custa o Qwen3.8-Max?
$2.00 por milhão de tokens de entrada e $6.00 por milhão de saída, com entrada em cache reportada a $0.25. Isso é 35.6% mais que o Qwen3.7-Max nos dois lados. Medimos uma mediana de $0.001592 por chamada curta, cerca de 4x mais barato que o 3.7-Max no mesmo prompt, porque ele emite muito menos tokens de raciocínio.
Quantos parâmetros tem o Qwen3.8-Max?
2.4 trilhões no total, segundo o anúncio da Alibaba e todos os veículos que cobriram o lançamento. A contagem ativa é contestada: SiliconANGLE, The Decoder e Coursiv reportam ~95 bilhões ativos, enquanto o MarkTechPost afirma que a Alibaba não divulgou esse número. A API não expõe nenhum campo de parâmetros, então não conseguimos verificar nenhum dos dois valores.
Qual é a janela de contexto do Qwen3.8-Max?
A API ao vivo reporta 1,000,000 tokens de contexto e 131,072 tokens máximos de conclusão. Testamos recuperação até 247,911 tokens sem falhas. Não fizemos uma chamada de 1M tokens, porque uma teria custado cerca de $2.00 e ultrapassado nosso orçamento de teste, então o topo dessa janela é não verificado por nós.
O Qwen3.8-Max suporta entrada de imagem e vídeo?
Sim para as duas, e verificamos ambas. Ele leu dígitos e uma cor corretamente a partir de um PNG gerado localmente, e descreveu um vídeo com precisão quando recebeu uma URL que a Alibaba conseguiu buscar. O Qwen3.7-Max rejeita imagens completamente, com um 404. Duas das nossas três URLs de vídeo de teste falharam na etapa de download do provedor.
As pontuações de benchmark do Qwen3.8-Max são verificadas de forma independente?
Não. Terminal-Bench 2.1 em 86.6, GPQA Diamond em 92.6, PaperBench em 93.0, OSWorld-Verified em 86.1 e DeepSWE 1.1 em 56.6 vêm todas das execuções internas da Alibaba. Até 2026-08-04, não encontramos nenhuma avaliação de terceiros publicada para nenhuma delas.
Posso rodar o Qwen3.8-Max localmente?
Na prática, não, mesmo depois que os pesos forem lançados. Com 2.4 trilhões de parâmetros, ele é várias vezes o tamanho do DeepSeek-V3.2, que já é um verdadeiro projeto de infraestrutura para autoalojar. Espere consumi-lo através de provedores de inferência em vez das suas próprias GPUs, a menos que você opere um datacenter.
Devo migrar do Qwen3.7-Max para o Qwen3.8-Max?
Depende da sua mistura de tokens. Em prompts curtos, medimos o 3.8-Max a cerca de um quarto do custo e de quatro a cinco vezes a velocidade. Em cargas de trabalho de entrada longa, ele custa 35.6% mais e teve desempenho idêntico no nosso teste de recuperação. Se você precisa de entrada de imagem ou vídeo, o 3.7-Max simplesmente não consegue.
Quando os pesos do Qwen3.8-Max serão lançados?
A Alibaba disse "a próxima semana" no seu anúncio de 2026-08-03, nomeando o Hugging Face e o ModelScope como destinos. Sem data exata, e sem texto de licença. Um modelo complementar de pesos abertos, o Qwen3.8-27B, é reportado como previsto para lançar junto com eles. Planejamos verificar novamente em 2026-08-10.