Techsy
Contacto
Começar
Voltar ao blog
ai-machine-learning

Qwen3.8-Max Chegou: 2.4T de Parâmetros, 1M de Contexto, e os Pesos Ainda Não Saíram

Escrito por Mert Batur
Atualizado Aug 4, 2026
19 min de leitura
Índice
Qwen3.8-Max Chegou: 2.4T de Parâmetros, 1M de Contexto, e os Pesos Ainda Não Saíram

Qwen3.8-Max Chegou: 2.4T de Parâmetros, 1M de Contexto, e os Pesos Ainda Não Saíram

$1.4728. Foi isso que custaram 40 chamadas de API ao vivo com o Qwen3.8-Max e seus dois predecessores em 2026-08-04, um dia depois de a Alibaba lançá-lo. A surpresa não foram os 2.4 trilhões de parâmetros. Foi isto: o 3.8-Max cobra 35.6% mais por token que o Qwen3.7-Max e, ainda assim, saiu cerca de 4x mais barato por resposta, porque parou de pensar demais. Mais uma coisa que boa parte da cobertura do lançamento está errando: não é open source. Não hoje.

Este post foi publicado originalmente em 2026-07-19, quando o Qwen3.8 era uma prévia sem especificações publicadas. Foi reescrito em 2026-08-04 com base no lançamento GA e nos nossos próprios testes de API.

Principais Conclusões

  • Em 2026-08-04, o Qwen3.8-Max está disponível apenas via API. A Alibaba prometeu os pesos para "a próxima semana", ou seja, a semana de 2026-08-10, no Hugging Face e no ModelScope.
  • Medimos $0.001592 por chamada curta contra $0.006428 no Qwen3.7-Max, apesar de um preço por token mais alto.
  • As cinco pontuações de benchmark da Alibaba são reportadas pelo próprio fornecedor. Não encontramos nenhuma avaliação independente publicada até 2026-08-04.
  • Entrada de imagem e vídeo é real e nova. Verificamos ambas contra a API e contra a recusa do 3.7-Max.

O Que Mudou Entre a Prévia e o GA

O Qwen3.8-Max ficou geralmente disponível em 2026-08-03, e o lançamento respondeu a todas as perguntas em aberto que esta página listava há duas semanas. A era de prévia nos deu uma contagem de parâmetros e uma promessa. O lançamento GA trouxe uma janela de contexto confirmada de 1M tokens, entrada de texto mais imagem mais vídeo, cinco pontuações de benchmark publicadas e um preço por token.

Aqui está a antiga lista de incógnitas, resolvida:

O que esta página dizia em 2026-07-19Status em 2026-08-04
Qualquer pontuação de benchmark publicada: nenhumaCinco pontuações reportadas pela Alibaba publicadas
Parâmetros ativos / configuração MoE: não divulgadoAmplamente reportado como ~95B ativos, MoE esparso. Reportagens conflitantes, veja abaixo
Janela de contexto e saída máxima: não anunciado1M de entrada, 131,072 de saída, confirmado pela API ao vivo
Modalidade: não anunciadotexto + imagem + vídeo na entrada, texto na saída. Verificamos isso nós mesmos
Preço por token: não detalhado$2.00 / M entrada, $6.00 / M saída
Data de lançamento dos pesos abertos: "em breve", sem data"Próxima semana", Hugging Face e ModelScope nomeados
Qwen3.8-Max-Preview está disponível agoraA prévia acabou. O GA foi lançado

Um item não se resolveu. A divisão de parâmetros continua contestada. A matéria de lançamento do MarkTechPost afirma claramente que a contagem de parâmetros ativos não foi divulgada pela Alibaba, enquanto SiliconANGLE, The Decoder e Coursiv publicam todos ~95 bilhões ativos. Relemos o artigo do MarkTechPost em 2026-08-04 e ele ainda diz não divulgado. A fonte de alguém está errada, e o correto a dizer é que a cobertura sobre esse número específico entrou em conflito no dia do lançamento.

Não conseguimos verificar de nenhuma das duas formas. A resposta do /models da OpenRouter não expõe nenhum campo de contagem de parâmetros, então nada em nossos testes confirma ou refuta os 2.4T totais ou os 95B ativos.

O Qwen3.8-Max é Open Source? Não em 4 de Agosto

Não. Em 2026-08-04, o Qwen3.8-Max está disponível apenas via API. A Alibaba agendou o lançamento dos pesos para "a próxima semana" no Hugging Face e no ModelScope, e não anunciou nenhuma licença. A cobertura continua confundindo "disponível" com "aberto", e essa distinção é toda a história. Não há pesos para baixar hoje, não importa o que diga uma manchete.

Três estados estão sendo misturados em uma única palavra. Eles não são a mesma coisa:

EstadoQwen3.8-Max em 2026-08-04
Disponível via APISim. Alibaba Cloud Model Studio, além de revendedores e roteadores
Pesos para downloadNão. Prometido para "a próxima semana", sem data definida
Termos de licençaNão anunciado. Não existe texto para ler

Verificamos a evidência mais concreta disponível em vez de confiar na palavra de alguém: uma busca no Hugging Face por Qwen3.8 em 2026-08-04 não retorna nenhum model card da Alibaba. O que retorna são quatro uploads de comunidade chamados Qwen3.8_4B_Distilled e variantes, que são destilações de terceiros, não o modelo principal. Se você estiver navegando rápido por essa página, é fácil confundi-los com o lançamento real.

Uma nota sobre a licença, porque precedente continua sendo relatado como compromisso. O Qwen 3.5 e o Qwen 3.6 foram lançados sob Apache 2.0. Uma licença comunitária restritiva em um modelo de 2.4T ainda seria tecnicamente "pesos abertos", mas mudaria o que você pode construir com eles. Até existir o texto da licença, qualquer um que lhe disser o que você pode fazer com esses pesos está apenas chutando. É também por isso que o Qwen3.8-Max não está no nosso levantamento dos melhores LLMs open source para rodar em 2026: ele ainda não se qualifica.

O Que Medimos: 4x Mais Barato por Chamada Apesar de um Aumento de 35.6% no Preço

Fizemos 40 chamadas cobradas contra qwen3.8-max, qwen3.7-max e qwen3-max via OpenRouter em 2026-08-04, gasto total de $1.4728. Cada custo abaixo foi calculado a partir do objeto usage retornado e conferido cruzadamente com o valor faturado pela própria OpenRouter. Todos bateram. O resultado principal vai na direção oposta à mudança de preço.

Comece pelo preço. O preço ao vivo do GET /models em 2026-08-04 coloca o 3.8-Max em $2.00 de entrada / $6.00 de saída por milhão de tokens, contra o 3.7-Max em $1.475 / $4.425. Isso é um aumento de 35.6% nos dois lados, e a proporção é idêntica de qualquer forma (2.000/1.475 = 6.000/4.425 = 1.3559). Você pode conferir os valores atuais na página do modelo na OpenRouter.

Agora o mesmo prompt trivial enviado aos três modelos, três execuções cada, temperature: 0, em streaming:

ModeloPrimeiro token (3 execuções)Primeiro conteúdo visívelTempo total (3 execuções)Tokens de conclusãodos quais de raciocínioCusto médio por chamada
qwen3.8-max2.249s / 0.874s / 1.054s5.414s / 5.058s / 4.209s6.338s / 6.734s / 5.130s242 / 287 / 243156 / 194 / 157$0.001592
qwen3.7-max4.871s / 1.157s / 1.670snunca / 22.358s / 25.998s31.147s / 24.013s / 27.661s1502 / 1281 / 14431500 / 1174 / 1346$0.006428
qwen3-max2.617s / 2.892s / 2.386s2.617s / 2.892s / 2.386s4.401s / 4.601s / 4.081s105 / 105 / 1070 / 0 / 0$0.000431

Duas colunas separadas de primeiro token são necessárias porque os dois modelos de raciocínio transmitem raciocínio oculto antes de qualquer texto de resposta. No 3.8-Max, um token chega em menos de um segundo em duas das três execuções, mas a primeira palavra que um usuário consegue realmente ler chega de quatro a cinco segundos depois. Na execução 1 do 3.7-Max, ela nunca chegou. Se você constrói uma interface de streaming sobre um modelo de raciocínio, o indicador de carregamento continua girando bem depois de a conexão provar que está viva.

Leia a coluna de raciocínio duas vezes. Em um prompt pedindo uma explicação de três frases sobre um filtro de Bloom, o 3.7-Max gastou entre 1,174 e 1,500 tokens de raciocínio. O 3.8-Max gastou entre 156 e 194. Isso é aproximadamente 7x menos pensamento para a mesma resposta, e tokens de raciocínio são cobrados na taxa de saída. O resultado: o 3.8-Max sai cerca de 4x mais barato por chamada e é de 4 a 5 vezes mais rápido em tempo total a partir da nossa máquina, incluindo o round-trip de rede, enquanto custa 35.6% mais por token. O preço de tabela subiu e a conta caiu.

Isso se inverte à medida que os prompts crescem. Modelado a partir do preço ao vivo, e não medido, uma chamada de 30,000 tokens com 500 tokens de saída custa $63.00 por mil chamadas no 3.8-Max, contra $46.46 no 3.7-Max. Em 100,000 tokens de entrada, são $203.00 contra $149.71. Quando a maior parte dos seus tokens é de entrada, a vantagem de eficiência de raciocínio deixa de compensar o aumento de preço, e o 3.8-Max se torna o mais caro dos três. Qual modelo é mais barato depende genuinamente da sua proporção entrada/saída, que é exatamente a lição que nossa comparação de preços de APIs de LLM continua reforçando.

O reasoning_effort é Novo, e o 3.7-Max o Ignora Silenciosamente

reasoning_effort aparece entre os parâmetros suportados do 3.8-Max e não nos do 3.7-Max. No 3.8-Max, ele move a agulha de forma modesta: em três execuções cada, minimal produziu 67, 108 e 124 tokens de raciocínio contra high em 163, 136 e 173. Medianas de 108 contra 163, no mesmo prompt, na temperatura 0.

O achado que custa dinheiro está no modelo mais antigo. Enviar reasoning_effort: "low" para o 3.7-Max é aceito em vez de rejeitado, e depois ignorado: essa chamada ainda queimou 1,401 tokens de raciocínio, cobrando os mesmos $0.006689 da chamada de formato idêntico que registramos. Sem erro, sem aviso, sem efeito. Se você está ajustando custo reduzindo o esforço de raciocínio, verifique se isso está realmente fazendo alguma coisa no modelo que você está chamando de fato, porque um parâmetro não suportado aqui falha silenciosamente em vez de gritar.

A Armadilha da Resposta Vazia Que Você Deveria Checar Antes de Migrar

Nossa primeira execução de teste usou max_tokens: 400 e travou nosso próprio script. O motivo acabou valendo mais do que o teste em si. O Qwen3.7-Max pode gastar todo o seu orçamento de tokens em raciocínio e retornar uma string vazia, com finish_reason: "length", cobrada integralmente.

Isso aconteceu com a gente três vezes separadas. Em max_tokens: 400: 402 tokens de conclusão, 400 deles de raciocínio, zero caracteres de resposta, $0.001822 cobrados. Em max_tokens: 1500: 1,502 tokens, 1,500 de raciocínio, zero caracteres, $0.006689 por nada. E mais uma vez em uma chamada posterior, $0.006735. Sem erro, sem exceção, apenas um objeto de resposta com aparência fluente e uma string de conteúdo vazia.

Se você está migrando uma integração existente com o 3.7-Max e seu código define um max_tokens modesto, reserve tempo para testar esse caminho. O raciocínio muito mais curto do 3.8-Max o torna significativamente menos exposto a isso. Mas ele não é imune.

Um Pequeno Overhead de Tokens Que Ninguém Menciona

O mesmo prompt de 12 palavras contou 67 tokens de prompt no 3.8-Max e 29 no 3.7-Max, de forma consistente em todas as execuções (27 no qwen3-max). Isso é aproximadamente 38 tokens de overhead fixo, presumivelmente um template de sistema ou de chat maior. Em uma chamada RAG de 100,000 tokens, isso arredonda para nada. Em um classificador de alto volume disparando prompts curtos, isso mais do que dobra sua conta de entrada antes mesmo de você escrever uma palavra.

O Qwen3.8-Max Realmente Aceita Imagens e Vídeo?

Sim, e a entrada multimodal é genuinamente nova nesta geração, não uma simples remarcação. A API reporta text+image+video->text para o 3.8-Max e apenas texto para o 3.7-Max. Verificamos a diferença enviando a mesma imagem para ambos, e o modelo mais antigo a rejeitou na camada de roteamento.

Geramos a imagem de teste localmente com um codificador PNG escrito à mão, para que a verdade fundamental fosse conhecida por construção: 750x270 pixels, dígitos em bloco pretos 4739 em fundo branco, com uma barra horizontal vermelha no topo. Enviada em base64, o qwen3.8-max retornou DIGITS: 4739 e TOPBAR: red. Correto nos dois casos, 6.99s, $0.002146. A mesma requisição para o qwen3.7-max voltou como HTTP 404 {"error":{"message":"No endpoints found that support image input"}} (nenhum endpoint encontrado que suporte entrada de imagem).

Vídeo também funciona, com uma ressalva que quase reportamos como falha. Duas das três URLs públicas de MP4 que testamos retornaram HTTP 400 "Failed to download multimodal content" (falha ao baixar conteúdo multimodal). Isso é a Alibaba falhando ao buscar o arquivo, não a rota recusando vídeo. Com uma URL que ela conseguiu buscar, o 3.8-Max descreveu um clipe do Big Buck Bunny com precisão, incluindo o nome do personagem, em 24.24s por $0.006528.

Duas notas práticas antes de você construir em cima disso. O vídeo foi cobrado como 696 tokens de prompt comuns para um clipe de cerca de 10 segundos, e usage.prompt_tokens_details.video_tokens reportou 0, então você não consegue separar o custo de vídeo desse campo. E uma parte de conteúdo malformada falha silenciosamente: enviar {"type": "video", "video": [url]} em vez de video_url retornou HTTP 200 com o modelo dizendo educadamente que não conseguia ver nenhum vídeo, mais a cobrança. Use video_url.

Vale saber: quando pedimos ao 3.8-Max para descrever suas próprias capacidades, ele respondeu Input modalities: text. Isso está errado, como o próximo teste em nossa própria execução demonstrou. A autodescrição de um modelo é uma saída de linguagem, não uma ficha técnica.

Quão Bem a Janela de Contexto de 1M Tokens Se Sustenta?

Plantamos três fatos únicos em profundidades de 10%, 50% e 90% em um preenchimento gerado e pedimos os três em uma única chamada. 18 de 18 agulhas voltaram corretas em seis execuções em dois modelos, em tamanhos de prompt de 5,723 até 247,911 tokens, avaliadas por correspondência exata de substring no código, e não por leitura das respostas.

Nossas execuções do qwen3.8-max (as duas execuções do qwen3.7-max em 83,380 e 247,873 tokens, e uma execução do qwen3-max em 78,255, também retornaram todas as agulhas):

Tokens de prompt (qwen3.8-max)LatênciaCustoAgulhas encontradas
5,7239.24s$0.014093 de 3
25,70313.43s$0.054533 de 3
83,41817.63s$0.169653 de 3
247,91138.54s$0.498283 de 3

A latência escala sublinearmente, que é a parte praticamente útil: 43x mais tokens de entrada custam apenas 4.2x mais tempo total.

Agora os limites honestos, porque esse é o lado mais fácil da avaliação de contexto longo. Recuperar um fato plantado literalmente diz muito pouco sobre raciocínio em um documento grande, e testamos cada tamanho apenas uma vez. Não fizemos uma chamada de 1M tokens. A $2.00 por milhão de tokens de entrada, uma teria custado cerca de $2.00, mais do que toda essa rodada de testes, e uma única amostra não nos diria muita coisa. O teto anunciado de 1M é, portanto, não verificado por nós. E o 3.7-Max igualou exatamente o 3.8-Max nos dois tamanhos que comparamos, então recuperação de contexto longo não é onde esta geração se diferencia.

Uma armadilha de preços apareceu aqui que a cobertura de lançamento ignora completamente. O qwen3-max carrega sobretaxas de preço escalonadas que dobram sua taxa acima de 32,000 tokens de prompt e a elevam novamente acima de 128,000, enquanto o 3.8-Max e o 3.7-Max têm taxa fixa em qualquer tamanho. Confirmamos o escalão a partir da cobrança real: nossa chamada de 78,255 tokens para o qwen3-max foi cobrada $0.12227, a taxa de $1.56/M, não o valor anunciado de $0.78/M. Nesse comprimento, custa quase exatamente o mesmo que o 3.7-Max custa ($0.12523). Seu preço anunciado é menos da metade. Seu preço real a 80 mil tokens é uma diferença de arredondamento.

As Cinco Pontuações de Benchmark da Alibaba, e Por Que Nenhuma Delas Está Verificada

A Alibaba publicou cinco pontuações de benchmark com o lançamento GA. Todas elas vêm das execuções internas da própria Alibaba, e não encontramos nenhuma avaliação independente publicada até 2026-08-04. Essa frase merece ficar ao lado dos números, e não três parágrafos abaixo deles.

BenchmarkPontuação reportada pela AlibabaVerificado por terceiros?
Terminal-Bench 2.186.6Não, até 2026-08-04
GPQA Diamond92.6Não, até 2026-08-04
PaperBench93.0Não, até 2026-08-04
OSWorld-Verified86.1Não, até 2026-08-04
DeepSWE 1.156.6 (predecessor: 21.6)Não, até 2026-08-04

A Alibaba também reportou um agregado interno de 0.725, subindo de 0.474, e posicionou o modelo como próximo ou acima do Claude Opus 4.8, do Fable 5 e do GPT-5.6 Sol. Colocações em arena também circularam: 5º na Text Arena e 2º na Vision Arena conforme o próprio anúncio da Alibaba de 2026-08-03, que não reconfirmamos no leaderboard ao vivo. Os rankings de arena mudam diariamente. Trate qualquer ranking que você leia nesta semana como um retrato com uma data anexada.

O que ninguém mediu ainda, nós incluídos: throughput sob concorrência, desempenho em idiomas além do inglês, avaliações de segurança e alinhamento, e confiabilidade de chamadas de ferramentas. Nossos próprios números cobrem latência, custo, modalidade e recuperação de contexto longo em uma única rota, e nada mais. A reportagem de lançamento da Bloomberg repetiu as alegações de benchmark sem testes independentes, que é onde praticamente toda a cobertura está agora.

Para números que já foram checados, nossa comparação Qwen vs DeepSeek vs GLM é a referência melhor, e o Kimi K3, com aproximadamente 2.8T, é o rival de tamanho contra o qual todo mundo o compara em benchmarks.

Qwen3.8 vs Qwen3-8B, e a Reviravolta de Pesos Abertos por Trás Deste Lançamento

O Qwen3.8 é o modelo principal da Alibaba, com 2.4 trilhões de parâmetros. O Qwen3-8B é um modelo denso de 8 bilhões de parâmetros da série Qwen3, disponível para download desde 2025. Nomes parecidos, cerca de 300x de diferença em tamanho. Buscadores ainda confundem os dois, e um número surpreendente de respostas em fóruns também.

O problema de nomenclatura piorou nesta semana, não melhorou. As únicas coisas no Hugging Face carregando o nome "Qwen3.8" agora são destilações de comunidade de 4B. Se você for procurar pesos e pegar uma dessas, estará baixando algo sem nenhuma relação com o modelo de 2.4T.

Dois Modelos Principais Fechados, e Agora Isto

A promessa de pesos abertos é a verdadeira notícia aqui, e ela se lê de forma diferente quando você vê o histórico da família. A Alibaba passou duas gerações mantendo uma divisão deliberada: modelos de trabalho de pesos abertos para todo mundo, modelo principal fechado no topo.

GeraçãoPesosNotas
Qwen 3.5 (0.8B a 397B-A17B)Aberto, Apache 2.0Família completa lançada publicamente
Qwen 3.6 (27B denso, 35B-A3B MoE)Aberto, Apache 2.0O mesmo padrão se manteve
Qwen3.7-MaxFechadoApenas API. Sem GGUF, sem checkpoint no Hugging Face
Qwen3.8-MaxPrometido aberto, ainda não lançado"Próxima semana" a partir de 2026-08-03. Licença não anunciada

A Alibaba manteve o nível principal fechado por duas gerações seguidas e agora diz que vai abrir o maior modelo que já construiu. Se os pesos chegarem como prometido, isso é uma verdadeira reviravolta e pressiona todo laboratório que trata "o topo da fronteira permanece fechado" como algo consolidado. Se atrasarem, este se torna o terceiro lançamento Max fechado seguido. Os dois desfechos ainda estão em aberto em 2026-08-04. Vimos a mesma dinâmica se repetir com o GLM 5.2, onde a licença efetivamente lançada importou mais do que o anúncio.

Você Consegue Rodar o Qwen3.8-Max Você Mesmo? (Ainda Não)

Não, e as especificações do GA deixam isso mais claro, não menos. Com 2.4 trilhões de parâmetros totais, este não é um modelo que você hospeda no seu próprio hardware, nem mesmo depois que os pesos forem liberados. O DeepSeek-V3.2, com 685B, já é descrito por quem já fez isso como um projeto de infraestrutura sério. Este é várias vezes maior que isso.

Então o que um modelo de 2.4T de pesos abertos realmente traz de vantagem?

  • Provedores de inferência podem hospedá-lo, o que significa competição de preços, o que significa que o seu custo por token cai
  • Implantações soberanas, regulamentadas e air-gapped se tornam possíveis nesse nível pela primeira vez
  • Pesquisadores e quem faz fine-tuning ganham um modelo-base de escala de fronteira para trabalhar
  • Isso não significa que ele roda na sua máquina, na sua única A100, ou no orçamento de GPU da sua startup

Se você quer a matemática do que rodar grandes modelos de pesos abertos realmente exige, nosso guia de requisitos de VRAM para LLMs faz essa conta direito. A versão curta para este modelo: não faça.

Você Deve Trocar, Testar ou Esperar?

Sua situaçãoO que faríamos em 2026-08-04
Rodando o Qwen3.7-Max em produçãoTeste o 3.8-Max primeiro no tráfego de prompts curtos. Foi ali que apareceu nossa diferença de 4x no custo. Depois verifique como seu max_tokens lida com o caso de resposta vazia
Carga de trabalho de contexto longo ou RAG pesadoFique onde está por enquanto. O 3.8-Max custa 35.6% mais por token e empatou exatamente com o 3.7-Max no nosso teste de recuperação
Você precisa de entrada de imagem ou vídeoEsse é o motivo para migrar. O 3.7-Max não consegue receber imagem alguma, e confirmamos o 404
Esperando pelos pesos abertosMarque 2026-08-10 na agenda. Não há nada a fazer até existir um model card e uma licença para ler
Satisfeito com Claude ou GPTNada muda hoje. As pontuações de benchmark da Alibaba não estão verificadas, e números não verificados não são motivo para migração

O método importa mais do que o veredicto. Todo modelo que testamos em produção se comportou de forma diferente da sua posição no leaderboard, porque os seus prompts, a sua base de código e a sua tolerância a retentativas não estão no benchmark de ninguém. Duas tarefas de código na nossa rodada ilustram bem isso: o 3.8-Max e o 3.7-Max pontuaram 11 de 11 em uma tarefa de truncamento de largura de string, e ambos passaram em 5,000 de 5,000 casos aleatórios de aritmética de datas. Em corretude, não conseguimos diferenciá-los. A diferença que medimos está na latência e no gasto de tokens em prompts fáceis, não na capacidade em prompts difíceis.

Está avaliando uma migração e quer uma segunda opinião sobre o modelo de custo? Peça para nossa equipe testar isso na sua carga de trabalho.

Todos os números verificados em 2026-08-04. Preços, rankings de arena e o cronograma dos pesos mudam com frequência. Nossas medições vêm de uma única rota (OpenRouter para a Alibaba), uma máquina, um dia, com n=3 para latência e n=1 para a maioria das sondagens funcionais.

Perguntas Frequentes

O Qwen3.8-Max é open source?

Não em 2026-08-04. Está disponível apenas via API. A Alibaba agendou os pesos para "a próxima semana" no Hugging Face e no ModelScope, e não anunciou nenhuma licença. Manchetes que o chamam de open source estão à frente dos fatos. Uma busca no Hugging Face retorna apenas destilações de terceiros de 4B, não um model card da Alibaba.

Quanto custa o Qwen3.8-Max?

$2.00 por milhão de tokens de entrada e $6.00 por milhão de saída, com entrada em cache reportada a $0.25. Isso é 35.6% mais que o Qwen3.7-Max nos dois lados. Medimos uma mediana de $0.001592 por chamada curta, cerca de 4x mais barato que o 3.7-Max no mesmo prompt, porque ele emite muito menos tokens de raciocínio.

Quantos parâmetros tem o Qwen3.8-Max?

2.4 trilhões no total, segundo o anúncio da Alibaba e todos os veículos que cobriram o lançamento. A contagem ativa é contestada: SiliconANGLE, The Decoder e Coursiv reportam ~95 bilhões ativos, enquanto o MarkTechPost afirma que a Alibaba não divulgou esse número. A API não expõe nenhum campo de parâmetros, então não conseguimos verificar nenhum dos dois valores.

Qual é a janela de contexto do Qwen3.8-Max?

A API ao vivo reporta 1,000,000 tokens de contexto e 131,072 tokens máximos de conclusão. Testamos recuperação até 247,911 tokens sem falhas. Não fizemos uma chamada de 1M tokens, porque uma teria custado cerca de $2.00 e ultrapassado nosso orçamento de teste, então o topo dessa janela é não verificado por nós.

O Qwen3.8-Max suporta entrada de imagem e vídeo?

Sim para as duas, e verificamos ambas. Ele leu dígitos e uma cor corretamente a partir de um PNG gerado localmente, e descreveu um vídeo com precisão quando recebeu uma URL que a Alibaba conseguiu buscar. O Qwen3.7-Max rejeita imagens completamente, com um 404. Duas das nossas três URLs de vídeo de teste falharam na etapa de download do provedor.

As pontuações de benchmark do Qwen3.8-Max são verificadas de forma independente?

Não. Terminal-Bench 2.1 em 86.6, GPQA Diamond em 92.6, PaperBench em 93.0, OSWorld-Verified em 86.1 e DeepSWE 1.1 em 56.6 vêm todas das execuções internas da Alibaba. Até 2026-08-04, não encontramos nenhuma avaliação de terceiros publicada para nenhuma delas.

Posso rodar o Qwen3.8-Max localmente?

Na prática, não, mesmo depois que os pesos forem lançados. Com 2.4 trilhões de parâmetros, ele é várias vezes o tamanho do DeepSeek-V3.2, que já é um verdadeiro projeto de infraestrutura para autoalojar. Espere consumi-lo através de provedores de inferência em vez das suas próprias GPUs, a menos que você opere um datacenter.

Devo migrar do Qwen3.7-Max para o Qwen3.8-Max?

Depende da sua mistura de tokens. Em prompts curtos, medimos o 3.8-Max a cerca de um quarto do custo e de quatro a cinco vezes a velocidade. Em cargas de trabalho de entrada longa, ele custa 35.6% mais e teve desempenho idêntico no nosso teste de recuperação. Se você precisa de entrada de imagem ou vídeo, o 3.7-Max simplesmente não consegue.

Quando os pesos do Qwen3.8-Max serão lançados?

A Alibaba disse "a próxima semana" no seu anúncio de 2026-08-03, nomeando o Hugging Face e o ModelScope como destinos. Sem data exata, e sem texto de licença. Um modelo complementar de pesos abertos, o Qwen3.8-27B, é reportado como previsto para lançar junto com eles. Planejamos verificar novamente em 2026-08-10.

Etiquetas

qwen-3-8qwen3-8-maxopen-weight-llmalibaba-qwenllm-tooling

Partilhar este artigo

Artigos relacionados

Mais em ai-machine-learning

ai-machine-learning
Aug 4, 2026

Gitar AI Code Review: O Que a Sonar Realmente Comprou (Análise 2026)

A Sonar adquiriu a Gitar em 21 de maio de 2026. Esta análise cobre o que o autofix validado por CI da Gitar realmente faz, os planos de $20 e $40, onde ela supera CodeRabbit e Greptile, e as razões honestas para evitá-la.

10 min de leitura min de leitura
Ler
ai-machine-learning
Aug 3, 2026

Melhores Práticas de Tool Calling em Agentes: Por Que Seu Agente Escolhe a Ferramenta Errada

Seu agente escolhe a ferramenta errada porque a falha está em quatro lugares específicos: seleção, argumentos, loops e tamanho de resposta. Este guia diagnostica cada modo de falha primeiro, depois mapeia oito melhores práticas de tool calling para eles, com código, schemas e um loop de avaliação que você pode rodar a cada mudança.

14 min de leitura min de leitura
Ler
ai-machine-learning
Aug 3, 2026

RAG vs Fine-Tuning: Quando Usar Cada Um (Com Números Reais)

O RAG recupera fatos no momento da consulta; o fine-tuning grava conhecimento nos pesos do modelo. Um estudo do arXiv com 162 citações testou os dois na mesma tarefa, e o vencedor surpreende a maioria das equipes. Aqui está o framework de decisão com matemática de custo real sobre preços públicos de tabela.

14 min de leitura min de leitura
Ler
Ver todos os artigos
Inicia o Teu Projeto

Pronto para criar algo extraordinário?

Vamos transformar a sua visão em realidade. A nossa equipa está pronta para o ajudar a criar software que faz a diferença.

Marca uma chamada de scope 30 minVer o Nosso Trabalho

Destaque da biblioteca

Skills do Claude

Ver tudo
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Automações AI

Ver tudo
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Destaque da biblioteca

Skills do Claude

Ver tudo
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Automações AI

Ver tudo
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Serviços

  • Soluções Empresariais
  • Aplicações Móveis
  • Aplicações Web

Soluções

  • Sistemas CRM
  • Integração de IA
  • Soluções ERP
  • Agentes de Voz
  • Automação de Processos
  • Cibersegurança

Biblioteca

  • Blogue
  • Portfólio

Comunidade

  • Automações AI
  • Skills do Claude

Ferramentas

  • Calculadora de Custo de App Móvel
  • Calculadora de Custo de API OpenAI / LLM
  • Calculadora de Custo de MVP
  • Calculadora de Custo de Agente de Voz AI

Empresa

  • Sobre
  • Parceiros
  • Contacto

Legal

  • Política de Privacidade
  • Termos de Serviço
  • Política de Cookies

Serviços

  • Soluções Empresariais
  • Aplicações Móveis
  • Aplicações Web

Soluções

  • Sistemas CRM
  • Integração de IA
  • Soluções ERP
  • Agentes de Voz
  • Automação de Processos
  • Cibersegurança

Biblioteca

  • Blogue
  • Portfólio

Comunidade

  • Automações AI
  • Skills do Claude

Ferramentas

  • Calculadora de Custo de App Móvel
  • Calculadora de Custo de API OpenAI / LLM
  • Calculadora de Custo de MVP
  • Calculadora de Custo de Agente de Voz AI

Empresa

  • Sobre
  • Parceiros
  • Contacto
LegalPolítica de PrivacidadeTermos de ServiçoPolítica de Cookies
TECHSY
© 2026 Techsy. Todos os direitos reservados.