
Qwen3.8-Max Ya Está Aquí: 2.4T de Parámetros, 1M de Contexto, y los Pesos Todavía No Salen
$1.4728. Eso es lo que nos costaron 40 llamadas API en vivo a Qwen3.8-Max y sus dos predecesores el 2026-08-04, el día después de que Alibaba lo lanzara. La sorpresa no fueron los 2.4 billones de parámetros. Fue esto: 3.8-Max cobra un 35.6% más por token que Qwen3.7-Max y aun así salió aproximadamente 4x más barato por respuesta, porque dejó de pensar de más. Una cosa más que casi toda la cobertura del lanzamiento está entendiendo mal. No es de código abierto. Todavía no.
Este artículo se publicó por primera vez el 2026-07-19, cuando Qwen3.8 era una vista previa sin especificaciones publicadas. Se reescribió el 2026-08-04 con la disponibilidad general y nuestras propias pruebas de la API.
Puntos Clave
- A fecha de 2026-08-04, Qwen3.8-Max solo está disponible por API. Alibaba prometió los pesos "la próxima semana", es decir, la semana del 2026-08-10, en Hugging Face y ModelScope.
- Medimos $0.001592 por llamada corta frente a $0.006428 en Qwen3.7-Max, a pesar de un precio por token más alto.
- Las cinco puntuaciones de benchmark de Alibaba están reportadas por el propio proveedor. No encontramos ninguna evaluación independiente publicada a fecha de 2026-08-04.
- La entrada de imagen y vídeo es real y nueva. Verificamos ambas contra la API y contra el rechazo de 3.7-Max.
Qué Cambió Entre la Vista Previa y la Disponibilidad General
Qwen3.8-Max alcanzó la disponibilidad general el 2026-08-03, y el lanzamiento respondió a todas las preguntas abiertas que esta página enumeraba hace dos semanas. La etapa de vista previa nos dio un número de parámetros y una promesa. El lanzamiento GA añadió una ventana de contexto confirmada de 1M de tokens, entrada de texto más imagen más vídeo, cinco puntuaciones de benchmark publicadas y un precio por token.
Aquí está el antiguo listado de incógnitas, ya resueltas:
| Lo que decía esta página el 2026-07-19 | Estado el 2026-08-04 |
|---|---|
| Cualquier puntuación de benchmark publicada: ninguna | Cinco puntuaciones reportadas por Alibaba, publicadas |
| Parámetros activos / configuración MoE: no revelado | Ampliamente reportado como ~95B activos, MoE disperso. Los reportes son contradictorios, ver más abajo |
| Ventana de contexto y salida máxima: no anunciado | 1M de entrada, 131,072 de salida, confirmado por la API en vivo |
| Modalidad: no anunciado | texto + imagen + vídeo de entrada, texto de salida. Lo verificamos nosotros mismos |
| Precio por token: no desglosado | $2.00 / M de entrada, $6.00 / M de salida |
| Fecha de lanzamiento de pesos abiertos: "pronto", sin fecha | "La próxima semana", con Hugging Face y ModelScope mencionados |
| Qwen3.8-Max-Preview está activo ahora | La vista previa terminó. Se lanzó la GA |
Un elemento no se resolvió. El reparto de parámetros sigue siendo disputado. El artículo de lanzamiento de MarkTechPost afirma claramente que Alibaba no reveló el número de parámetros activos, mientras que SiliconANGLE, The Decoder y Coursiv publican todos ~95 mil millones activos. Releímos el artículo de MarkTechPost el 2026-08-04 y sigue diciendo que no se reveló. Las fuentes de alguien están equivocadas, y lo honesto es decirte que la cobertura sobre esta cifra concreta se contradijo el día del lanzamiento.
No pudimos verificarlo en ningún sentido. La respuesta de /models de OpenRouter no expone ningún campo de número de parámetros, así que nada en nuestras pruebas confirma ni refuta los 2.4T totales o los 95B activos.
¿Es Qwen3.8-Max de Código Abierto? No, al 4 de Agosto
No. A fecha de 2026-08-04, Qwen3.8-Max solo está disponible por API. Alibaba ha programado el lanzamiento de los pesos para "la próxima semana" en Hugging Face y ModelScope, y no ha anunciado ninguna licencia. La cobertura sigue confundiendo "disponible" con "abierto", y esa distinción es toda la historia. No hay pesos que descargar hoy, digan lo que digan los titulares.
Se están mezclando tres estados en una sola palabra. No son lo mismo:
| Estado | Qwen3.8-Max el 2026-08-04 |
|---|---|
| Disponible por API | Sí. Alibaba Cloud Model Studio, además de revendedores y routers |
| Pesos descargables | No. Prometidos para "la próxima semana", sin fecha concreta |
| Términos de licencia | No anunciados. No existe ningún texto que leer |
Comprobamos la evidencia más contundente disponible en lugar de fiarnos de la palabra de nadie: una búsqueda en Hugging Face de Qwen3.8 el 2026-08-04 no devuelve ninguna ficha de modelo de Alibaba. Lo que sí devuelve son cuatro subidas de la comunidad llamadas Qwen3.8_4B_Distilled y variantes, que son destilaciones de terceros, no el buque insignia. Si escaneas esa página rápido, es fácil confundirlas con el lanzamiento real.
Una nota sobre la licencia, porque el precedente se sigue reportando como si fuera un compromiso. Tanto Qwen 3.5 como Qwen 3.6 se lanzaron bajo Apache 2.0. Una licencia comunitaria restrictiva a 2.4T seguiría siendo técnicamente "pesos abiertos" mientras cambia lo que se te permite construir con ellos. Hasta que exista un texto de licencia, cualquiera que te diga qué puedes hacer con estos pesos está adivinando. Por eso Qwen3.8-Max tampoco está en nuestro resumen de LLM de código abierto que vale la pena usar en 2026: todavía no califica.
Lo Que Medimos: 4x Más Barato Por Llamada a Pesar de una Subida de Precio del 35.6%
Hicimos 40 llamadas facturadas contra qwen3.8-max, qwen3.7-max y qwen3-max a través de OpenRouter el 2026-08-04, con un gasto total de $1.4728. Cada costo de abajo se calculó a partir del objeto usage devuelto y se verificó cruzándolo con la cifra facturada por el propio OpenRouter. Todas coincidieron. El hallazgo principal va en dirección opuesta al cambio de precio.
Empecemos con el precio. El precio en vivo desde GET /models el 2026-08-04 sitúa a 3.8-Max en $2.00 de entrada / $6.00 de salida por millón de tokens frente a 3.7-Max en $1.475 / $4.425. Eso es una subida del 35.6% en ambos lados, y la proporción es idéntica en los dos casos (2.000/1.475 = 6.000/4.425 = 1.3559). Puedes verificar las cifras actuales en la página del modelo en OpenRouter.
Ahora el mismo prompt trivial enviado a los tres modelos, tres ejecuciones cada uno, temperature: 0, en streaming:
| Modelo | Primer token (3 ejecuciones) | Primer contenido visible | Tiempo total (3 ejecuciones) | Tokens de finalización | de los cuales de razonamiento | Costo mediano/llamada |
|---|---|---|---|---|---|---|
| qwen3.8-max | 2.249s / 0.874s / 1.054s | 5.414s / 5.058s / 4.209s | 6.338s / 6.734s / 5.130s | 242 / 287 / 243 | 156 / 194 / 157 | $0.001592 |
| qwen3.7-max | 4.871s / 1.157s / 1.670s | nunca / 22.358s / 25.998s | 31.147s / 24.013s / 27.661s | 1502 / 1281 / 1443 | 1500 / 1174 / 1346 | $0.006428 |
| qwen3-max | 2.617s / 2.892s / 2.386s | 2.617s / 2.892s / 2.386s | 4.401s / 4.601s / 4.081s | 105 / 105 / 107 | 0 / 0 / 0 | $0.000431 |
Hacen falta dos columnas separadas de primer token porque ambos modelos de razonamiento transmiten razonamiento oculto antes de cualquier texto de respuesta. En 3.8-Max un token llega en menos de un segundo en dos de las tres ejecuciones, pero la primera palabra que un usuario puede leer de verdad llega cuatro o cinco segundos después. En la ejecución 1 de 3.7-Max nunca llegó. Si construyes una interfaz de streaming contra un modelo de razonamiento, el spinner sigue girando mucho después de que la conexión ya haya demostrado estar viva.
Lee la columna de razonamiento dos veces. En un prompt que pedía una explicación de tres frases sobre un filtro de Bloom, 3.7-Max gastó entre 1,174 y 1,500 tokens de razonamiento. 3.8-Max gastó entre 156 y 194. Eso es aproximadamente 7x menos pensamiento para la misma respuesta, y los tokens de razonamiento se facturan a la tarifa de salida. El resultado: 3.8-Max sale aproximadamente 4x más barato por llamada y de 4 a 5 veces más rápido en tiempo total desde nuestra máquina, incluyendo el viaje de ida y vuelta de la red, mientras cuesta un 35.6% más por token. El precio de lista subió y la factura bajó.
Eso se invierte a medida que crecen los prompts. Modelado a partir del precio en vivo, no medido, una llamada de 30,000 tokens con 500 tokens de salida cuesta $63.00 por cada mil llamadas en 3.8-Max frente a $46.46 en 3.7-Max. A 100,000 tokens de entrada es $203.00 frente a $149.71. Una vez que la mayoría de tus tokens son de entrada, la ventaja de eficiencia en razonamiento deja de compensar la subida de precio y 3.8-Max pasa a ser el más caro de los tres. Cuál modelo sale más barato depende de verdad de tu proporción entre entrada y salida, que es la misma lección a la que sigue llegando nuestra comparativa de precios de API de LLM.
reasoning_effort Es Nuevo, y 3.7-Max Lo Ignora en Silencio
reasoning_effort aparece entre los parámetros soportados de 3.8-Max y no en los de 3.7-Max. En 3.8-Max mueve la aguja de forma modesta: en tres ejecuciones cada uno, minimal produjo 67, 108 y 124 tokens de razonamiento frente a high con 163, 136 y 173. Medianas de 108 frente a 163, con el mismo prompt, a temperatura 0.
El hallazgo que cuesta dinero está en el modelo más antiguo. Enviar reasoning_effort: "low" a 3.7-Max se acepta en lugar de rechazarse, y luego se ignora: esa llamada igual quemó 1,401 tokens de razonamiento, facturando los mismos $0.006689 que la llamada de forma idéntica que registramos. Sin error, sin aviso, sin efecto. Si estás ajustando el costo bajando el esfuerzo de razonamiento, verifica que esté haciendo algo en el modelo al que realmente estás llamando, porque aquí un parámetro no soportado falla en silencio en lugar de fallar en voz alta.
La Trampa de la Respuesta Vacía Que Deberías Revisar Antes de Migrar
Nuestra primera ejecución de prueba usó max_tokens: 400 y bloqueó nuestro propio script. La razón resultó valer más que la prueba en sí. Qwen3.7-Max puede gastar todo su presupuesto de tokens en razonamiento y devolver una cadena vacía, con finish_reason: "length", facturado en su totalidad.
Nos topamos con esto tres veces por separado. Con max_tokens: 400: 402 tokens de finalización, 400 de ellos de razonamiento, cero caracteres de respuesta, $0.001822 facturados. Con max_tokens: 1500: 1,502 tokens, 1,500 de razonamiento, cero caracteres, $0.006689 por nada. Y una vez más en una llamada posterior, $0.006735. Sin error, sin excepción, solo un objeto de respuesta con aspecto normal y una cadena de contenido vacía.
Si estás migrando una integración existente de 3.7-Max y tu código fija un max_tokens modesto, reserva tiempo para probar este caso. El razonamiento mucho más corto de 3.8-Max lo deja notablemente menos expuesto. No es inmune.
Un Pequeño Sobrecosto de Tokens Que Nadie Menciona
El mismo prompt idéntico de 12 palabras contó 67 tokens de prompt en 3.8-Max y 29 en 3.7-Max, de forma consistente en todas las ejecuciones (27 en qwen3-max). Eso es aproximadamente 38 tokens de sobrecosto fijo, probablemente una plantilla de sistema o de chat más grande. En una llamada RAG de 100,000 tokens, esto se redondea a nada. En un clasificador de alto volumen que dispara prompts cortos, esto más que duplica tu factura de entrada antes de que hayas escrito una sola palabra.
¿De Verdad Qwen3.8-Max Acepta Imágenes y Vídeo?
Sí, y la entrada multimodal es genuinamente nueva en esta generación, no un simple cambio de etiqueta. La API reporta text+image+video->text para 3.8-Max y solo texto para 3.7-Max. Verificamos la diferencia enviando la misma imagen a ambos, y el modelo más antiguo la rechazó en la capa de enrutamiento.
Generamos la imagen de prueba localmente con un codificador PNG escrito a mano, así que la verdad de referencia se conocía por construcción: 750x270 píxeles, dígitos de bloque negros 4739 sobre blanco, con una barra horizontal roja en la parte superior. Enviada codificada en base64, qwen3.8-max devolvió DIGITS: 4739 y TOPBAR: red. Correcto en ambos puntos, 6.99s, $0.002146. La solicitud idéntica a qwen3.7-max volvió como HTTP 404 {"error":{"message":"No endpoints found that support image input"}}.
El vídeo también funciona, con una salvedad que casi reportamos como un fallo. Dos de las tres URL públicas de MP4 que probamos devolvieron HTTP 400 "Failed to download multimodal content". Eso es Alibaba fallando al descargar el archivo, no la ruta rechazando el vídeo. Con una URL que sí pudo descargar, 3.8-Max describió un clip de Big Buck Bunny con precisión, incluyendo nombrar al personaje, en 24.24s por $0.006528.
Dos notas prácticas antes de que construyas sobre esto. El vídeo se facturó como 696 tokens de prompt ordinarios para un clip de unos 10 segundos, y usage.prompt_tokens_details.video_tokens reportó 0, así que no puedes desglosar el costo del vídeo a partir de ese campo. Y una parte de contenido mal formada falla en silencio: enviar {"type": "video", "video": [url]} en lugar de video_url devolvió HTTP 200 con el modelo diciendo educadamente que no podía ver ningún vídeo, más una factura. Usa video_url.
Vale la pena saberlo: cuando le pedimos a 3.8-Max que describiera sus propias capacidades, respondió Input modalities: text. Eso es incorrecto, como demostró la siguiente prueba en nuestra propia ejecución. La autodescripción de un modelo es una salida de modelo de lenguaje, no una ficha técnica.
¿Qué Tan Bien Aguanta la Ventana de Contexto de 1M de Tokens?
Plantamos tres datos únicos al 10%, 50% y 90% de profundidad en relleno generado y pedimos los tres en una sola llamada. 18 de 18 agujas volvieron correctas a lo largo de seis ejecuciones en dos modelos, con tamaños de prompt de entre 5,723 y 247,911 tokens, calificados por coincidencia exacta de subcadena en código en lugar de leyendo las respuestas.
Nuestras ejecuciones de qwen3.8-max (las dos ejecuciones de qwen3.7-max en 83,380 y 247,873 tokens, y una ejecución de qwen3-max en 78,255, también devolvieron todas las agujas):
| Tokens de prompt (qwen3.8-max) | Latencia | Costo | Agujas encontradas |
|---|---|---|---|
| 5,723 | 9.24s | $0.01409 | 3 de 3 |
| 25,703 | 13.43s | $0.05453 | 3 de 3 |
| 83,418 | 17.63s | $0.16965 | 3 de 3 |
| 247,911 | 38.54s | $0.49828 | 3 de 3 |
La latencia escala de forma sublineal, que es la parte prácticamente útil: 43x más tokens de entrada cuestan solo 4.2x más tiempo total.
Ahora los límites honestos, porque este es el extremo fácil de la evaluación de contexto largo. Recuperar un dato plantado de forma literal dice muy poco sobre el razonamiento a través de un documento extenso, y probamos cada tamaño una sola vez. No ejecutamos una llamada de 1M de tokens. A $2.00 por millón de tokens de entrada, una habría costado unos $2.00, más que toda esta ejecución de pruebas, y una sola muestra no nos habría dicho mucho. El techo anunciado de 1M queda, por tanto, sin verificar por nosotros. Y 3.7-Max igualó exactamente a 3.8-Max en los dos tamaños que comparamos, así que la recuperación de contexto largo no es donde esta generación se separa.
Aquí salió a la luz una trampa de precios que la cobertura del lanzamiento pasa por alto por completo. qwen3-max tiene sobrescrituras de precio por niveles que duplican su tarifa por encima de 32,000 tokens de prompt y la vuelven a subir por encima de 128,000, mientras que 3.8-Max y 3.7-Max tienen tarifa plana en cualquier longitud. Confirmamos el nivel a partir de la facturación real: nuestra llamada de 78,255 tokens a qwen3-max se cobró a $0.12227, la tarifa de $1.56/M, no el titular de $0.78/M. A esa longitud cuesta casi exactamente lo mismo que 3.7-Max ($0.12523). Su precio de titular es menos de la mitad. Su precio real a 80k tokens está a un error de redondeo de distancia.
Las Cinco Puntuaciones de Benchmark de Alibaba, y Por Qué Ninguna Está Verificada
Alibaba publicó cinco puntuaciones de benchmark con el lanzamiento GA. Cada una de ellas proviene de las propias ejecuciones internas de Alibaba, y no encontramos ninguna evaluación independiente publicada a fecha de 2026-08-04. Esa frase merece estar al lado de los números, no tres párrafos por debajo de ellos.
| Benchmark | Puntuación reportada por Alibaba | ¿Verificado por un tercero? |
|---|---|---|
| Terminal-Bench 2.1 | 86.6 | No, a fecha de 2026-08-04 |
| GPQA Diamond | 92.6 | No, a fecha de 2026-08-04 |
| PaperBench | 93.0 | No, a fecha de 2026-08-04 |
| OSWorld-Verified | 86.1 | No, a fecha de 2026-08-04 |
| DeepSWE 1.1 | 56.6 (predecesor: 21.6) | No, a fecha de 2026-08-04 |
Alibaba también reportó un agregado interno de 0.725, subiendo desde 0.474, y posicionó el modelo cerca o por encima de Claude Opus 4.8, Fable 5 y GPT-5.6 Sol. También circularon posiciones de arena: 5.º en Text Arena y 2.º en Vision Arena según el propio anuncio de Alibaba del 2026-08-03, algo que no hemos reconfirmado en el leaderboard en vivo. Las posiciones de arena se mueven a diario. Trata cualquier posición que leas esta semana como una instantánea con una fecha encima.
Lo que nadie ha medido todavía, nosotros incluidos: rendimiento bajo concurrencia, desempeño en idiomas distintos al inglés, evaluaciones de seguridad y alineación, y fiabilidad en el uso de herramientas. Nuestras propias cifras cubren latencia, costo, modalidad y recuperación de contexto largo en una sola ruta, y nada más. El reportaje de lanzamiento de Bloomberg repitió las afirmaciones de benchmark sin pruebas independientes, que es donde se sitúa esencialmente toda la cobertura ahora mismo.
Para cifras que sí se han comprobado, nuestra comparativa de Qwen vs DeepSeek vs GLM es la mejor referencia, y Kimi K3, con unos 2.8T, es el rival de tamaño contra el que todo el mundo compara este modelo.
Qwen3.8 frente a Qwen3-8B, y el Giro de Pesos Abiertos Detrás de Este Lanzamiento
Qwen3.8 es el buque insignia de Alibaba con 2.4 billones de parámetros. Qwen3-8B es un modelo denso de 8 mil millones de parámetros de la serie Qwen3, descargable desde 2025. Nombres de aspecto parecido, con una diferencia de tamaño de unas 300x. Los motores de búsqueda todavía los confunden, y también lo hace un número sorprendente de respuestas en foros.
El problema de nomenclatura empeoró esta semana, no mejoró. Lo único en Hugging Face que lleva el nombre "Qwen3.8" ahora mismo son destilaciones comunitarias de 4B. Si buscas pesos y coges una de esas, estás descargando algo sin ninguna relación con el modelo de 2.4T.
Dos Buques Insignia Cerrados, y Luego Esto
La promesa de pesos abiertos es la verdadera noticia aquí, y se lee distinto una vez que ves el historial de la familia. Alibaba pasó dos generaciones manteniendo una división deliberada: caballos de batalla de pesos abiertos para todos, buque insignia cerrado en la cúspide.
| Generación | Pesos | Notas |
|---|---|---|
| Qwen 3.5 (0.8B a 397B-A17B) | Abiertos, Apache 2.0 | Familia completa publicada |
| Qwen 3.6 (27B denso, 35B-A3B MoE) | Abiertos, Apache 2.0 | Se mantuvo el mismo patrón |
| Qwen3.7-Max | Cerrados | Solo API. Sin GGUF, sin checkpoint en Hugging Face |
| Qwen3.8-Max | Prometidos abiertos, todavía no lanzados | "La próxima semana" a fecha de 2026-08-03. Licencia no anunciada |
Alibaba cerró el nivel insignia durante dos generaciones seguidas, y ahora dice que abrirá el modelo más grande que jamás ha construido. Si los pesos llegan como se prometió, eso es un giro real y pone presión sobre cada laboratorio que trata "el nivel de frontera se queda cerrado" como algo ya asentado. Si se retrasan, esto se convierte en el tercer lanzamiento Max cerrado seguido. Ambos desenlaces siguen abiertos a fecha de 2026-08-04. Vimos la misma dinámica con GLM 5.2, donde la licencia que finalmente se lanzó importó más que el anuncio.
¿Puedes Ejecutar Qwen3.8-Max Tú Mismo? (Sigue Siendo No)
No, y las especificaciones de la GA lo dejan más claro, no menos. Con 2.4 billones de parámetros totales, este no es un modelo que sirvas en tu propio hardware, ni siquiera después de que salgan los pesos. DeepSeek-V3.2, con 685B, ya es descrito por quienes lo han hecho como un auténtico proyecto de infraestructura. Esto es varias veces eso.
Entonces, ¿qué te da realmente un modelo de 2.4T con pesos abiertos?
- Los proveedores de inferencia pueden alojarlo, lo que significa competencia de precios, lo que significa que tu costo por token baja
- Los despliegues soberanos, regulados y aislados de red (air-gapped) se vuelven posibles en este nivel por primera vez
- Investigadores y quienes hacen fine-tuning obtienen un modelo base de escala de frontera con el que trabajar
- No significa que se ejecute en tu máquina, en tu único A100, o en el presupuesto de GPU de tu startup
Si quieres la aritmética de lo que realmente exige ejecutar modelos grandes de pesos abiertos, nuestra guía de requisitos de VRAM para LLM hace esas cuentas como es debido. La versión corta para este modelo: no lo hagas.
¿Deberías Cambiar, Probar o Esperar?
| Tu situación | Qué haríamos el 2026-08-04 |
|---|---|
| Tienes Qwen3.7-Max en producción | Prueba primero 3.8-Max con tráfico de prompts cortos. Ahí es donde apareció nuestra diferencia de costo de 4x. Luego revisa el manejo de max_tokens para el caso de respuesta vacía |
| Carga de trabajo de contexto largo o RAG intensivo | Quédate donde estás por ahora. 3.8-Max cuesta un 35.6% más por token e igualó exactamente a 3.7-Max en nuestra prueba de recuperación |
| Necesitas entrada de imagen o vídeo | Esta es la razón para migrar. 3.7-Max no puede aceptar una imagen en absoluto, y confirmamos el 404 |
| Estás esperando los pesos abiertos | Anota el 2026-08-10 en tu agenda. No hay nada que hacer hasta que exista una ficha de modelo y una licencia que leer |
| Estás contento con Claude o GPT | Nada cambia hoy. Las puntuaciones de benchmark de Alibaba no están verificadas, y unos números sin verificar no son un caso de migración |
El método importa más que el veredicto. Cada modelo que hemos probado en producción se ha comportado de forma distinta a su posición en el leaderboard, porque tus prompts, tu base de código y tu tolerancia a los reintentos no están en el benchmark de nadie. Dos tareas de codificación en nuestra ejecución lo demuestran: 3.8-Max y 3.7-Max obtuvieron ambos 11 de 11 en una tarea de truncamiento de ancho de cadena y ambos pasaron 5,000 de 5,000 casos aleatorizados de aritmética de fechas. En corrección no pudimos distinguirlos. La diferencia que medimos vive en la latencia y el gasto de tokens en prompts fáciles, no en la capacidad en los difíciles.
¿Estás sopesando una migración y quieres una segunda opinión sobre el modelo de costo? Deja que nuestro equipo lo ponga a prueba con tu carga de trabajo.
Todas las cifras verificadas el 2026-08-04. El precio, las posiciones de arena y el cronograma de los pesos cambian con frecuencia. Nuestras mediciones provienen de una sola ruta (OpenRouter hacia Alibaba), una máquina, un día, con n=3 para latencia y n=1 para la mayoría de las pruebas funcionales.
Preguntas Frecuentes
¿Es Qwen3.8-Max de código abierto?
No, a fecha de 2026-08-04. Solo está disponible por API. Alibaba ha programado los pesos para "la próxima semana" en Hugging Face y ModelScope, y no ha anunciado ninguna licencia. Los titulares que lo llaman de código abierto van por delante de los hechos. Una búsqueda en Hugging Face solo devuelve destilaciones de terceros de 4B, no una ficha de modelo de Alibaba.
¿Cuánto cuesta Qwen3.8-Max?
$2.00 por millón de tokens de entrada y $6.00 por millón de salida, con la entrada en caché reportada a $0.25. Eso es un 35.6% más que Qwen3.7-Max en ambos lados. Medimos una mediana de $0.001592 por llamada corta, aproximadamente 4x más barato que 3.7-Max con el mismo prompt, porque emite muchos menos tokens de razonamiento.
¿Cuántos parámetros tiene Qwen3.8-Max?
2.4 billones en total, según el anuncio de Alibaba y todos los medios que lo cubren. El número de parámetros activos es disputado: SiliconANGLE, The Decoder y Coursiv reportan ~95 mil millones activos, mientras que MarkTechPost afirma que Alibaba no lo reveló. La API no expone ningún campo de parámetros, así que no pudimos verificar ninguna de las dos cifras.
¿Qué ventana de contexto tiene Qwen3.8-Max?
La API en vivo reporta 1,000,000 de tokens de contexto y 131,072 tokens de finalización máximos. Probamos la recuperación hasta 247,911 tokens sin fallos. No ejecutamos una llamada de 1M de tokens, porque una habría costado unos $2.00 y habría excedido nuestro presupuesto de pruebas, así que el tope de esa ventana queda sin verificar por nosotros.
¿Qwen3.8-Max soporta entrada de imagen y vídeo?
Sí a ambas, y las verificamos. Leyó dígitos y un color correctamente a partir de un PNG generado localmente, y describió un vídeo con precisión cuando se le dio una URL que Alibaba pudo descargar. Qwen3.7-Max rechaza las imágenes de plano con un 404. Dos de nuestras tres URL de vídeo de prueba fallaron en el paso de descarga del proveedor.
¿Están verificadas de forma independiente las puntuaciones de benchmark de Qwen3.8-Max?
No. Terminal-Bench 2.1 con 86.6, GPQA Diamond con 92.6, PaperBench con 93.0, OSWorld-Verified con 86.1 y DeepSWE 1.1 con 56.6 provienen todas de las ejecuciones internas de Alibaba. A fecha de 2026-08-04 no encontramos ninguna evaluación de terceros publicada para ninguna de ellas.
¿Puedo ejecutar Qwen3.8-Max localmente?
De forma realista, no, ni siquiera cuando salgan los pesos. Con 2.4 billones de parámetros, es varias veces el tamaño de DeepSeek-V3.2, que ya es un auténtico proyecto de infraestructura para auto-alojar. Espera consumirlo a través de proveedores de inferencia en lugar de tus propias GPU, a menos que operes un centro de datos.
¿Debería migrar de Qwen3.7-Max a Qwen3.8-Max?
Depende de tu mezcla de tokens. En prompts cortos medimos 3.8-Max a aproximadamente una cuarta parte del costo y de cuatro a cinco veces la velocidad. En cargas de trabajo de entrada larga cuesta un 35.6% más y rindió de forma idéntica en nuestra prueba de recuperación. Si necesitas entrada de imagen o vídeo, 3.7-Max simplemente no puede hacerlo.
¿Cuándo se lanzan los pesos de Qwen3.8-Max?
Alibaba dijo "la próxima semana" en su anuncio del 2026-08-03, nombrando a Hugging Face y ModelScope como destinos. Sin fecha exacta, y sin texto de licencia. Se reporta que un modelo complementario de pesos abiertos, Qwen3.8-27B, se lanzará junto con ellos. Planeamos volver a comprobar el 2026-08-10.