Techsy
문의하기
시작하기
블로그로 돌아가기
ai-machine-learning

Qwen3.8-Max 출시: 2.4조 파라미터, 100만 컨텍스트, 그런데 가중치는 아직 없다

작성자 Mert Batur
수정일 Aug 4, 2026
13 분 읽기
목차
Qwen3.8-Max 출시: 2.4조 파라미터, 100만 컨텍스트, 그런데 가중치는 아직 없다

Qwen3.8-Max 출시: 2.4조 파라미터, 100만 컨텍스트, 그런데 가중치는 아직 없다

$1.4728. 알리바바가 출시한 다음 날인 2026-08-04, Qwen3.8-Max와 그 이전 두 모델에 걸쳐 40건의 실제 API 호출을 돌리는 데 든 비용이에요. 놀라운 건 2.4조 파라미터가 아니었어요. 진짜 놀라운 건 이거였어요. 3.8-Max는 Qwen3.7-Max보다 토큰당 가격이 35.6% 비싼데도, 답변당 비용은 오히려 약 4배 저렴했어요. 이유는 단순해요. 덜 오래 생각하니까요. 그리고 대부분의 출시 보도가 틀리고 있는 게 하나 더 있어요. 오픈소스가 아니에요. 적어도 오늘은요.

이 글은 Qwen3.8이 아직 사양도 공개되지 않은 프리뷰였던 2026-07-19에 처음 게시됐어요. 2026-08-04, GA(정식) 출시와 저희가 직접 진행한 API 테스트를 반영해 다시 썼어요.

핵심 요약

  • 2026-08-04 기준, Qwen3.8-Max는 API로만 제공돼요. 알리바바는 Hugging Face와 ModelScope에 가중치를 "다음 주", 즉 2026-08-10이 있는 주에 공개하겠다고 했어요.
  • 짧은 호출 1건당 $0.001592가 나왔는데, Qwen3.7-Max는 $0.006428이었어요. 토큰당 가격이 더 높은데도 이 결과가 나왔어요.
  • 알리바바가 공개한 5개 벤치마크 점수는 모두 벤더 자체 보고예요. 저희는 2026-08-04 기준으로 발표된 독립 평가를 찾지 못했어요.
  • 이미지와 비디오 입력은 실제로 새로 추가된 기능이에요. API에 직접 요청해서, 그리고 3.7-Max가 거부하는 걸 확인해서 검증했어요.

프리뷰와 GA 사이에 뭐가 바뀌었나

Qwen3.8-Max는 2026-08-03에 정식 출시(GA)됐어요. 이번 출시로 이 글이 2주 전에 나열했던 미해결 질문이 전부 답을 얻었어요. 프리뷰 시절에는 파라미터 수와 약속뿐이었어요. GA 출시에서는 확정된 100만 토큰 컨텍스트 윈도우, 텍스트+이미지+비디오 입력, 5개의 공개 벤치마크 점수, 그리고 토큰당 가격이 추가됐어요.

미해결이었던 항목들이 어떻게 정리됐는지 볼게요.

2026-07-19 당시 이 글이 적었던 내용2026-08-04 현재 상태
공개된 벤치마크 점수: 없음알리바바 보고 점수 5개 공개
활성 파라미터 / MoE 구성: 미공개활성 파라미터 약 95B, 스파스 MoE라고 널리 보도됨. 보도가 상충함, 아래 참고
컨텍스트 윈도우와 최대 출력: 미발표입력 100만, 출력 131,072, 실제 API로 확인
모달리티: 미발표텍스트+이미지+비디오 입력, 텍스트 출력. 직접 검증함
토큰당 가격: 미공개입력 $2.00 / M, 출력 $6.00 / M
오픈 웨이트 공개일: "곧", 날짜 없음"다음 주", Hugging Face와 ModelScope 명시
Qwen3.8-Max-Preview 서비스 중프리뷰 종료. GA 출시됨

한 가지는 아직 해결되지 않았어요. 파라미터 구성비는 여전히 논쟁 중이에요. MarkTechPost의 출시 기사는 알리바바가 활성 파라미터 수를 공개하지 않았다고 명확히 밝히는 반면, SiliconANGLE, The Decoder, Coursiv는 모두 약 950억이라고 보도하고 있어요. 저희는 2026-08-04에 MarkTechPost 기사를 다시 읽었는데 여전히 "미공개"라고 적혀 있었어요. 누군가의 취재원이 틀렸다는 건데, 솔직히 말씀드리면 출시 당일 이 특정 수치에 대한 보도가 서로 엇갈렸다는 것뿐이에요.

저희도 어느 쪽인지 확인할 수 없었어요. OpenRouter의 /models 응답에는 파라미터 수 필드 자체가 없어요. 그래서 저희 테스트로는 총 2.4T든 활성 95B든 확인도 반박도 할 수 없었어요.

Qwen3.8-Max는 오픈소스인가? 8월 4일 기준으로는 아니다

아니에요. 2026-08-04 기준 Qwen3.8-Max는 API로만 제공돼요. 알리바바는 Hugging Face와 ModelScope에 가중치를 "다음 주" 공개하겠다고 예고했지만, 라이선스는 아직 발표하지 않았어요. 언론 보도는 계속 "제공 가능"과 "오픈"을 뭉뚱그리고 있는데, 이 구분이 이 이야기의 전부예요. 헤드라인이 뭐라 하든, 오늘 다운로드할 수 있는 가중치는 없어요.

세 가지 서로 다른 상태가 한 단어로 뭉개지고 있어요. 이건 같은 게 아니에요.

상태2026-08-04 기준 Qwen3.8-Max
API로 제공예. Alibaba Cloud Model Studio, 그리고 리셀러·라우터를 통해서도
가중치 다운로드아니오. "다음 주"라고 예고됐지만 날짜는 없음
라이선스 조건미발표. 읽을 수 있는 문구 자체가 없음

저희는 누구 말만 믿지 않고 가장 확실한 증거를 직접 확인했어요. Qwen3.8을 검색한 Hugging Face 결과는 2026-08-04 기준 알리바바의 모델 카드를 하나도 보여주지 않아요. 대신 나오는 건 Qwen3.8_4B_Distilled라는 이름의 커뮤니티 업로드 4건과 그 변형들인데, 이건 서드파티 증류 모델이지 플래그십이 아니에요. 이 페이지를 대충 훑어보면 이걸 정식 출시물로 착각하기 쉬워요.

라이선스에 관해 한 가지 짚을게요. 전례가 계속 확정된 사실처럼 보도되고 있거든요. Qwen 3.5와 Qwen 3.6은 둘 다 Apache 2.0으로 출시됐어요. 하지만 2.4T급에서 제한적인 커뮤니티 라이선스가 적용된다면, 기술적으로는 "오픈 웨이트"라 해도 이 가중치로 무엇을 만들 수 있는지는 완전히 달라져요. 라이선스 문구가 나오기 전까지, 이 가중치로 뭘 할 수 있는지 단정하는 사람은 그냥 추측하는 거예요. 이게 바로 저희 2026년 운영해볼 만한 오픈소스 LLM 정리에 Qwen3.8-Max가 아직 들어가지 않은 이유예요. 아직 자격 요건을 충족하지 못했거든요.

저희가 측정한 것: 가격은 35.6% 올랐는데 호출당 비용은 4배 저렴

저희는 2026-08-04에 OpenRouter를 통해 qwen3.8-max, qwen3.7-max, qwen3-max에 대해 40건의 유료 호출을 실행했고, 총 지출은 $1.4728이었어요. 아래의 모든 비용은 반환된 usage 객체로부터 계산했고, OpenRouter 자체의 청구 금액과 대조 검증했어요. 전부 일치했어요. 핵심 발견은 가격 변화와 정반대 방향이었어요.

먼저 가격부터 볼게요. 2026-08-04 GET /models의 실시간 가격을 보면 3.8-Max는 백만 토큰당 입력 $2.00 / 출력 $6.00인 반면, 3.7-Max는 $1.475 / $4.425예요. 양쪽 모두 35.6% 인상이고, 비율도 동일해요(2.000/1.475 = 6.000/4.425 = 1.3559). 최신 수치는 OpenRouter 모델 페이지에서 직접 확인할 수 있어요.

이제 세 모델 모두에 동일한 간단한 프롬프트를 각각 3회씩, temperature: 0, 스트리밍으로 보냈어요.

모델첫 토큰(3회)실제 첫 콘텐츠전체 소요 시간(3회)완성 토큰이 중 추론 토큰호출당 중앙값 비용
qwen3.8-max2.249s / 0.874s / 1.054s5.414s / 5.058s / 4.209s6.338s / 6.734s / 5.130s242 / 287 / 243156 / 194 / 157$0.001592
qwen3.7-max4.871s / 1.157s / 1.670snever / 22.358s / 25.998s31.147s / 24.013s / 27.661s1502 / 1281 / 14431500 / 1174 / 1346$0.006428
qwen3-max2.617s / 2.892s / 2.386s2.617s / 2.892s / 2.386s4.401s / 4.601s / 4.081s105 / 105 / 1070 / 0 / 0$0.000431

첫 토큰 열이 두 개 필요한 이유는, 두 추론 모델 모두 답변 텍스트가 나오기 전에 숨겨진 추론 과정을 스트리밍하기 때문이에요. 3.8-Max는 3회 중 2회는 1초 안에 토큰이 도착하지만, 사용자가 실제로 읽을 수 있는 첫 단어는 4~5초 뒤에야 나와요. 3.7-Max는 1회차에서 아예 도착하지 않았어요. 추론 모델 위에 스트리밍 UI를 만든다면, 연결이 살아있다는 게 증명된 지 한참 지나도 로딩 스피너가 계속 돌아가는 거예요.

추론 토큰 열을 두 번 읽어보세요. 블룸 필터를 세 문장으로 설명해달라는 프롬프트에서, 3.7-Max는 추론 토큰을 1,1741,500개 썼어요. 3.8-Max는 156194개였고요. 같은 답변에 대해 대략 7배 덜 생각한 것이고, 추론 토큰은 출력 요율로 과금돼요. 그 결과 3.8-Max는 호출당 비용이 약 4배 저렴하고, 저희 회선(네트워크 왕복 포함)에서 벽시계 기준 4~5배 빨랐어요. 토큰당 가격은 35.6% 올랐는데 말이죠. 정가는 올랐는데 청구서는 줄어든 셈이에요.

프롬프트가 커지면 이 그래프는 뒤집혀요. 실측이 아니라 실시간 가격으로 모델링해보면, 입력 30,000토큰·출력 500토큰짜리 호출 1,000건 기준으로 3.8-Max는 $63.00, 3.7-Max는 $46.46이에요. 입력 100,000토큰이면 $203.00 대 $149.71이고요. 토큰 대부분이 입력이 되는 순간, 추론 효율의 이점은 가격 인상을 상쇄하지 못하고 3.8-Max가 셋 중 가장 비싸져요. 어떤 모델이 가장 저렴한지는 결국 입력 대 출력 비율에 달려 있는데, 이건 저희 LLM API 가격 비교가 계속 도달하는 결론과 같아요.

reasoning_effort는 새로 생겼고, 3.7-Max는 조용히 무시한다

reasoning_effort는 3.8-Max가 지원하는 파라미터 목록에는 있지만 3.7-Max에는 없어요. 3.8-Max에서는 이 값이 눈금을 소폭 움직여요. 각 3회씩 돌려본 결과 minimal은 추론 토큰 67, 108, 124개, high는 163, 136, 173개였어요. 같은 프롬프트, temperature 0 기준으로 중앙값은 108 대 163이에요.

돈이 나가는 발견은 구형 모델 쪽에 있었어요. 3.7-Max에 reasoning_effort: "low"를 보내면 거부되지 않고 그냥 받아들여진 뒤 무시돼요. 그 호출도 여전히 추론 토큰 1,401개를 태웠고, 저희가 로그로 남긴 동일 형태의 호출과 똑같이 $0.006689가 청구됐어요. 에러도, 경고도, 아무런 효과도 없었어요. 추론 강도를 낮춰서 비용을 조정하고 계시다면, 실제로 호출 중인 모델에서 그게 뭔가 작동하는지 반드시 확인하세요. 여기서는 미지원 파라미터가 소리 없이 실패하거든요.

마이그레이션 전에 반드시 확인해야 할 빈 응답 함정

첫 테스트 실행에서 max_tokens: 400을 썼는데 저희 스크립트가 죽었어요. 원인을 파보니 테스트 자체보다 더 값진 발견이었어요. Qwen3.7-Max는 토큰 예산 전체를 추론에 다 써버리고 빈 문자열을 반환할 수 있어요. finish_reason: "length"와 함께요. 물론 전액 청구되고요.

세 번 따로 마주쳤어요. max_tokens: 400에서는 완성 토큰 402개 중 400개가 추론이었고, 답변 문자는 0개, 그런데 $0.001822가 청구됐어요. max_tokens: 1500에서는 1,502토큰 중 1,500개가 추론, 답변 문자는 0개, 아무것도 없이 $0.006689가 나갔어요. 또 다른 호출에서는 $0.006735였고요. 에러도 예외도 없이, 그냥 내용이 비어 있는 유창해 보이는 응답 객체만 왔어요.

기존 3.7-Max 연동을 마이그레이션하는 중이고 코드에 적당한 max_tokens가 설정돼 있다면, 이 경로를 테스트할 시간을 확보하세요. 3.8-Max는 추론이 훨씬 짧아서 이 위험에 덜 노출돼 있지만, 완전히 면역인 건 아니에요.

아무도 언급하지 않는 작은 토큰 오버헤드

동일한 12단어 프롬프트를 셌더니 3.8-Max에서는 67 프롬프트 토큰, 3.7-Max에서는 29 프롬프트 토큰이 나왔어요. 모든 실행에서 일관됐고(qwen3-max에서는 27), 대략 38토큰의 고정 오버헤드로 보여요. 아마 시스템 프롬프트나 챗 템플릿이 더 큰 것 같아요. 100,000토큰짜리 RAG 호출에서는 반올림 오차 수준이지만, 짧은 프롬프트를 대량으로 쏘는 분류기라면 단어 하나 쓰기도 전에 입력 요금이 두 배 넘게 뛸 수 있어요.

Qwen3.8-Max는 정말 이미지와 비디오를 받을까?

네, 그리고 멀티모달 입력은 이번 세대에서 진짜로 새로 생긴 기능이지 재포장이 아니에요. API는 3.8-Max에 대해 text+image+video->text를 보고하고, 3.7-Max는 텍스트만 지원한다고 보고해요. 저희는 동일한 이미지를 양쪽에 보내서 차이를 검증했고, 구형 모델은 라우팅 단계에서 아예 거부했어요.

테스트 이미지는 직접 만든 PNG 인코더로 로컬에서 생성해서 정답을 미리 알고 있는 상태였어요. 750x270 픽셀, 흰 배경에 검은색 블록체 숫자 4739, 상단에 빨간색 가로 막대. Base64로 인코딩해서 보냈더니 qwen3.8-max는 DIGITS: 4739와 TOPBAR: red를 반환했어요. 두 항목 모두 정답이었고, 소요 6.99초, 비용 $0.002146이었어요. 동일한 요청을 qwen3.7-max에 보내자 HTTP 404 {"error":{"message":"No endpoints found that support image input"}}가 돌아왔어요.

비디오도 작동해요. 다만 실패로 보고할 뻔한 함정이 하나 있었어요. 저희가 시도한 공개 MP4 URL 3개 중 2개는 HTTP 400 "Failed to download multimodal content"를 반환했어요. 이건 알리바바 쪽에서 파일 다운로드에 실패한 것이지, 라우트가 비디오를 거부한 게 아니에요. 정상적으로 가져올 수 있는 URL로 시도했더니, 3.8-Max는 Big Buck Bunny 클립을 캐릭터 이름까지 포함해 정확히 묘사했고, 소요 24.24초, 비용 $0.006528이었어요.

실제로 구현하기 전에 알아둘 실무 팁 두 가지예요. 약 10초짜리 비디오는 일반 프롬프트 토큰 696개로 청구됐고, usage.prompt_tokens_details.video_tokens는 0으로 나와서 이 필드로는 비디오 비용을 따로 뽑아낼 수 없어요. 그리고 형식이 잘못된 콘텐츠 파트는 소리 없이 실패해요. video_url 대신 {"type": "video", "video": [url]}를 보냈더니 HTTP 200과 함께 모델이 정중하게 "비디오가 보이지 않는다"고 답했고, 요금은 그대로 청구됐어요. video_url을 쓰세요.

알아두시면 좋은 것 하나 더. 3.8-Max에게 자기 자신의 기능을 설명해달라고 했더니 Input modalities: text라고 답했어요. 이건 틀린 답이었고, 저희가 진행한 다음 테스트에서 그게 바로 증명됐어요. 모델의 자기소개는 언어모델 출력물일 뿐, 사양서가 아니에요.

100만 토큰 컨텍스트 윈도우는 실제로 얼마나 버틸까?

저희는 생성한 필러 텍스트의 10%, 50%, 90% 지점에 각각 고유한 사실 하나씩을 심어두고, 한 번의 호출로 셋 다 찾아내라고 요청했어요. 두 모델에 걸친 6회 실행에서 18개 needle 전부 정확히 돌아왔어요. 5,723부터 247,911토큰까지 다양한 프롬프트 크기에서, 답변을 사람이 읽는 게 아니라 코드로 정확한 부분 문자열 일치를 확인하는 방식으로 채점했어요.

저희 qwen3.8-max 실행 결과예요(qwen3.7-max 2회 실행: 83,380 및 247,873토큰, 그리고 qwen3-max 1회 실행: 78,255토큰도 needle을 전부 찾아냈어요):

프롬프트 토큰(qwen3.8-max)지연 시간비용발견된 needle
5,7239.24s$0.014093 of 3
25,70313.43s$0.054533 of 3
83,41817.63s$0.169653 of 3
247,91138.54s$0.498283 of 3

지연 시간은 준선형으로 늘어나요. 이게 실무적으로 유용한 부분이에요. 입력 토큰이 43배 늘었는데 소요 시간은 4.2배만 늘었어요.

이제 솔직한 한계를 말씀드릴게요. 이건 장문 컨텍스트 평가 중에서도 쉬운 축에 속해요. 심어둔 사실을 그대로 찾아내는 건 대형 문서를 가로지르는 추론 능력과는 거리가 멀고, 저희는 각 크기별로 딱 한 번씩만 테스트했어요. 저희는 100만 토큰짜리 호출은 실행하지 않았어요. 백만 입력 토큰당 $2.00이니, 한 번만 돌려도 약 $2.00이 들어 이번 테스트 전체보다 비쌌을 거고, 샘플 하나로는 어차피 얻을 정보도 많지 않았을 거예요. 그래서 홍보되는 100만 상한선은 저희 쪽에서는 검증되지 않았어요. 그리고 비교한 두 크기 모두에서 3.7-Max가 3.8-Max와 정확히 동일한 결과를 냈으니, 장문 컨텍스트 검색은 이번 세대의 차별점이 아니에요.

여기서 출시 보도가 완전히 놓치고 있는 가격 함정이 하나 드러났어요. qwen3-max는 32,000 프롬프트 토큰을 넘으면 요율이 두 배가 되고, 128,000을 넘으면 다시 한 번 오르는 계층형 가격 오버라이드가 있는 반면, 3.8-Max와 3.7-Max는 어떤 길이에서도 균일 요율이에요. 저희는 실제 청구 내역으로 이 계층 구조를 확인했어요. 78,255토큰짜리 qwen3-max 호출에는 $1.56/M 요율이 적용된 $0.12227이 청구됐고, 헤드라인에 나온 $0.78/M이 아니었어요. 이 길이에서는 3.7-Max 비용($0.12523)과 거의 정확히 같아요. 헤드라인 가격은 절반도 안 되지만, 8만 토큰 지점에서의 실제 가격은 반올림 오차 수준밖에 차이가 안 나요.

알리바바의 5개 벤치마크 점수, 그리고 왜 하나도 검증되지 않았나

알리바바는 GA 출시와 함께 5개의 벤치마크 점수를 공개했어요. 전부 알리바바 자체 내부 실행에서 나온 결과이고, 저희는 2026-08-04 기준으로 발표된 독립 평가를 찾지 못했어요. 이 문장은 아래 숫자 세 문단 밑이 아니라, 숫자 바로 옆에 있어야 마땅해요.

벤치마크알리바바 보고 점수제3자 검증 여부
Terminal-Bench 2.186.6No, as of 2026-08-04
GPQA Diamond92.6No, as of 2026-08-04
PaperBench93.0No, as of 2026-08-04
OSWorld-Verified86.1No, as of 2026-08-04
DeepSWE 1.156.6 (predecessor: 21.6)No, as of 2026-08-04

알리바바는 내부 종합 점수도 공개했는데, 0.474에서 0.725로 올랐다고 밝히며 Claude Opus 4.8, Fable 5, GPT-5.6 Sol과 비슷하거나 그 이상이라고 자리매김했어요. 아레나 순위도 함께 돌았는데, 알리바바 자체의 2026-08-03 발표에 따르면 Text Arena 5위, Vision Arena 2위였고, 저희는 이걸 실시간 리더보드에서 다시 확인하지는 못했어요. 아레나 순위는 매일 바뀌어요. 이번 주에 읽은 순위는 그날짜가 찍힌 스냅샷일 뿐이라고 생각하셔야 해요.

저희를 포함해 아직 아무도 측정하지 못한 게 있어요. 동시성 부하 하에서의 처리량, 비영어권 성능, 안전성·정합성 평가, 도구 호출 신뢰성이에요. 저희 수치는 하나의 경로에서 지연 시간, 비용, 모달리티, 장문 컨텍스트 검색만 다뤘고 그 이상은 다루지 않았어요. 블룸버그의 출시 보도는 독립적인 테스트 없이 벤치마크 주장을 그대로 반복했는데, 지금 대부분의 보도가 딱 이 상태예요.

검증된 숫자를 원하신다면 저희 Qwen vs DeepSeek vs GLM 비교가 더 나은 참고 자료이고, 약 2.8T 규모인 Kimi K3가 모두가 이 모델을 비교하는 체급 라이벌이에요.

Qwen3.8 vs Qwen3-8B, 그리고 이번 출시 뒤에 숨은 오픈 웨이트 반전

Qwen3.8은 알리바바의 2.4조 파라미터 플래그십이에요. Qwen3-8B는 Qwen3 시리즈의 밀집형 80억 파라미터 모델로, 2025년부터 다운로드가 가능했어요. 이름은 비슷해 보이지만 규모는 약 300배 차이가 나요. 검색 엔진은 여전히 둘을 혼동하고, 놀랍게도 상당수의 포럼 답변도 마찬가지예요.

이번 주 들어 이 이름 혼동 문제는 더 나아지기는커녕 더 심해졌어요. 지금 Hugging Face에서 "Qwen3.8"이라는 이름을 달고 있는 건 커뮤니티가 만든 4B 증류 모델뿐이에요. 가중치를 찾다가 이런 걸 하나 받으면, 2.4T 모델과는 아무 관련이 없는 걸 다운로드하는 거예요.

두 번의 폐쇄형 플래그십, 그리고 이번

여기서 진짜 뉴스는 오픈 웨이트 약속이고, 이 모델 가문의 역사를 보면 이야기가 다르게 읽혀요. 알리바바는 지난 두 세대 동안 의도적인 분리 전략을 써왔어요. 누구나 쓸 수 있는 오픈 웨이트 워크호스와, 최상위에는 폐쇄형 플래그십이요.

세대가중치비고
Qwen 3.5 (0.8B~397B-A17B)오픈, Apache 2.0전체 라인업 공개
Qwen 3.6 (27B 밀집형, 35B-A3B MoE)오픈, Apache 2.0동일한 패턴 유지
Qwen3.7-Max폐쇄API 전용. GGUF도, Hugging Face 체크포인트도 없음
Qwen3.8-Max오픈 예고, 아직 미공개2026-08-03 기준 "다음 주". 라이선스 미발표

알리바바는 두 세대 연속으로 플래그십 등급을 닫아뒀다가, 이제 자신이 만든 가장 큰 모델을 열겠다고 말하고 있어요. 가중치가 예고대로 나온다면 이건 진짜 반전이고, "최상위 프론티어급은 폐쇄로 남는다"를 당연시하던 모든 연구소에 압박이 될 거예요. 만약 미뤄진다면, 이건 3세대 연속 폐쇄형 Max 출시가 되는 거고요. 2026-08-04 현재 두 결과 모두 아직 살아있어요. 저희는 GLM 5.2에서도 똑같은 역학을 목격했는데, 거기서는 실제로 나온 라이선스가 발표 그 자체보다 더 중요했어요.

Qwen3.8-Max를 직접 돌릴 수 있을까? (여전히 아니오)

아니에요. GA 사양을 보면 오히려 더 명확해질 뿐이에요. 총 2.4조 파라미터라면, 가중치가 공개된 뒤에도 자체 하드웨어에서 서빙할 만한 모델이 아니에요. 685B급인 DeepSeek-V3.2조차 이미 직접 운영해본 사람들 사이에서 만만치 않은 인프라 프로젝트로 묘사되고 있어요. 이건 그것보다 몇 배는 더 커요.

그럼 오픈 웨이트 2.4T 모델은 실제로 뭘 가져다줄까요?

  • 추론 제공업체들이 이걸 호스팅할 수 있게 되고, 그러면 가격 경쟁이 붙고, 그러면 토큰당 비용이 내려가요
  • 이 규모에서 처음으로 소버린·규제·에어갭 배포가 가능해져요
  • 연구자와 파인튜너들은 프론티어급 베이스 모델을 확보하게 돼요
  • 여러분의 컴퓨터에서, 단일 A100에서, 스타트업의 GPU 예산으로 돌아간다는 뜻은 아니에요

대형 오픈 웨이트 모델을 실제로 돌리려면 뭐가 필요한지 계산해보고 싶으시다면, 저희 LLM VRAM 요구사항 가이드가 그 계산을 제대로 해드려요. 이 모델의 짧은 답은요. 하지 마세요.

갈아타야 할까, 테스트만 해볼까, 기다려야 할까?

지금 상황2026-08-04 기준 저희라면 이렇게 해요
프로덕션에서 Qwen3.7-Max 운영 중짧은 프롬프트 트래픽부터 3.8-Max로 테스트하세요. 저희 4배 비용 차이가 나타난 지점이 바로 거기예요. 그다음 max_tokens 처리가 빈 응답 케이스에 대응하는지 확인하세요
장문 컨텍스트나 무거운 RAG 워크로드지금은 그대로 두세요. 3.8-Max는 토큰당 35.6% 비싸고, 저희 검색 테스트에서는 3.7-Max와 완전히 동일한 결과였어요
이미지나 비디오 입력이 필요함이게 바로 갈아타야 할 이유예요. 3.7-Max는 이미지를 아예 받지 못하고, 저희는 그 404를 직접 확인했어요
오픈 웨이트를 기다리는 중2026-08-10을 달력에 표시해두세요. 모델 카드와 읽을 수 있는 라이선스가 나오기 전까지는 할 일이 없어요
Claude나 GPT로 만족하는 중오늘은 아무것도 바뀌지 않아요. 알리바바의 벤치마크 점수는 검증되지 않았고, 검증되지 않은 숫자는 마이그레이션의 근거가 못 돼요

방법론이 결론보다 더 중요해요. 저희가 프로덕션에서 테스트해본 모든 모델은 리더보드 순위와 다르게 움직였어요. 여러분의 프롬프트, 코드베이스, 재시도 허용 범위는 누구의 벤치마크에도 들어 있지 않으니까요. 저희 테스트에 있었던 코딩 과제 두 가지가 이 점을 잘 보여줘요. 3.8-Max와 3.7-Max 모두 문자열 폭 절단 과제에서 11 of 11을 맞혔고, 날짜 연산 퍼징 테스트에서도 5,000 of 5,000을 통과했어요. 정확도만 보면 둘을 구분할 수 없었어요. 저희가 측정한 차이는 쉬운 프롬프트에서의 지연 시간과 토큰 지출에 있었지, 어려운 문제에서의 성능이 아니었어요.

마이그레이션을 저울질 중이고 비용 모델을 다른 눈으로 검토받고 싶으시다면, 저희 팀에게 여러분의 워크로드로 직접 검증받아 보세요.

모든 수치는 2026-08-04에 검증됐어요. 가격, 아레나 순위, 가중치 공개 일정은 자주 바뀌어요. 저희 측정치는 단일 경로(OpenRouter를 통한 알리바바), 한 대의 머신, 하루 동안 진행됐고, 지연 시간은 n=3, 대부분의 기능 테스트는 n=1이에요.

자주 묻는 질문

Qwen3.8-Max는 오픈소스인가요?

2026-08-04 기준으로는 아니에요. API로만 제공돼요. 알리바바는 Hugging Face와 ModelScope에 가중치를 "다음 주" 공개하겠다고 예고했지만, 라이선스는 아직 발표하지 않았어요. 오픈소스라고 부르는 헤드라인들은 사실보다 앞서 있는 거예요. Hugging Face 검색 결과는 알리바바 모델 카드가 아니라 서드파티 4B 증류 모델만 보여줘요.

Qwen3.8-Max는 얼마인가요?

백만 입력 토큰당 $2.00, 출력 토큰당 $6.00이고, 캐시된 입력은 $0.25로 보고돼요. Qwen3.7-Max보다 양쪽 다 35.6% 비싸요. 짧은 호출 1건 기준 중앙값 $0.001592를 측정했는데, 동일 프롬프트에서 3.7-Max보다 약 4배 저렴해요. 추론 토큰을 훨씬 적게 쓰기 때문이에요.

Qwen3.8-Max의 파라미터는 몇 개인가요?

알리바바의 발표와 이를 보도하는 모든 매체에 따르면 총 2.4조 개예요. 활성 파라미터 수는 논쟁 중이에요. SiliconANGLE, The Decoder, Coursiv는 활성 약 950억이라고 보도하는 반면, MarkTechPost는 알리바바가 이를 공개하지 않았다고 밝혔어요. API에는 파라미터 필드 자체가 없어서 저희는 어느 쪽도 검증할 수 없었어요.

Qwen3.8-Max의 컨텍스트 윈도우는 어느 정도인가요?

실시간 API 기준으로 컨텍스트 1,000,000토큰, 최대 완성 131,072토큰이 보고돼요. 저희는 247,911토큰까지 검색을 테스트했고 실패는 없었어요. 100만 토큰짜리 호출은 실행하지 않았어요. 한 번 돌리는 데만 약 $2.00이 들어 저희 테스트 예산을 넘어섰기 때문이고, 그래서 그 윈도우의 최상단은 저희 쪽에서 검증되지 않았어요.

Qwen3.8-Max는 이미지와 비디오 입력을 지원하나요?

둘 다 지원하고, 저희가 직접 검증했어요. 로컬에서 생성한 PNG에서 숫자와 색상을 정확히 읽어냈고, 알리바바가 정상적으로 가져올 수 있는 URL이 주어지면 비디오도 정확히 묘사했어요. Qwen3.7-Max는 이미지를 404로 완전히 거부해요. 저희가 시도한 테스트 비디오 URL 3개 중 2개는 제공업체의 다운로드 단계에서 실패했어요.

Qwen3.8-Max의 벤치마크 점수는 독립적으로 검증됐나요?

아니요. Terminal-Bench 2.1 86.6, GPQA Diamond 92.6, PaperBench 93.0, OSWorld-Verified 86.1, DeepSWE 1.1 56.6 모두 알리바바의 내부 실행 결과예요. 2026-08-04 기준으로 저희는 이 중 어느 것에 대해서도 제3자 평가를 찾지 못했어요.

Qwen3.8-Max를 로컬에서 돌릴 수 있나요?

현실적으로는 아니에요. 가중치가 나와도 마찬가지예요. 총 2.4조 파라미터면 이미 만만치 않은 인프라 프로젝트로 꼽히는 DeepSeek-V3.2보다 몇 배는 더 커요. 데이터센터를 직접 운영하지 않는 이상, 자체 GPU가 아니라 추론 제공업체를 통해 이용하게 될 거예요.

Qwen3.7-Max에서 Qwen3.8-Max로 마이그레이션해야 하나요?

토큰 구성에 따라 달라요. 짧은 프롬프트에서는 3.8-Max가 비용은 약 4분의 1, 속도는 4~5배 빠른 것으로 측정됐어요. 입력이 긴 워크로드에서는 35.6% 더 비싸고, 저희 검색 테스트에서는 결과가 동일했어요. 이미지나 비디오 입력이 필요하다면 3.7-Max는 아예 지원하지 않아요.

Qwen3.8-Max의 가중치는 언제 공개되나요?

알리바바는 2026-08-03 발표에서 "다음 주"라고 밝히며 Hugging Face와 ModelScope를 공개처로 지목했어요. 정확한 날짜도 라이선스 문구도 없어요. 이와 함께 오픈 웨이트 동반 모델인 Qwen3.8-27B도 함께 나올 것으로 보도되고 있어요. 저희는 2026-08-10에 다시 확인할 계획이에요.

태그

qwen-3-8qwen3-8-maxopen-weight-llmalibaba-qwenllm-tooling

이 기사 공유하기

관련 글

더 많은 글 보기 ai-machine-learning

ai-machine-learning
Aug 4, 2026

Gitar AI 코드 리뷰: Sonar가 실제로 산 건 무엇인가 (2026년 리뷰)

Sonar는 2026년 5월 21일 Gitar를 인수했다. 이 리뷰는 CI로 검증된 자동 수정이 실제로 무엇을 하는지, 20달러·40달러 요금제, CodeRabbit과 Greptile을 이기는 지점, 그리고 건너뛰어야 할 정직한 이유를 다룬다.

10분 소요 분 읽기
읽어보기
ai-machine-learning
Aug 3, 2026

에이전트 툴 콜링 모범 사례: 에이전트가 잘못된 도구를 고르는 이유

에이전트가 잘못된 도구를 고르는 원인은 선택, 인자, 루프, 응답 크기라는 네 가지 지점에 있습니다. 이 가이드는 각 실패 모드를 먼저 진단한 뒤, 여덟 가지 에이전트 툴 콜링 모범 사례를 코드와 스키마, 변경마다 실행할 수 있는 평가 루프와 함께 연결합니다.

14분 읽기 분 읽기
읽어보기
ai-machine-learning
Aug 3, 2026

RAG vs 파인튜닝: 언제 무엇을 쓸까 (실제 수치 포함)

RAG는 쿼리 시점에 사실을 검색하고, 파인튜닝은 모델 가중치에 지식을 새깁니다. 162회 인용된 arXiv 논문이 같은 태스크에서 두 방식을 직접 비교했고, 승자는 대부분의 팀이 예상한 것과 다릅니다. 공개 가격 기준 실제 비용 계산과 결정 프레임워크를 정리했습니다.

14분 읽기 분 읽기
읽어보기
모든 글 보기
프로젝트 시작하기

새로운 것을 만들 준비가 되었다면 특별함은?

여러분의 비전을 현실로 만들어 보세요. 차이를 만드는 소프트웨어, 우리 팀이 함께 만들겠습니다.

30분 스코핑 미팅 예약프로젝트 보기

라이브러리에서 인기 있는 도구

Claude 스킬

전체 보기
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI 자동화

전체 보기
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

라이브러리에서 인기 있는 도구

Claude 스킬

전체 보기
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI 자동화

전체 보기
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

서비스

  • 엔터프라이즈 솔루션
  • 모바일 앱
  • 웹 애플리케이션

솔루션

  • CRM 시스템
  • AI 통합
  • ERP 솔루션
  • 음성 에이전트
  • 프로세스 자동화
  • 사이버 보안

라이브러리

  • 블로그
  • 포트폴리오

커뮤니티

  • AI 자동화
  • Claude 스킬

도구

  • 모바일 앱 비용 계산기
  • OpenAI / LLM API 비용 계산기
  • MVP 비용 계산기
  • 음성 AI 에이전트 비용 계산기

회사 소개

  • 소개
  • 파트너
  • 문의하기

법적 고지사항

  • 개인정보 처리방침
  • 서비스 약관
  • 쿠키 정책

서비스

  • 엔터프라이즈 솔루션
  • 모바일 앱
  • 웹 애플리케이션

솔루션

  • CRM 시스템
  • AI 통합
  • ERP 솔루션
  • 음성 에이전트
  • 프로세스 자동화
  • 사이버 보안

라이브러리

  • 블로그
  • 포트폴리오

커뮤니티

  • AI 자동화
  • Claude 스킬

도구

  • 모바일 앱 비용 계산기
  • OpenAI / LLM API 비용 계산기
  • MVP 비용 계산기
  • 음성 AI 에이전트 비용 계산기

회사 소개

  • 소개
  • 파트너
  • 문의하기
법적 고지사항개인정보 처리방침서비스 약관쿠키 정책
TECHSY
© 2026 Techsy. 무단전재 및 재배포 금지.