
Melhor LLM Open-Source de 2026: Testámos 8 — Apenas 3 Superam a Classe GPT-4
Última atualização: 5 de julho de 2026. Cada pontuação de benchmark, valor de VRAM e licença neste guia foi reverificada para esta atualização. O ranking abaixo reflete os modelos de pesos abertos lançados até meados de 2026 — se um novo lançamento alterar a ordem, esta página é atualizada dentro do mês.
O melhor LLM open-source de 2026 é o Qwen 3 235B-A22B para raciocínio e programação em geral, com o DeepSeek R1 a liderar no raciocínio matemático profundo e o Llama 4 Scout no contexto longo (10 milhões de tokens). Para uma única GPU de consumo, o Gemma 3 27B (16 GB de VRAM) e o Phi-4 14B (8 GB) são os mais fáceis de alojar localmente. Os três modelos de topo igualam o desempenho da classe GPT-4 em código e matemática, mantendo-se gratuitos para implementar.
Principais LLM Open-Source: Snapshot de Benchmarks
A tabela abaixo abrange cinco modelos open-source amplamente implementados, pontuados em benchmarks públicos standard. O MMLU mede conhecimento geral amplo; o HumanEval mede a taxa de sucesso na geração de código.
| Modelo | Parâmetros | Lançamento | MMLU | HumanEval | Licença | Melhor Para |
|---|---|---|---|---|---|---|
| Llama 3.3 70B | 70B | dez 2024 | 86.0 | 88.4 | Llama 3.3 Community | Uso geral, multilingue |
| Qwen 2.5 72B | 72B | set 2024 | 85.0+ | 86.6 | Qwen License | Matemática, programação, seguimento de instruções |
| DeepSeek-V3 | 671B (37B ativos) | dez 2024 | 87.1 | 82.6 | MIT | Uso geral, programação, custo-eficiente |
| Mistral Small 3.1 | 24B | mar 2025 | 80.6 | 88.4 | Apache 2.0 | Fluxos agênticos, visão, multilingue |
| Gemma 3 27B | 27B | mar 2025 | ~78.6 | 87.8 | Gemma Terms of Use | Implementação numa GPU, multimodal |
Atualizamos esta tabela mensalmente.
Os LLM open-source já não se limitam a "competir" com os modelos proprietários — em programação, matemática e tarefas de contexto longo, estão a vencer. A diferença entre uma fatura de API de 200$/mês e um modelo aberto alojado localmente nunca foi tão pequena.
Este ranking corta o hype. Cada modelo aqui é avaliado nos benchmarks que importam, no hardware de que realmente vai precisar e no caso de uso específico em que cada um brilha mais.
Resumo Rápido: Que LLM Open-Source Deve Escolher?
Precisa do melhor raciocínio absoluto? Vá de Qwen 3 235B ou DeepSeek R1. Quer correr algo numa única GPU? Gemma 3 27B ou Phi-4 14B. A processar documentos massivos? O contexto de 10 milhões de tokens do Llama 4 Scout não tem rival.
| Posição | Modelo | Parâmetros (Ativos) | Melhor Para | Licença | VRAM Mín. |
|---|---|---|---|---|---|
| n.º 1 | Qwen 3 235B-A22B | 235B (22B) | Raciocínio + programação | Apache 2.0 | ~132 GB (Q4) |
| n.º 2 | DeepSeek R1 | 671B (37B) | Raciocínio profundo + matemática | MIT | ~136 GB (Q4) |
| n.º 3 | Llama 4 Scout | 109B (17B) | Contexto longo (10M tokens) | Llama License | ~55 GB (Q4) |
| n.º 4 | DeepSeek V3 | 671B (37B) | Uso geral + programação | MIT | ~136 GB (Q4) |
| n.º 5 | Mistral Large 3 | 675B (41B) | Multilingue + empresarial | Apache 2.0 | ~140 GB (Q4) |
| n.º 6 | Gemma 3 27B | 27B (27B, denso) | Implementação numa GPU | Pesos abertos | ~16 GB (Q4) |
| n.º 7 | Phi-4 Reasoning | 14B (14B, denso) | Edge + dispositivos móveis | MIT | ~8 GB (Q4) |
| n.º 8 | GLM-4.7 | 355B (32B) | Fluxos agênticos de programação | MIT | ~130 GB (Q4) |
Os números de VRAM assumem quantização Q4. Os requisitos em precisão total são 2-4x superiores. Se é novo a correr modelos localmente, comece com o Gemma 3 ou o Phi-4 — são as opções mais amigas do hardware nesta lista.
Leaderboard de LLM Open-Source: Ranking de julho 2026
Em julho de 2026, o Qwen 3 235B-A22B lidera o nosso leaderboard de LLM open-source para raciocínio e programação em geral, com o DeepSeek R1 em segundo na matemática profunda e o Llama 4 Scout em terceiro no contexto longo. O ranking completo abaixo abrange os oito modelos pontuados neste guia, desde máquinas de data center até escolhas amigas do portátil.
| Posição | Modelo | Licença | Melhor para | VRAM Mín. |
|---|---|---|---|---|
| n.º 1 | Qwen 3 235B-A22B | Apache 2.0 | Raciocínio + programação | ~132 GB (Q4) |
| n.º 2 | DeepSeek R1 | MIT | Raciocínio profundo + matemática | ~136 GB (Q4) |
| n.º 3 | Llama 4 Scout | Llama License | Contexto longo (10M tokens) | ~55 GB (Q4) |
| n.º 4 | DeepSeek V3 | MIT | Uso geral + programação | ~136 GB (Q4) |
| n.º 5 | Mistral Large 3 | Apache 2.0 | Multilingue + empresarial | ~140 GB (Q4) |
| n.º 6 | Gemma 3 27B | Pesos abertos | Implementação numa GPU | ~16 GB (Q4) |
| n.º 7 | Phi-4 Reasoning | MIT | Edge + dispositivos móveis | ~8 GB (Q4) |
| n.º 8 | GLM-4.7 | MIT | Fluxos agênticos de programação | ~130 GB (Q4) |
Estes rankings refletem a nossa reverificação mensal de benchmarks, necessidades de hardware e termos de licença.
Agora vamos destrinçar o que torna cada modelo digno da sua atenção.
1. Qwen 3 235B-A22B, o Melhor LLM Open-Source Global
O Qwen 3 235B-A22B da Alibaba é o modelo a bater neste momento. É uma arquitetura Mixture-of-Experts com 235 mil milhões de parâmetros no total, mas apenas 22 mil milhões ativam-se por token, cortando o cómputo em cerca de 90% face a um modelo denso de qualidade semelhante.
O que distingue o Qwen 3 é o seu pensamento em modo duplo. Pode alternar entre um "modo de pensamento" para problemas complexos de matemática e programação (onde o modelo mostra a sua cadeia de raciocínio) e um "modo sem pensamento" rápido para respostas de chat velozes. Essa flexibilidade importa em produção.
Destaques de benchmarks:
| Benchmark | Pontuação Qwen 3 235B | Contexto |
|---|---|---|
| AIME 2024 | 85.7% | Matemática de nível competitivo |
| AIME 2025 | 81.5% | Problemas de matemática mais difíceis |
| LiveCodeBench v5 | 70.7% | Tarefas de programação reais |
| CodeForces | 2,056 | Programação competitiva |
| BFCL v3 | 70.8% | Chamada de funções |
Estes números colocam-no no mesmo patamar do DeepSeek R1, do o1 da OpenAI e do Gemini 2.5 Pro, com a diferença de que pode descarregá-lo, afiná-lo e implementá-lo onde quiser ao abrigo da Apache 2.0.
Requisitos de hardware: O modelo completo precisa de cerca de 132 GB de VRAM em quantização Q4. Isso é uma configuração multi-GPU — pense em cinco RTX 3090, três A40 ou uma máquina com dois H100. Não é barato, mas está bem ao alcance de uma startup ou laboratório de investigação. A família Qwen 3 inclui também variantes menores (32B, 14B, 8B, 4B) que correm em hardware de consumo.
Quem o deve usar: Equipas que precisam de raciocínio e programação de nível frontier mas querem ser donas da sua infraestrutura. É particularmente forte para cargas de trabalho multilingues com contexto de 256K e suporte para mais de 100 idiomas. Se planeia afinar um modelo para o seu domínio específico, a licença Apache 2.0 do Qwen 3 dá-lhe total liberdade.
2. DeepSeek R1 — Melhor para Raciocínio Profundo
O DeepSeek R1 mudou o jogo quando surgiu no início de 2025, provando que os modelos open-source podiam igualar o o1 da OpenAI em tarefas de raciocínio. A atualização R1-0528 levou as coisas ainda mais longe — a precisão no AIME 2025 saltou de 70% para 87.5%.
O segredo do modelo é a sua metodologia de treino. A DeepSeek criou primeiro o R1-Zero usando aprendizagem por reforço pura, sem aquecimento de fine-tuning supervisionado. O modelo desenvolveu espontaneamente raciocínio em cadeia de pensamento, autoverificação e comportamentos de retrocesso. Ensinou-se literalmente a verificar o seu próprio trabalho.
Destaques de benchmarks:
| Benchmark | Pontuação DeepSeek R1 | Contexto |
|---|---|---|
| AIME 2025 | 87.5% (R1-0528) | Olimpíada de matemática |
| GPQA Diamond | 71.5% | Ciência de nível de pós-graduação |
| SWE-bench | 49.2% | Engenharia de software real |
| HumanEval | 92.4% | Geração de código |
Requisitos de hardware: A mesma arquitetura MoE de 671B que o DeepSeek V3, pelo que estamos a falar de ~136 GB de VRAM em Q4. Mas aqui está o ângulo prático: a DeepSeek também lançou variantes destiladas de 1.5B, 7B, 14B, 32B e 70B parâmetros. O destilado de 32B corre numa única RTX 4090 e ainda supera muitos modelos maiores em tarefas de raciocínio.
Quem o deve usar: Qualquer pessoa a construir aplicações que exigem raciocínio passo a passo, prova de teoremas, depuração complexa de código, análise científica. As variantes destiladas são especialmente úteis se precisa de capacidades de raciocínio com orçamento limitado. Veja as melhores ferramentas para correr LLM localmente se quiser implementar os destilados menores no seu próprio hardware.
3. Llama 4 Scout, Melhor para Contexto Longo
O Llama 4 Scout da Meta trouxe algo genuinamente novo ao mundo open-source: uma janela de contexto de 10 milhões de tokens. Não é gralha. Pode alimentar-lhe uma base de código inteira, uma prateleira de artigos de investigação ou 20 horas de transcrição de vídeo num único prompt.
O Scout usa 16 especialistas MoE com apenas 2 ativos por token, dando-lhe 109B de parâmetros totais mas apenas 17B ativos. A Meta afirma que cabe num único H100 com quantização INT4, embora a janela de contexto de 10M obviamente exija mais memória para a cache KV.
Destaques de benchmarks:
| Benchmark | Pontuação Llama 4 Scout | Contexto |
|---|---|---|
| Needle-in-a-Haystack (10M) | 100% | Recuperação perfeita |
| MMLU | 79.6% | Conhecimento geral |
| HumanEval | 81.2% | Geração de código |
| DocVQA | 85.1% | Compreensão de documentos |
Essa pontuação perfeita no Needle-in-a-Haystack a 10M tokens é notável. A maioria dos modelos começa a perder informação bem antes dos 128K. O Scout usa uma abordagem nova de mascaramento de atenção interdocumentos que mantém fronteiras entre documentos mesmo dentro da sua enorme janela de contexto.
Requisitos de hardware: Em Q4, os pesos do modelo precisam de cerca de 55 GB de VRAM. Um único H100 (80 GB) dá conta dele confortavelmente. Para hardware de consumo, duas RTX 4090 (48 GB no total) conseguem gerir comprimentos de contexto mais curtos. O senão: usar realmente a janela de contexto completa de 10M exige uma enorme memória de cache KV por cima dos pesos do modelo. Na prática, a maioria das implementações auto-alojadas fica-se pelos 128K-256K tokens.
Quem o deve usar: Equipas a trabalhar com documentos massivos, análise jurídica, perguntas e respostas sobre repositórios de código, síntese de artigos de investigação. As capacidades multimodais (entrada de texto + imagem) também são fortes. Seja apenas realista quanto ao comprimento do contexto: o teto de 10M é real, mas vai precisar de hardware de nível servidor para o atingir.
4. DeepSeek V3 — Melhor LLM Open-Source de Uso Geral
Enquanto o DeepSeek R1 colhe as manchetes pelo raciocínio, o DeepSeek V3 é sem dúvida o modelo mais prático para o uso diário. É o cavalo de carga — rápido, capaz em todas as frentes e notavelmente eficiente para o seu tamanho.
O V3 partilha a mesma arquitetura MoE de 671B / 37B ativos que o R1, mas troca as cadeias de raciocínio profundo por tempos de resposta mais rápidos e capacidades gerais mais amplas. A atualização V3-0324 incorporou técnicas de aprendizagem por reforço do treino do R1, reforçando o raciocínio sem o custo de latência da cadeia de pensamento explícita.
Destaques de benchmarks:
| Benchmark | Pontuação DeepSeek V3 | Contexto |
|---|---|---|
| MMLU | 87.1% | Conhecimento geral |
| HumanEval | 82.6% | Geração de código |
| MATH | 90.2% | Raciocínio matemático |
| Janela de contexto | 128K | Suporte de documentos longos |
O DeepSeek V3 supera o GPT-4.5 em benchmarks de programação e matemática. A sua eficiência de treino é lendária — apenas 2.788 milhões de horas de GPU H800 para a corrida completa de pré-treino, uma fração do que modelos comparáveis exigem.
Requisitos de hardware: Idênticos ao R1 (~136 GB de VRAM em Q4). Para implementação prática, as versões quantizadas GGUF correm via llama.cpp ou Ollama em configurações multi-GPU de consumo.
Quem o deve usar: Se precisa de um modelo que trata de tudo — chat, programação, análise, tradução, sumarização — o V3 é a escolha mais equilibrada. Não vai bater o R1 no raciocínio difícil nem o Scout no comprimento de contexto, mas vai superar ambos nas cargas de trabalho de produção típicas, onde velocidade e versatilidade importam mais do que pontuações máximas de benchmark.
5. Mistral Large 3 — Melhor para Uso Multilingue e Empresarial
O Mistral Large 3 trouxe a Mistral de volta à fronteira. Com 675 mil milhões de parâmetros no total (41B ativos), é um modelo MoE completo lançado ao abrigo da Apache 2.0 — uma enorme mudança face à licença de investigação restritiva do Mistral Large 2.
O modelo foi treinado de raiz em 3.000 GPUs NVIDIA H200, e nota-se. Na LMSYS Chatbot Arena, ficou em n.º 2 entre os modelos abertos e n.º 6 no geral (incluindo os proprietários). O que o torna especialmente interessante para equipas europeias é a sua força multilingue — cerca de 85.5% de precisão num teste MMLU multilingue equilibrado.
Destaques de benchmarks:
| Benchmark | Pontuação Mistral Large 3 | Contexto |
|---|---|---|
| MMLU Multilingue | 85.5% | Conhecimento entre idiomas |
| LMSYS Arena | n.º 6 no geral | Ranking de preferência humana |
| AIME 2025 (variante 14B) | 85% | Raciocínio matemático |
| Janela de contexto | 128K | Suporte de documentos longos |
Um traço que distingue os modelos Mistral: são treinados para dizer "não sei" em vez de alucinar. Isso torna o Mistral Large 3 uma forte aposta para pipelines RAG e aplicações empresariais onde a precisão factual importa mais do que a produção criativa.
Requisitos de hardware: Com 675 mil milhões de parâmetros no total, as necessidades de VRAM são semelhantes às do DeepSeek (~140 GB em Q4). A Mistral oferece também a variante 14B Small 3, que cabe numa única GPU de consumo e bate bem acima do seu peso em raciocínio e programação.
Quem o deve usar: Empresas europeias que precisam de capacidades multilingues e soberania de dados. Equipas empresariais a construir sistemas RAG onde a redução de alucinações é crítica. A licença Apache 2.0 remove por completo o atrito comercial.
6. Gemma 3 27B, Melhor para Implementação numa Única GPU
O Gemma 3 27B da Google é o ponto ideal entre capacidade e acessibilidade. Com 27 mil milhões de parâmetros numa arquitetura densa, corre numa única RTX 4090 com quantização Q4. Sem configurações multi-GPU, sem hardware de nível servidor — apenas uma placa de gaming comum.
Não se deixe enganar pela contagem modesta de parâmetros. O Gemma 3 27B bate bem acima do seu peso, especialmente em tarefas multimodais. Trata tanto entrada de texto como de imagem, suporta mais de 140 idiomas e a sua janela de contexto de 130K é generosa para um modelo deste tamanho.
Destaques de benchmarks:
| Benchmark | Pontuação Gemma 3 27B | Contexto |
|---|---|---|
| MMLU | 78.6% | Conhecimento geral |
| DocVQA | 85.6% | Compreensão de documentos |
| MGSM | 74.3% | Matemática multilingue |
| ChartQA | 76.3% | Raciocínio visual |
Essas pontuações multimodais (DocVQA 85.6%, ChartQA 76.3%) competem com modelos 3-5x maiores. Para programadores que precisam de compreensão de imagem sem um cluster de GPU, o Gemma 3 é a escolha óbvia.
Requisitos de hardware: Cerca de 16 GB de VRAM em quantização Q4, 32 GB em Q8. Uma única RTX 4090 (24 GB) dá conta dele confortavelmente. Mesmo um MacBook Pro M2 com 32 GB de memória unificada consegue corrê-lo. Se está a seguir o nosso guia para correr LLM localmente, o Gemma 3 é um dos modelos mais fáceis com que começar.
Quem o deve usar: Programadores a solo, pequenas equipas e qualquer pessoa que quer um modelo multimodal capaz sem alugar GPUs na cloud. É também excelente para prototipagem — teste o seu pipeline no Gemma 3 localmente, depois escale para um modelo maior em produção se necessário. Para o modelo pequeno mais recente da Google, veja o nosso guia do Gemma 4 12B.
7. Phi-4 Reasoning, Melhor para Edge e Implementação com Recursos Limitados
O Phi-4 Reasoning da Microsoft prova que a contagem de parâmetros não é tudo. Com apenas 14 mil milhões de parâmetros, supera o destilado de 70B do DeepSeek R1 em vários benchmarks de raciocínio. O recentemente lançado Phi-4-reasoning-vision-15B acrescenta capacidades multimodais, pontuando 17% mais alto que o Gemma 3 12B em tarefas de raciocínio matemático-visual.
O segredo da família Phi-4 é a qualidade dos dados de treino. A abordagem da Microsoft prioriza dados curados e de alta qualidade em vez de escala bruta, e resulta — o Phi-4 pontua acima de 80% nos benchmarks MATH e MGSM, superando o Gemini Pro da Google e o GPT-4o-mini no raciocínio matemático.
Destaques de benchmarks:
| Benchmark | Pontuação Phi-4 | Contexto |
|---|---|---|
| MATH | 82.6% | Raciocínio matemático |
| HumanEval | 82.6% | Geração de código |
| MGSM | 80%+ | Matemática multilingue |
| MathVista (visão) | +17% vs Gemma 12B | Matemática visual |
Requisitos de hardware: Cerca de 8 GB de VRAM em Q4 — isso é uma GPU de portátil ou mesmo uma placa de desktop mais antiga. O modelo corre confortavelmente em MacBooks com Apple Silicon, tornando-o genuinamente portátil. Para implementação em edge, é um dos poucos modelos que consegue correr no dispositivo com latência razoável.
Quem o deve usar: Programadores mobile e edge, equipas a construir funcionalidades de IA no dispositivo e qualquer pessoa que precisa de raciocínio forte em hardware mínimo. O Phi-4 é também uma ótima escolha para avaliar modelos afinados, já que o seu pequeno tamanho torna as iterações de treino rápidas e baratas. A licença MIT significa sem restrições comerciais.
8. GLM-4.7 — Melhor para Programação Agêntica
O GLM-4.7 da Z.ai é construído de propósito para um caso de uso específico: fluxos de trabalho agênticos de programação onde o modelo precisa de raciocinar, usar ferramentas e manter o contexto ao longo de longas interações multi-passo.
A sua arquitetura é um MoE de 355B com 32B de parâmetros ativos, mas a funcionalidade em destaque é o seu sistema de pensamento em três níveis. Ao contrário da maioria dos modelos que reiniciam o seu processo de raciocínio a cada turno, o GLM-4.7 retém os blocos de pensamento ao longo de toda a conversa. Esse contexto de raciocínio persistente faz uma diferença real quando o modelo está a orquestrar tarefas de programação complexas e multi-passo.
Destaques de benchmarks:
| Benchmark | Pontuação GLM-4.7 | Contexto |
|---|---|---|
| SWE-bench | 73.8% | Engenharia de software real |
| HumanEval | 94.2% | Geração de código |
| Janela de contexto | 200K | Interações longas |
| Saída máx. | 131K tokens | Geração estendida |
Essa pontuação de 73.8% no SWE-bench é competitiva com o Claude Sonnet 4.5 — em tarefas de engenharia de software do mundo real, não em benchmarks sintéticos. E os 94.2% no HumanEval é a mais alta de qualquer modelo nesta lista.
Requisitos de hardware: Semelhante a outros modelos MoE grandes (~130 GB de VRAM em Q4). A janela de contexto de 200K e a saída máx. de 131K tornam-no faminto por memória durante longas sessões agênticas.
Quem o deve usar: Equipas de desenvolvimento assistido por IA a construir agentes de programação, ferramentas de depuração automatizada ou sistemas de revisão de código. Se está a escolher ferramentas de fine-tuning para um modelo focado em programação, o GLM-4.7 é uma base sólida. A licença MIT significa uso comercial total.
Melhor LLM Open-Source para Programação (julho 2026)
Para programação em julho de 2026, o GLM-4.7 é a escolha open-source de topo, pontuando 94.2% no HumanEval e 73.8% no SWE-bench — competitivo com o Claude Sonnet 4.5 em tarefas de software reais. Quer um modelo de programação forte em hardware de consumo? O destilado DeepSeek R1 32B corre numa única RTX 4090.
A ponderar o lançamento mais recente do GLM? Veja a nossa análise do GLM 5.2 para ver como se compara.
Como Escolher: Quadro de Decisão
O "melhor" modelo depende inteiramente das suas restrições. Use esta matriz para afunilar a sua decisão.
| Se Precisa de... | Escolha | Porquê |
|---|---|---|
| Melhor raciocínio global | Qwen 3 235B | Top em benchmarks de matemática, código e gerais |
| Cadeia de pensamento profunda | DeepSeek R1 | Raciocínio autocorretivo, 87.5% AIME |
| Janela de contexto massiva | Llama 4 Scout | 10M tokens, recuperação perfeita |
| Rápido de uso geral | DeepSeek V3 | Melhor rácio velocidade-qualidade |
| Multilingue empresarial | Mistral Large 3 | 85.5% MMLU multilingue, anti-alucinação |
| Uma única GPU de consumo | Gemma 3 27B | 16 GB VRAM, multimodal forte |
| Portátil ou dispositivo edge | Phi-4 14B | 8 GB VRAM, licença MIT |
| Agentes de programação | GLM-4.7 | 94.2% HumanEval, raciocínio persistente |
Ainda na dúvida? Comece aqui: Tem hardware multi-GPU? Se não, as suas escolhas são Gemma 3 e Phi-4. Se sim, está a construir um agente de programação? Escolha GLM-4.7 ou DeepSeek R1. Precisa de contexto longo? Llama 4 Scout. Tudo o resto? O Qwen 3 235B é a predefinição mais segura.
Como Classificámos Estes Modelos
Os rankings não se baseiam num único benchmark. Cada modelo foi avaliado em cinco dimensões:
- Desempenho em benchmarks — MMLU, HumanEval, AIME, SWE-bench e testes específicos de domínio
- Acessibilidade de hardware — Conseguem equipas reais implementá-lo de facto?
- Liberdade de licença — Apache 2.0 e MIT pontuam mais alto que licenças restritivas
- Maturidade do ecossistema — Disponível na Hugging Face, Ollama, vLLM e principais motores de inferência
- Adoção no mundo real — Comunidade ativa, implementações em produção, atualizações contínuas
Modelos que pontuam bem em benchmarks mas exigem um cluster de GPU que ninguém tem (estamos a olhar para ti, 671B em precisão total) são penalizados. Modelos com licenças restritivas que bloqueiam o uso comercial também perdem pontos. O objetivo é valor prático, não direitos de gabarolice no leaderboard.
Se quiser testar estes modelos você mesmo, o nosso guia de avaliação de LLM percorre a configuração de benchmarks sistemáticos, e o resumo das melhores ferramentas de avaliação cobre as frameworks de que vai precisar.
FAQ
Quais são os LLM open-source mais recentes de 2026?
A fronteira de 2026 é liderada pelo Qwen 3 (Alibaba), DeepSeek R1 e V3, Llama 4 Scout (Meta), Mistral Large 3 e GLM-4.7 (Z.ai). Lançamentos pontuais como o DeepSeek R1-0528 e a variante Phi-4 reasoning-vision chegaram até meados de 2026. Reverificamos esta lista mensalmente e atualizamos o leaderboard sempre que um novo lançamento altera o ranking.
Com que frequência é atualizado este leaderboard de LLM open-source?
Mensalmente. Reverificamos as pontuações de benchmarks, os requisitos de VRAM e as licenças no início de cada mês e acrescentamos novos modelos à medida que são lançados. A data de "Última atualização" sob o título reflete a revisão mais recente.
Qual é o melhor LLM open-source de 2026?
O Qwen 3 235B-A22B lidera atualmente na mais ampla gama de benchmarks, combinando raciocínio, programação e capacidades multilingues de topo ao abrigo de uma licença Apache 2.0. Para casos de uso específicos, o DeepSeek R1 (raciocínio) e o Llama 4 Scout (contexto longo) podem ser escolhas melhores.
Posso correr LLM open-source em hardware de consumo?
Sim. O Gemma 3 27B corre numa única RTX 4090 (24 GB de VRAM) e o Phi-4 14B cabe numa GPU de portátil com 8 GB. Versões quantizadas (Q4, Q8) de modelos maiores também funcionam em configurações multi-GPU de consumo usando ferramentas como Ollama e llama.cpp.
Os LLM open-source são tão bons como o ChatGPT ou o Claude?
Em benchmarks de programação e matemática, os melhores modelos open-source igualam ou batem o GPT-4.5 e aproximam-se do desempenho do Claude Sonnet 4.5. A diferença é mais estreita em tarefas estruturadas (código, matemática, raciocínio) e mais larga em escrita criativa e seguimento de instruções com nuances.
O que significa MoE (Mixture-of-Experts) para o hardware?
Os modelos MoE têm uma contagem total de parâmetros grande, mas apenas ativam uma fração por token. No entanto, o modelo inteiro tem de ser carregado em memória para que o router possa selecionar os especialistas. Um modelo MoE de 235B com 22B ativos ainda precisa de VRAM equivalente a 235B — não poupa memória, poupa cómputo.
Qual é o melhor LLM open-source para programação?
O GLM-4.7 lidera com 94.2% no HumanEval e 73.8% no SWE-bench. Para geração de código pura, o DeepSeek R1 e o Qwen 3 235B estão logo atrás. Para programação em hardware de consumo, o destilado DeepSeek R1 32B é o melhor rácio de capacidade para custo.
O Llama 4 Scout tem mesmo 10 milhões de tokens de contexto?
A arquitetura suporta-o, e a Meta demonstrou recuperação perfeita no Needle-in-a-Haystack a 10M tokens. Mas usar realmente o contexto completo exige uma enorme memória de cache KV. A maioria das implementações auto-alojadas fica-se realisticamente pelos 128K-256K tokens. Fornecedores cloud como a Together AI e a Fireworks oferecem janelas de contexto mais longas.
Que licença devo procurar num LLM open-source?
Apache 2.0 e MIT são as mais permissivas — uso comercial, modificação e redistribuição totais. A licença personalizada da Llama permite uso comercial mas tem restrições para aplicações com mais de 700M de utilizadores. Alguns modelos de "pesos abertos" (como o Gemma) têm termos específicos — leia sempre a licença antes da implementação em produção.
De quanta VRAM preciso para um modelo de 70B?
Em quantização Q4, um modelo denso de 70B precisa de cerca de 35-40 GB de VRAM. Um único A100 (80 GB) dá conta dele facilmente, ou duas RTX 4090 (48 GB no total). Em precisão total (BF16), estamos a falar de mais de 140 GB, exigindo efetivamente quatro A100 ou equivalente.
Posso fazer fine-tuning de LLM open-source para o meu caso de uso?
Absolutamente. O QLoRA torna possível afinar um modelo de 70B numa única GPU de 24 GB. Modelos menores como o Phi-4 e o Gemma 3 são ainda mais acessíveis para experiências de fine-tuning. Modelos com licença Apache 2.0 e MIT não têm restrições sobre trabalhos derivados.
E quanto a LLM open-source multimodais?
O Gemma 3 27B e o Llama 4 Scout ambos tratam nativamente entrada de texto e imagem. O Phi-4-reasoning-vision-15B acrescenta raciocínio visual numa escala menor. Para compreensão de vídeo, o Llama 4 Scout suporta até 20 horas de entrada de vídeo dentro da sua janela de contexto.
Qual é o melhor LLM open-source neste momento?
Neste momento, o Qwen 3 235B-A22B é o melhor LLM open-source no geral, liderando em raciocínio e programação ao abrigo de uma licença Apache 2.0. Para uma única GPU de consumo, o Gemma 3 27B (16 GB de VRAM) é a escolha de topo, e o GLM-4.7 vence para agentes de programação com 94.2% no HumanEval.
Existe um leaderboard de LLM open-source?
Sim. O nosso leaderboard de julho de 2026 acima classifica os oito modelos deste guia, e a Hugging Face aloja o Open LLM Leaderboard gerido pela comunidade para uma cobertura mais ampla. Reverificamos os nossos rankings mensalmente contra benchmarks como MMLU, HumanEval, AIME e SWE-bench.
Escolher uma ferramenta é a metade fácil. Fazê-la correr de forma fiável dentro de um produto real é onde a maioria das equipas encrava, e é exatamente isso que a nossa equipa de integração de IA constrói para clientes, desde pipelines RAG até agentes personalizados. Quer uma segunda opinião sobre a sua stack? Obtenha uma consulta gratuita.