
Bir LLM'i şu an kendi makinenizde çalıştırabilirsiniz -- API anahtarı yok, aylık fatura yok, verileriniz donanımınızı terk etmiyor. Yerel LLM alanı patlama yaşadı: kurumsal yapay zeka inferansının %55'i artık şirket içinde gerçekleşiyor; bu oran 2023'te %12'ydi. Ollama gibi araçlarla, sıfırdan çalışan bir modele geçmek sıfır API maliyetiyle 5 dakikadan az sürüyor.
Bu rehber normalde beş ayrı makalede arayacağınız şeyleri bir araya getiriyor: donanım gereksinimleri, model seçimi, araç karşılaştırması, adım adım kurulum ve üretim ortamına dağıtım -- hepsi tek bir yerde.
Bir Bakışta: Yerel LLM'ler Hızlı Özet
Derine dalmadan önce, 60 saniyede genel tablo:
| Konu | Kısa Yanıt |
|---|---|
| En kolay başlangıç | ollama run llama3.3 (tek komut) |
| Geliştiriciler için en iyi araç | Ollama (CLI, OpenAI uyumlu API) |
| Kodlamayanlar için en iyi araç | LM Studio (GUI, tek tıkla indirme) |
| 7B modeller için minimum GPU | 8 GB VRAM (veya Mac'te 8 GB birleşik bellek) |
| En iyi bütçe GPU | RTX 4060 Ti 16 GB (~13.000 ₺) |
| Genel en iyi GPU | RTX 4090 24 GB (fiyat/performans şampiyonu) |
| En iyi genel model | Llama 3.3 8B (Q4_K_M kuantizasyon) |
| En iyi kodlama modeli | Qwen 3 7B |
| Maliyet vs bulut API | ~0 ₺/ay yerel vs ~650-3.250 ₺/ay API |
| Gizlilik garantisi | %100 -- veriler makinenizi asla terk etmez |
Şimdi kurulumunuz için doğru kararları verebilmeniz adına bunların her birini ayrıntılı inceleyelim.
Neden Bir LLM'i Yerel Olarak Çalıştırırsınız?
LLM'leri kendi donanımınızda çalıştırmanın dört gerçek nedeni var -- ve ne zaman yapmamanız gerektiğine dair bir dürüst uyarı.
Gizlilik ve Veri Egemenliği
Yerel olarak çalıştırdığınızda, promptlarınız, verileriniz ve çıktılarınız asla üçüncü taraf bir sunucuya dokunmuyor. Nokta. Bu bir pazarlama iddiası değil -- mimaridir. Ele geçirilecek bir ağ çağrısı yok, bir sağlayıcıya verileriniz üzerinde eğitim hakkı tanıyan hizmet şartları yok.
Bu durum düzenlenmiş sektörlerde son derece önemli. Sağlık kuruluşları HIPAA uyumluluğuna ihtiyaç duyuyor. Finans şirketleri gizli müşteri verilerini işliyor. Devlet kurumları sınıflandırılmış bilgilerle çalışıyor. Kurumsal yapay zeka inferansının %55'i artık şirket içinde gerçekleşiyor, çünkü bulut yapay zeka uyumluluk yükü son derece ağır.
Maliyet Ortadan Kaldırma
Bulut API fiyatları hızla birikiryor. Aynı iş yükünün gerçekte ne kadara mal olduğu:
| Sağlayıcı | 1M Token Başına Maliyet | Gizlilik | Gecikme (Tek Kullanıcı) |
|---|---|---|---|
| OpenAI GPT-4o | ~175-525 ₺ | Veriler OpenAI'ya gidiyor | ~1-2s |
| Anthropic Claude 3.5 | ~105-525 ₺ | Veriler Anthropic'e gidiyor | ~1-2s |
| Yerel Llama 3.3 8B | 0 ₺ (yalnızca donanım) | %100 özel | ~30-50ms |
| Yerel Qwen 3 7B | 0 ₺ (yalnızca donanım) | %100 özel | ~30-50ms |
Tek seferlik ~13.000 ₺'lik GPU yatırımı, 650-3.250 ₺/aylık API maliyetlerinin yerini alıyor. Orta düzey bir kullanıcıysanız 4-6 ayda başa baş geliyorsunuz. Ondan sonra her token ücretsiz.
Tek Kullanıcı için Hız
İnsanları şaşırtan bir şey: yerel inferans tek bir kullanıcı için genellikle bulut API'larından daha hızlı. Ağ round-trip'ini tamamen atlıyorsunuz. İyi yapılandırılmış bir yerel kurulum, bulut API'sinden 1-2 saniyeye karşı 40 ms'nin altında ilk token gecikmesi sunuyor. Hız sınırı yok, kesinti yok, yoğun saatlerde sıra bekleme yok.
Kontrol ve Özelleştirme
Modelleri kendi verilerinizle ince ayarlayın. Platform kısıtlamaları olmadan özel sistem promptları oluşturun. Tamamen çevrimdışı çalışın -- uçakta, sahada, nerede olursa olsun. Satıcı bağımlılığı olmadan daha iyi bir şey çıktığında model veya araç değiştirirsiniz.
Dürüst Uyarı
Bulut API'ları hâlâ üç senaryoda kazanıyor: GPT-4 düzeyinde akıl yürütmeye ihtiyaç duyuyorsunuz (yerel modeller yaklaşıyor ama henüz orada değil), GPU yönetmeden devasa çok kullanıcılı verim istiyorsunuz ya da donanımla uğraşmak istemiyorsunuz. Geri kalan her şey için yerel kazanıyor.
Sonuç: Hassas veri işliyorsanız, öngörülebilir maliyetler istiyorsanız veya API hız sınırlarından nefret ediyorsanız, yerel çalıştırma mantıklı bir seçimdir.
LLM'leri Yerel Çalıştırmak İçin Hangi Donanıma İhtiyacınız Var?
VRAM darboğazdır. Nokta. Tamamen GPU belleğine sığan bir model, sistem RAM'ine taşan birinden yaklaşık 10 kat daha hızlı çalışıyor. Kural: Q4 kuantizasyonda milyar parametre başına yaklaşık 0,5-1 GB VRAM hesaplayın.
PC GPU Önerileri
| Bütçe | GPU | VRAM | Maks Model Boyutu | Yaklaşık TPS | En İyisi |
|---|---|---|---|---|---|
| 0 ₺ (mevcut) | Yalnızca CPU | Yok | 7B (çok yavaş) | 2-5 | Yalnızca test |
| 6.500-9.750 ₺ | RTX 3060 12 GB | 12 GB | 7-13B | 15-25 | Hobi kullanıcısı |
| 11.500-16.250 ₺ | RTX 4060 Ti 16 GB | 16 GB | 13-34B (kuantize) | 20-35 | Tatlı nokta |
| 16.250-26.000 ₺ | RX 7900 XTX 24 GB | 24 GB | 34B / 70B Q4 | 25-40 | AMD değer seçimi |
| 32.500-48.750 ₺ | RTX 4090 24 GB | 24 GB | 34B / 70B Q4 | 40-60 | Fiyat/performans şampiyonu |
| 65.000 ₺+ | RTX 5090 32 GB | 32 GB | 70B Q4 rahat | 50-80 | Tüketici tavanı |
Performans verileri, Ubuntu 24.04'te CUDA 12.8 ile standartlaştırılmış llama.cpp llama-bench kullanılarak Hardware Corner'ın GPU kıyaslamalarından alınmıştır.
Apple Silicon Önerileri
Apple Silicon'un birleşik belleği burada gerçek bir avantaj. GPU ve CPU aynı RAM havuzunu paylaşıyor, bu nedenle 128 GB birleşik bellekli bir M4 Max, PC'de 65.000 ₺+ ayrık GPU gerektiren modelleri çalıştırabiliyor.
| Çip | Maks Birleşik Bellek | Maks Model Boyutu | Yaklaşık TPS | Fiyat Aralığı |
|---|---|---|---|---|
| M1/M2 | 16-24 GB | 7-13B | 10-20 | 26.000-39.000 ₺ (ikinci el) |
| M3 Pro | 18-36 GB | 13-34B | 15-30 | 52.000-71.500 ₺ |
| M4 Pro | 24-48 GB | 34B / 70B Q4 | 25-45 | 58.500-81.250 ₺ |
| M4 Max | 64-128 GB | 70B+ / 120B Q4 | 35-55 | 97.500-162.500 ₺ |
| M4 Ultra | 192-256 GB | 120B+ FP16 | 40-65 | 162.500 ₺+ |
Pratik bir not: modeller diskte 4-40 GB yer kaplıyor. Birden fazla modelle denemek planlıyorsanız bir SSD'de (tercihen NVMe) en az 100 GB boş alan bırakın.
Sonuç: Elinizdeyle başlayın -- bir CPU bile 7B modeli test için çalıştırabilir. Ciddi günlük kullanım için RTX 4060 Ti 16 GB (~13.000 ₺) veya M4 Pro Mac tatlı noktalardır.
Yerel Olarak Hangi Modelleri Çalıştırmalısınız?
Tüm modeller eşit değildir ve "en iyi model" tamamen ne için kullandığınıza bağlıdır. İşte karmaşıklığı ortadan kaldıran bir karar tablosu:
| Kullanım Durumu | En İyi Model | Parametre | Min VRAM | Neden Bu Model |
|---|---|---|---|---|
| Genel sohbet | Llama 3.3 8B | 8B | 6 GB | En iyi her şeyci, Meta'nın amiral gemisi açık modeli |
| Kodlama asistanı | Qwen 3 7B | 7B | 5 GB | En iyi kodlama kıyaslamaları, güçlü çok dilli destek |
| Çok dilli | Qwen 3 7B | 7B | 5 GB | 29 dil, en iyi İngilizce dışı performans |
| Kısıtlı donanım | Phi-4-mini | 3,8B | 3 GB | Microsoft'un en küçüğü, şaşırtıcı derecede yetenekli |
| Maksimum kalite | Llama 3.3 70B (Q4) | 70B | 24 GB | Yerel olarak GPT-4 sınıfına en yakın |
| Uzun bağlam | Mistral Small 3 | 24B | 16 GB | 128K bağlam penceresi |
| Akıl yürütme | DeepSeek-R1 7B | 7B | 5 GB | Zincir düşünce akıl yürütme |
Bunların tümü GGUF formatında mevcut -- yerel LLM dosyaları için evrensel standart. Açık ağırlıklı modelleri indirmek için birincil merkez olan Hugging Face'te bulabilirsiniz. Yerel kullanıma hazır kuantize versiyonları bulmak için herhangi bir model adını "GGUF" ile aratın.
Sık sorulan bir soru: "ChatGPT'yi yerel olarak çalıştırabilir miyim?" Hayır -- ChatGPT, OpenAI'nin tescilli ürünüdür. Ancak Llama 3.3 ve Qwen 3 çoğu günlük görev için karşılaştırılabilir kalite sunuyor ve tamamen donanımınızda çalışıyor.
Sonuç: Llama 3.3 8B ile başlayın. Kullanım durumlarının %80'ini iyi karşılıyor. Kodlama için Qwen 3'e, daha fazla güç gerektiğinde Llama 3.3 70B'ye geçin.
Kuantizasyon Nedir (Ve Neden Önemlidir)?
Kuantizasyon, LLM'leri yerel olarak çalıştırmak için en önemli kavramdır. Model ağırlık hassasiyetini azaltır -- örneğin 16 bitlik kayan nokta sayıdan 4 bitlik tam sayıya -- böylece daha büyük modeller daha az VRAM'e sığar.
Bunu ses kalitesi gibi düşünün: kayıpsız bir FLAC dosyası devasa ama mükemmeldir. 320 kbps'lik bir MP3 boyutun çok küçük bir parçasıdır ve çoğu dinleyici için neredeyse ayırt edilemez. Q4_K_M kuantizasyonu 320 kbps MP3'ünüzdür -- standart kıyaslamalarda %3'ün altında kalite kaybıyla %75 daha az VRAM.
GGUF (General GGML Universal Format), bunu mümkün kılan dosya formatıdır. Eski GGML formatının yerini aldı ve artık Ollama, LM Studio ve llama.cpp tarafından kullanılan evrensel standarttır. GGUF dosyaları bağımsız, mimariden bağımsız ve belleğe eşlenebilir -- yani araçlar bunları ayrıştırma yükü olmadan verimli şekilde yükleyebilir. Tam özellik açık ve iyi belgelenmiştir.
| Kuantizasyon Seviyesi | VRAM (8B Model) | VRAM (70B Model) | FP16'ya Karşı Kalite | En İyisi |
|---|---|---|---|---|
Q4_K_M | ~5 GB | ~24 GB | %97-98 | Günlük kullanım (önerilen) |
Q5_K_M | ~6 GB | ~30 GB | %98-99 | Kaliteye duyarlı görevler |
Q8_0 | ~9 GB | ~45 GB | %99+ | Maksimum kalite, yeterli VRAM |
FP16 | ~16 GB | ~140 GB | %100 (temel) | Araştırma, ince ayar |
Ollama'dan bir model indirdiğinizde varsayılan olarak Q4_K_M alırsınız -- ve bu çoğu kişi için doğru seçimdir. İleri düzey kullanıcılar kuantizasyonu açıkça belirtebilir: ollama pull llama3.3:70b-q4_K_M.
Sonuç: Fazla VRAM'iniz olmadıkça her şey için Q4_K_M kullanın. Görevlerin %95'inde kalite farkı fark edilemez.
LLM'leri Yerel Çalıştırmak İçin Hangi Aracı Kullanmalısınız?
Araç ortamı hızla olgunlaştı. İşte önemli altı araç, yan yana karşılaştırılmış olarak:
| Araç | Tür | Platformlar | API Sunucusu | GPU Desteği | En İyisi |
|---|---|---|---|---|---|
| Ollama | CLI + Sunucu | Mac, Linux, Windows | OpenAI uyumlu | CUDA, Metal, ROCm | Geliştiriciler (önerilen) |
| LM Studio | GUI Uygulaması | Mac, Linux, Windows | OpenAI uyumlu | CUDA, Metal | CLI olmayan kullanıcılar, model keşfi |
| llama.cpp | C++ Motoru | Her yerde | Temel HTTP | CUDA, Metal, ROCm, Vulkan | Maksimum taşınabilirlik, edge cihazlar |
| vLLM | Python Sunucusu | Linux (GPU) | OpenAI uyumlu | CUDA | Üretim serving, çok kullanıcılı |
| Docker Model Runner | Docker Eklentisi | Mac, Linux, Windows | Docker API | CUDA, Metal | Docker-native iş akışları |
| Jan AI | GUI Uygulaması | Mac, Linux, Windows | OpenAI uyumlu | CUDA, Metal | Gizlilik odaklı masaüstü sohbet |
Ollama başlangıç noktasıdır. Tek komutla model çekme, otomatik GPU boşaltma ve OpenAI uyumlu API ekleyerek llama.cpp'yi bir Go sunucusuna sarıyor. GitHub'da 250.000'den fazla yıldızla yerel LLM geliştirme için fiili standart haline geldi.
LM Studio "LLM'lerin Spotify'ı" -- temiz bir GUI aracılığıyla modellere göz atın ve indirin. Bir iş akışına bağlanmadan önce keşfetmek ve test etmek için mükemmel.
llama.cpp, Ollama ve LM Studio'nun altındaki ham C/C++ inferans motorudur. Maksimum kontrol, özel derlemeler veya edge cihazlara dağıtım gerektiğinde doğrudan kullanın.
vLLM üretim seçimidir. PagedAttention bellek yönetimi, kıyaslamalarda 41 TPS'ye karşı 793 TPS ile büyük ölçekte Ollama'dan 19 kat daha fazla verim sunuyor. Birden fazla kullanıcıya hizmet ediyorsanız isteyeceğiniz şey bu.
Docker Model Runner, Docker'ın yerel LLM entegrasyonudur, şimdi GA. LLM'leri OCI artefaktları olarak çalıştırın. Ekibiniz zaten Docker'da yaşıyorsa, bu yığınınızdan bir araç daha kaldırıyor.
Jan AI, gizlilik odaklı tasarımlı ve uzantı sistemine sahip açık kaynaklı (Apache 2.0) bir masaüstü uygulamasıdır. Sıfır telemetri istiyorsanız LM Studio'ya sağlam bir alternatif.
Ne Zaman Ne Kullanılır
| İhtiyacınız Varsa... | Bunu Kullanın | Neden |
|---|---|---|
| En hızlı başlangıç (geliştirici) | Ollama | Tek komut, OpenAI API, tamam |
| GUI keşfi | LM Studio | Modellere görsel olarak göz atın, tek tıkla çalıştırın |
| Üretim serving (çok kullanıcılı) | vLLM | PagedAttention, 19 kat verim |
| Edge / IoT dağıtımı | llama.cpp | En küçük ayak izi, her yerde çalışır |
| Docker-native iş akışı | Docker Model Runner | Yeni araç yok, OCI artefaktları |
| Masaüstü sohbet (gizlilik) | Jan AI | Temiz UI, telemetri yok |
| Mac'te maksimum performans | MLX (aşağıdaki Apple bölümüne bakın) | Apple Silicon'da llama.cpp'den %20-30 daha hızlı |
Sonuç: Ollama ile başlayın. Ciddiyim, sadece oradan başlayın. Kullanım durumlarının %90'ını karşılıyor. Üretim için vLLM'e, GUI tercih ediyorsanız LM Studio'ya geçin.
İlk Yerel LLM'inizi Nasıl Kurarsınız?
Üç adım. Beş dakika. Başlayalım.
Adım 1: Ollama'yı Yükleme
# macOS / Linux (tek komut):
curl -fsSL https://ollama.com/install.sh | sh
# Windows: https://ollama.com/download adresinden yükleyiciyi indirinAdım 2: İlk Modelinizi İndirin ve Çalıştırın
# Llama 3.3'ü (~4,7 GB) indirin ve sohbet başlatın
ollama pull llama3.3
ollama run llama3.3Hepsi bu. Kendi makinenizde son teknoloji bir LLM çalıştırıyorsunuz. Bir soru yazın, milisaniyeler içinde yanıt alırsınız.
Adım 3: API'yi Kullanın (OpenAI'nin Doğrudan Yedeği)
Bu, yerel LLM'leri gerçekten pratik kılan kısım. Ollama, localhost:11434 üzerinde OpenAI uyumlu bir API sunuyor. OpenAI ile çalışan herhangi bir uygulama bunun yerine yerel endpoint'inize yönlendirebilir -- sıfır kod değişikliği.
# API'yi curl ile test etme
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "llama3.3",
"messages": [{"role": "user", "content": "Kuantum hesaplamayı 3 cümlede açıkla"}]
}'# Python: OpenAI SDK için doğrudan yedek
from openai import OpenAI
client = OpenAI(base_url="http://localhost:11434/v1", api_key="ollama")
response = client.chat.completions.create(
model="llama3.3",
messages=[{"role": "user", "content": "Bir listeyi sıralamak için Python fonksiyonu yaz"}]
)
print(response.choices[0].message.content)Python kodunun standart OpenAI SDK'sını kullandığına dikkat edin -- sadece base_url değiştiriyorsunuz. OpenAI API'yi destekleyen her kütüphane, çerçeve ve araç Ollama ile kutudan çıkar çıkmaz çalışıyor.
Alternatif: Docker Model Runner
İş akışınız Docker-native ise, Docker Model Runner Ollama'yı tamamen atlamanıza olanak tanıyor:
# Docker aracılığıyla model indirip çalıştırma
docker model pull ai/llama3.3
docker model run ai/llama3.3 "Merhaba, nasılsınız?"Docker Model Runner artık GA ve CUDA, Metal ve Vulkan GPU arka uçlarını destekliyor. Modelleri OCI artefaktları olarak çalıştırıyor ve OpenAI uyumlu bir API sunuyor -- aynı geliştirici deneyimi, ama Docker ekosistemine özgü.
Sonuç: Ollama ile sıfırdan LLM çalıştırmaya geçmek 5 dakikadan az sürüyor. OpenAI uyumlu API, mevcut kodunuzun sıfır değişiklikle çalışması anlamına geliyor.
Mac'te En İyi Performansı Nasıl Elde Edersiniz?
Mac kullanıcılarının çoğu rehberin tamamen atladığı gizli bir silahı var: MLX.
Tartıştığımız tüm araçlar -- Ollama, LM Studio, llama.cpp -- Metal arka ucu aracılığıyla Mac'te çalışıyor. Hepsi Apple Silicon'un GPU çekirdeklerinden yararlanıyor ve sağlam performans sunuyor. Ama Apple'ın kendi ML çerçevesi olan MLX daha da ileri gidiyor.
MLX, Apple Silicon için özel olarak inşa edilmiş. Metal'ın tek başına sunduğundan daha düşük bir seviyede birleşik bellek mimarisini kullanıyor ve aynı donanımda llama.cpp'ye kıyasla %20-30 daha hızlı inferans sunuyor. mlx-lm paketi uyumlu herhangi bir modeli çalıştırmayı kolaylaştırıyor:
# MLX-LM'i yükleme
pip install mlx-lm
# MLX ile model çalıştırma (Hugging Face'den otomatik indirilir)
mlx_lm.generate --model mlx-community/Llama-3.3-8B-Instruct-4bit \
--prompt "Ollama ile MLX arasındaki farkı açıkla"Peki Mac'te MLX'i mi Ollama'yı mı kullanmalısınız?
- Ollama: Daha kolay kurulum, yerleşik model yönetimi, OpenAI uyumlu API. Çoğu şey için kullanın -- özellikle diğer uygulamaların yerel LLM'inize bağlanmasını istiyorsanız.
- MLX: Daha hızlı ham inferans, yerel Apple optimizasyonu. Hız önemli olduğunda kullanın -- kodlama copilot'ları, toplu işleme veya %20-30 daha hızlı üretimin gerçek zaman kazandırdığı herhangi bir iş akışı.
Her iki araç aynı anda çalışabilir. Birçok geliştirici Ollama'yı günlük sürücü olarak kullanıp performans açısından kritik görevler için MLX'e geçiyor.
Apple ayrıca WWDC25'te ML iş yükleri için M4'e kıyasla 4 kat hız iyileştirmesi iddiasıyla M5 çipini sergiledi. Yerel LLM'ler için özellikle yeni donanım satın alıyorsanız, Apple Silicon en iyi değer önerilerinden biri olmaya devam ediyor -- özellikle 64-256 GB birleşik belleğin ayrık GPU'larda binlerce liraya mal olacak modelleri çalıştırmanıza olanak tanıdığı M4 Max ve Ultra katmanlarında.
Sonuç: Mac kullanıcılarının MLX'te gizli bir silahı var. Günlük kullanım için Mac'te Ollama işe yarıyor. Maksimum hız için MLX ekstra kuruluma değer.
Ollama'nın Ötesine Ne Zaman Geçmelisiniz?
Ollama geliştirme, prototipleme ve tek kullanıcılı iş yükleri için mükemmel. Ama onu aştığınızın açık sinyalleri var:
| Sinyal | Ollama'da Kal | vLLM'e Geç |
|---|---|---|
| Kullanıcılar | Tek kullanıcı / küçük ekip | Çok kullanıcılı / müşteriye yönelik |
| Verim | <50 istek/dk | 50+ istek/dk |
| Gecikme ihtiyaçları | Etkileşimli (iyi) | Toplu işleme (kritik) |
| GPU sayısı | 1 GPU | Çoklu GPU |
| Karmaşıklık toleransı | Düşük | Orta-Yüksek |
vLLM üretim yükseltmesidir. PagedAttention algoritması GPU belleğini bir işletim sistemindeki sanal bellek sayfaları gibi yönetiyor -- bitişik parçalar ayırmak yerine bloklar halinde bellek ayırıp serbest bırakıyor. Sonuç: çok kullanıcılı kıyaslamalarda Ollama için 41 TPS'ye karşı 793 TPS. Bu marjinal bir iyileştirme değil; farklı bir araç sınıfı.
Hibrit model de değerlendirmeye değer: hassas veya rutin görevler için (özetleme, sınıflandırma, kod incelemesi) yerel bir LLM kullanın ve karmaşık akıl yürütme sorgularını bulut API'sine yönlendirin. İş yükünüzün %80'i için yerel inferansın gizlilik ve maliyet avantajlarını elde ederken gerektiğinde sınır modeli kalitesine erişimi korursunuz.
Sonuç: Çoğu geliştirici Ollama'yı asla terk etmek zorunda kalmıyor. Birden fazla kullanıcıya hizmet veren bir ürün geliştiriyorsanız, vLLM açık bir sonraki adımdır.
Yerel LLM'lerle Gerçekten Ne İnşa Edebilirsiniz?
Chatbot çalıştırmak açık kullanım durumudur ama ilginç olan değil. Yerel LLM'lerin gerçekten parlattığı yer:
Yerel kodlama copilot'u. Qwen 3'ü Ollama aracılığıyla Continue.dev veya Tabby'e bağlayın. Kodunuz asla makinenizi terk etmiyor -- tescilli kod tabanları için kritik. Kurulum 10 dakika sürüyor ve çoğu görev için deneyim bulut tabanlı copilot'larla rekabet ediyor. Yapay zeka destekli bir SaaS inşa ediyorsanız, yerel bir copilot kod tabanınızı açığa çıkarmadan geliştirmeyi hızlandırıyor.
Özel RAG sistemi. Dahili belgelerinizi dizine ekleyin, ardından yerel bir LLM ile sorgulayın. LangChain + Ollama + ChromaDB'yi birleştirin ve uyumluluk baş ağrısı olmadan gizli verileri işleyen özel bir bilgi tabanına sahip olursunuz. Sağlık ve hukuk firmaları bunu HIPAA ve avukat-müvekkil gizliliği için zaten yapıyor.
Çevrimdışı asistan. İnternet gerekmez. Saha araştırmacıları, askeri operasyonlar, uzak çalışma konumları -- bağlantının güvenilmez olduğu her yerde yerel LLM çalışmaya devam ediyor.
Veri işleme hattı. Binlerce belgeden sıfır marjinal maliyetle özetleme, sınıflandırma veya bilgi çıkarma. API hız sınırları veriminizi kısıtlamıyor. Makul bir GPU'da yerel 8B model dakikada yüzlerce sayfa işleyebiliyor.
Yapay zeka destekli geliştirme araçları. Kod inceleme botları, commit mesajı oluşturucular, test üretimi -- hepsi altyapınızda çalışıyor. Girişimler için yapay zeka araçları kullanan ekipler genellikle bulut API'leriyle başlıyor ve ölçeklendikçe yüksek hacimli, düşük karmaşıklıklı görevlerini yerel modellere taşıyor.
Kurumsal veri egemenliği. Hibrit mimari modeli: yerel LLM'ler hassas verileri (HIPAA, KVKK, sınıflandırılmış) işler, bulut API'leri sınır akıl yürütme gerektiren hassas olmayan istekleri işler. Her iki dünyanın en iyisini elde edersiniz.
Yukarıda bahsedilen her aracın derinlemesine incelemesi için LLM'leri Yerel Çalıştırmak için En İyi Araçlar [yakında] sayfamıza bakın.
Sonuç: Öldürücü kullanım durumu sohbet değil -- bulut API'sine gönderemeyeceğiniz hassas veriler üzerinde yapay zeka çalıştırmaktır. Kodlama copilot'ları ve özel RAG, yerel LLM'lerin gerçekten parladığı yerlerdir.
Techsy Yerel Yapay Zeka Entegrasyonuna Nasıl Yaklaşıyor?
3 kişilik girişimlerden kurumsal mühendislik organizasyonlarına kadar geniş bir yelpazede ekipler için yerel yapay zeka ardışık düzenleri oluşturduk. İşte öğrendiklerimiz:
- Prototipleme için Ollama ile başlayın -- altyapıya yatırım yapmadan önce kullanım durumunu doğrulayın
- Hibrit mimariyi erkenden tasarlayın -- hangi görevlerin yerel kalacağını, hangilerinin bulut API'sine gideceğini belirleyin
- Ollama'yı aştığınızda vLLM kullanın -- özellikle birkaçı aşan eş zamanlı kullanıcıya hizmet verdiğinizde
- Her şeyi containerize edin -- Docker Model Runner veya özel Docker görüntüleri dağıtımı ortamlar arasında tekrarlanabilir kılıyor
- GPU donanımı için bütçe düşünceli belirleyin -- bulut API maliyetlerinin yerini aldığında RTX 4090 aylar içinde kendini geri ödüyor
Çoğu kişisel ve küçük ekip kullanım durumu için bu rehberdeki Ollama kurulumu gerçekten yeterli. Hizmetlerimiz, yerel yapay zekayı üretime ölçeklendirdiğinizde anlam ifade ediyor: çok model orkestrasyonu, özel ince ayar ardışık düzenleri veya LLM inferansının temel özellik olduğu ürünler inşa etmek.
Yerel LLM'leri ürününüze entegre etmek için yardıma mı ihtiyacınız var? Ücretsiz danışmanlık alın.
Sıkça Sorulan Sorular
Bir LLM'i yerel olarak nasıl çalıştırırım?
Ollama'yı yükleyin, ollama pull llama3.3 çalıştırın, ardından ollama run llama3.3. Üç komut ve kendi donanımınızda son teknoloji bir LLM çalıştırıyorsunuz. Model indirme dahil tüm süreç 5 dakikadan az sürüyor.
Bir LLM'i yerel olarak çalıştırmak için hangi donanıma ihtiyacım var?
Minimum: 8 GB RAM ve herhangi bir modern CPU -- ama acı verecek kadar yavaş olacak. Önerilen: 12+ GB VRAM'li bir GPU (RTX 3060 veya daha iyisi) veya 16+ GB birleşik bellekli Apple Silicon Mac. ~13.000 ₺'lik RTX 4060 Ti 16 GB çoğu kişi için tatlı noktadır.
Mac'te LLM çalıştırabilir miyim?
Evet ve Mac'ler bunun için mükemmel. Apple Silicon'un birleşik belleği aynı fiyat noktasındaki çoğu ayrık GPU'dan daha fazla etkili VRAM sunuyor. 24 GB'lı M4 Pro, 7-13B modellerini kolayca işliyor. Daha iyi performans için MLX kullanın -- aynı çipta llama.cpp'den %20-30 daha hızlı olan Apple'ın yerel çerçevesi.
Bir LLM'i yerel olarak çalıştırmak ücretsiz mi?
Yazılım (Ollama, LM Studio, llama.cpp) ve modeller (Llama, Qwen, Mistral) tamamı ücretsiz ve açık kaynaklı. Tek maliyet, muhtemelen zaten sahip olduğunuz donanım. Temel bir dizüstü bilgisayar bile test için daha küçük modelleri çalıştırabilir.
ChatGPT'yi yerel olarak çalıştırabilir miyim?
Hayır. ChatGPT, OpenAI'nin tescilli ürünüdür ve yerel dağıtım için mevcut değildir. Ancak Llama 3.3 ve Qwen 3 gibi açık ağırlıklı alternatifler birçok günlük görev için karşılaştırılabilir kalite sunuyor ve tamamen donanımınızda çalışıyor.
GGUF nedir?
GGUF (General GGML Universal Format), kuantize yerel LLM'ler için standart dosya formatıdır. Bağımsız, mimariden bağımsız olup Ollama, LM Studio ve llama.cpp tarafından kullanılıyor. .gguf ile biten bir model dosyası gördüğünüzde yerel inferansa hazır demektir.
Kuantizasyon nedir ve neden önemlidir?
Kuantizasyon, daha büyük modellerin daha az belleğe sığması için model hassasiyetini azaltır (örn. 16 bitten 4 bite). Q4_K_M kuantizasyonu, çıktı kalitesinin %97-98'ini korurken VRAM gereksinimlerini yaklaşık %75 azaltıyor. Tek bir tüketici GPU'sunda 70 milyar parametreli bir modeli çalıştırabilmenizin nedeni budur.
2026'da en iyi yerel LLM modeli hangisi?
Llama 3.3 8B en iyi genel amaçlı başlangıç noktasıdır. Qwen 3 7B kodlama ve çok dilli görevlerde öne çıkıyor. Phi-4-mini (3,8B) kısıtlı donanım için seçimdir. Llama 3.3 70B yerel olarak çalıştırabileceğiniz GPT-4 sınıfı akıl yürütmeye en yakın olanı sunuyor.
Yerel bir LLM bulut API'lerine kıyasla ne kadar hızlı?
Tek kullanıcı için yerel genellikle daha hızlı -- bulut API'si üzerinden 1-2 saniyeye karşı 30-50 ms ilk token gecikmesi. Ayrıca hız sınırlarını ve kuyruk bekleme sürelerini de ortadan kaldırıyorsunuz. Yüksek verimli çok kullanıcılı senaryolarda, uygun GPU altyapısına sahip bulut API'leri veya vLLM, temel Ollama kurulumunu geride bırakacaktır.
Hassas veriler için yerel LLM çalıştırmak güvenli midir?
Evet -- bu yerel çalıştırmanın birincil nedenlerinden biridir. Veriler asla makinenizi terk etmiyor, bu nedenle üçüncü taraf maruziyeti yok. Sağlık (HIPAA), finans ve devlet kuruluşları özellikle yerel LLM kullanıyor çünkü hiçbir bulut sağlayıcıyla imzalanan veri işleme anlaşması verileri hiç göndermemenin gizliliğiyle eşleşemiyor.
Ollama ile llama.cpp arasındaki fark nedir?
Ollama, llama.cpp'yi model yönetimi, otomatik GPU boşaltma ve OpenAI uyumlu API ekleyerek bir Go sunucusuna sarıyor. llama.cpp altındaki ham C/C++ inferans motorudur. Kolaylık için Ollama kullanın; maksimum kontrol veya edge dağıtımı gerektiğinde llama.cpp'yi doğrudan kullanın.
Tüketici donanımında 70B model çalıştırabilir miyim?
Evet, kuantizasyonla. Q4_K_M'de 70B model yaklaşık 24 GB VRAM gerektiriyor -- RTX 4090 veya 48+ GB birleşik bellekli M4 Max ile ulaşılabilir. Performans kullanılabilir (saniyede 15-30 token) ama 7B veya 13B model çalıştırmaktan belirgin şekilde yavaş. Günlük kullanım için çoğu kişi 7-13B modellerin en iyi hız-kalite dengesini sunduğunu görüyor.