ai-machine-learning

LLM İnce Ayarı Nasıl Yapılır: Yöntemler, Çerçeveler ve Adım Adım Kod [2026]

Yazan Mert Batur
Mar 17, 2026
15 okuma
LLM İnce Ayarı Nasıl Yapılır: Yöntemler, Çerçeveler ve Adım Adım Kod [2026]

Bir LLM'i ince ayarlamak, önceden eğitilmiş bir modeli alıp belirli verilerinizde eğiterek görevinizi hiçbir komutun başaramayacağı kadar iyi gerçekleştirmesini sağlamak anlamına gelir. Giriş engeli ortadan kalktı: QLoRA + Unsloth artık 12 GB tüketici GPU'sunda 8 milyar parametreli bir modeli 1 dolardan az bulut maliyetiyle ince ayarlamanıza olanak tanıyor.

Bu kılavuz tüm süreci kapsıyor -- ne zaman ince ayar yapmalısınız (RAG veya komut mühendisliğine karşı), hangi yöntemi ve çerçeveyi seçeceğiniz, veri kümenizi nasıl hazırlayacağınız, kopyalayıp yapıştırabileceğiniz Llama 3 uygulaması, gerçek maliyet senaryoları ve dağıtım.

İnce Ayar Bir Bakışta

Herhangi bir şeye karar vermeden önce, işte hızlı genel tablo:

ÖzellikAyrıntı
NedirPerformansı artırmak için önceden eğitilmiş LLM'i göreve özgü verilerle eğitmek
Ne zaman kullanılırKomut mühendisliği ve RAG kullanım durumunuz için yeterli olmadığında
En popüler yöntemQLoRA (4 bit nicelleştirilmiş LoRA) -- tüketici GPU ince ayarının %90'ını karşılar
En hızlı çerçeve (2026)Unsloth (standart eğitimden 2–5x daha hızlı, %70 daha az VRAM)
Minimum donanımQLoRA ile 12 GB VRAM GPU (RTX 3060)
En ucuz bulut seçeneğiRunPod'da saatte ~0,34 $ (RTX 4090)
Veri kümesi boyutu100–10.000 örnek (üretim için 500+ önerilir)
Eğitim süresiModel ve veri kümesi boyutuna bağlı 30 dk – 8 saat
En iyi temel modeller (2026)Llama 3.x, Qwen 2.5, Mistral, Gemma 2, Phi-4
Ana riskFelaket unutması (model genel bilgiyi kaybeder)
AlternatifBilgi alma için RAG, basit görevler için komut mühendisliği

Şimdi ince ayarın projeniz için gerçekten doğru adım olup olmadığını anlayalım.

Bir LLM'i Ne Zaman İnce Ayarlamalısınız? (RAG ve Komut Mühendisliğine Karşı)

Bu, çoğu geliştiricinin atladığı soru -- ve onlara haftalar boyu boşa harcanan çabaya mal oluyor. İnce ayar güçlüdür, ancak her zaman doğru araç değildir. İşte karar vermek için bir çerçeve.

YaklaşımEn iyi ne zamanSınırlamalarMaliyet
Komut MühendisliğiBasit biçimlendirme, ton değişiklikleri, az örnekli örnekler işe yararBağlam penceresiyle sınırlı, karmaşık görevlerde tutarsızÜcretsiz (yalnızca API maliyetleri)
RAGHarici veya sık değişen bilgileri sorgulamanız gerekirAlma kalitesi değişir, gecikme eklerOrta (vektör DB + yerleştirme maliyetleri)
İnce AyarTutarlı davranış, alana özgü dil veya katı format uyumuna ihtiyaç duyuyorsunuzEğitim verileri gerektirir, felaket unutması riskiGPU süresi + veri kümesi hazırlığı
Hibrit (RAG + İnce Ayar)Uzmanlaşmış davranış VE harici bilgiye ihtiyacınız varOluşturulması ve bakımı en karmaşıkBirleşik

Karar, neyi değiştirmeye çalıştığınıza bağlıdır. İşte gerçek senaryolar:

SenaryoÖnerilen YaklaşımNeden
Ürün bilgisiyle müşteri destek botuRAGBilgi sık değişir, komutlar tonu yönetir
ICD-10 uyumlu tıbbi kodlamaİnce AyarKatı format gereksinimleri, alana özgü terminoloji
Şirket verisi + belirli ton içeren kurumsal asistanHibritHem alma hem de tutarlı davranışa ihtiyaç duyar
Güvenilir JSON çıktı biçimlendirmesiİnce AyarKomutlarla boğuşmaktan daha ucuz ve güvenilir
Markanız gibi konuşan sohbet botuİnce AyarDavranış ve stil değişiklikleri ağırlık güncellemeleri gerektirir

SaaS'ınız için doğru yapay zeka yığınını seçiyorsanız, bu karar çerçevesi ilk adımdır. Birçok ekip, 500 örnekli ince ayarın daha tutarlı sonuçlar ve daha düşük gecikme sağlayacağı durumlarda karmaşık RAG boru hatları oluşturuyor.

Sonuç: Modelin yalnızca farklı şeyler bilmesini değil, tutarlı biçimde farklı davranmasını istediğinizde ince ayar yapın. Yalnızca yeni bilgiye ihtiyacınız varsa, RAG daha ucuz ve bakımı daha kolaydır. Her ikisine de ihtiyacınız varsa, hibrite gidin.

LLM İnce Ayarı Nasıl Çalışır? Tam İnce Ayar, LoRA ve QLoRA

Donanım gereksinimleri, maliyet ve kalite açısından önemli ölçüde farklılık gösteren üç ana yaklaşım vardır. Dengeleri anlamak, ya fazla yatırım yapmanızı ya da yetersiz sonuç almanızı önler.

Tam İnce Ayar (Bütçe Sorun Değilse)

Tam ince ayar modeldeki her parametreyi günceller. Mümkün olan en iyi sonuçları üretir ancak muazzam kaynaklar gerektirir -- 7B model için yaklaşık 100+ GB VRAM (modeli, optimizer durumlarını ve gradyanları aynı anda depolamanız gerekir). Bu H100 kümesi bölgesidir. İyi finanse edilmiş bir laboratuvarda değilseniz bunu atlayın.

LoRA: PEFT Devrimi

LoRA (Düşük Ranklı Adaptasyon) temel modeli dondurur ve adaptörler adı verilen küçük eğitilebilir matrisler ekler. Büyük bir W ağırlık matrisini doğrudan güncellemek yerine, LoRA güncellemeyi iki küçük A ve B matrisine ayrıştırır; burada r rankı model boyutundan çok daha küçüktür. Sonuç: tam ince ayar kalitesinin %98–99'unu korurken orijinal parametrelerin yalnızca %1–2'sini eğitirsiniz.

Hugging Face peft kitaplığı standart uygulamadır. LoRA adaptörleri tipik olarak 50–200 MB'dır -- tam modelle karşılaştırıldığında oldukça küçük.

QLoRA: Herkes İçin İnce Ayar

QLoRA LoRA'yı bir adım öteye taşır. Temel modeli NormalFloat4 (NF4) adı verilen özel bir veri türü kullanarak 4 bit hassasiyetle yükler, ardından üzerine LoRA adaptörleri uygular. 4 bit nicelleştirme, neredeyse özdeş kaliteyi korurken standart LoRA'ya kıyasla VRAM kullanımını ~%25 daha azaltır.

Bu, ince ayarı erişilebilir kılan şeydir. Tam ince ayar için 100+ GB gerektiren bir 7B modeli, QLoRA ile 12 GB'a sığar.

YöntemVRAM (7B model)Temel modele göre kaliteEğitim hızıAdaptör boyutuKullanım durumu
Tam İnce Ayar100+ GBEn iyiEn yavaşTam model (~14 GB)H100 kümeli kurumsal
LoRA~16 GBTam modelin %98–99'u2x daha hızlı~50–200 MBA100/RTX 4090 ekipleri
QLoRA~12 GBTam modelin %97–99'uEn hızlı (Unsloth ile)~50–200 MBSolo geliştiriciler, tüketici GPU'ları

Sonuç: Geliştiricilerin %90'ı için QLoRA doğru seçimdir. Çoğu görev için tam ince ayardan kalite farkı ihmal edilebilir düzeyde, donanım tasarrufu ise muazzamdır. Oradan başlayın ve yalnızca değerlendirme metrikleriniz gerektirdiğinde ölçeği büyütün.

2026'da Hangi İnce Ayar Çerçevesini Kullanmalısınız?

Çerçeve seçimi, çoğu insanın fark ettiğinden daha önemlidir. Doğru çerçeve saatlerce kurulum süresinden tasarruf ettirir ve eğitimi önemli ölçüde hızlandırır. İşte dört büyük seçeneğin karşılaştırması.

ÇerçeveGitHub YıldızlarıHızEn iyi ne içinModel desteğiÖğrenme eğrisi
Unsloth54K+2–5x daha hızlıTekli GPU hızı, QLoRALlama, Mistral, Qwen, Gemma, PhiDüşük
LLaMA-Factory68K+TemelEn geniş model desteği, web UI100+ modelDüşük (GUI)
TRL (Hugging Face)18K+TemelRLHF/DPO/GRPO, HF ekosistemiTüm HF modelleriOrta
Axolotl11K+TemelTekrar üretilebilirlik, çoklu GPUBüyük modellerYüksek (YAML yapılandırması)

İşte hızlı öneri:

  • İlk ince ayarınız mı? Unsloth kullanın. En hızlı eğitim, en kolay kurulum, hemen başlamak için ücretsiz Colab not defterleri.
  • Kodsuz bir web UI ister misiniz? LLaMA-Factory kullanın. LLaMA-Board GUI'si eğitimi bir tarayıcıdan yapılandırıp başlatmanıza olanak tanır.
  • Hizalama (RLHF, DPO, GRPO) yapıyor musunuz? TRL kullanın. Tercih tabanlı eğitim için Hugging Face standardıdır ve v0.15.0 (Mart 2026) yerel GRPO desteği ekledi.
  • Çoklu GPU'da üretim boru hatları mı? Axolotl kullanın. YAML tabanlı yapılandırmalar deneyleri tekrar üretilebilir ve denetlenebilir kılar.

Kullanışlı bir püf noktası: Unsloth ve LLaMA-Factory birleştirilebilir. LLaMA-Factory, Unsloth'u eğitim arka ucu olarak destekler ve GUI kolaylığını Unsloth'un hız optimizasyonlarıyla birleştirir.

İnce Ayar Veri Kümesi Nasıl Hazırlanır?

Veri kalitesi, ince ayar başarısındaki en önemli tek faktördür. İyi seçilmiş 500 örnekli bir veri kümesi, gürültülü 10.000 örnekli birini neredeyse her zaman geçecektir.

Veri Kümesi Biçimleri

İki dominant biçim vardır: sohbet (OpenAI uyumlu) ve talimat (Alpaca tarzı). İşte JSONL biçiminde her birinin nasıl göründüğü:

Sohbet biçimi (çoğu kullanım durumu için önerilir):

json
{"messages": [{"role": "system", "content": "You are a customer support agent for Acme Inc. Be helpful, concise, and always reference the user's order number."}, {"role": "user", "content": "I ordered a laptop 3 days ago (order #4821) and it still says processing."}, {"role": "assistant", "content": "I can see order #4821 is currently in our warehouse being prepared for shipment. Laptops typically ship within 3-5 business days. You should receive a tracking number by tomorrow. Would you like me to flag this for priority processing?"}]}
{"messages": [{"role": "system", "content": "You are a customer support agent for Acme Inc. Be helpful, concise, and always reference the user's order number."}, {"role": "user", "content": "Can I return my keyboard? Order #3019, bought it last week."}, {"role": "assistant", "content": "Absolutely! Order #3019 is within our 30-day return window. I'll email you a prepaid return label right now. Once we receive the keyboard, your refund will process within 2-3 business days."}]}
{"messages": [{"role": "system", "content": "You are a customer support agent for Acme Inc. Be helpful, concise, and always reference the user's order number."}, {"role": "user", "content": "My monitor arrived cracked. Order #5573."}, {"role": "assistant", "content": "I'm sorry about that! For order #5573, I'm initiating an immediate replacement shipment -- no need to return the damaged unit. The new monitor will ship today with express delivery. You'll get a tracking email within the hour."}]}

Talimat biçimi (Alpaca tarzı):

json
{"instruction": "Summarize the following customer complaint in one sentence.", "input": "I've been waiting 2 weeks for my refund and nobody responds to my emails. This is the worst customer service I've ever experienced.", "output": "Customer is frustrated by a 2-week delay in receiving their refund and lack of email response from support."}
{"instruction": "Classify the sentiment of this review.", "input": "The product works fine but shipping took forever.", "output": "Mixed (positive product, negative shipping)"}

Veri Kümesi Boyutu Kılavuzu

Gerçekte ne kadar veriye ihtiyacınız var? Görev karmaşıklığına bağlıdır:

  1. 50–100 örnek -- kavram kanıtı, ince ayarın işe yarayıp yaramadığını test etmek için yeterli
  2. 500–1.000 örnek -- çoğu tek görev için kullanışlı (sınıflandırma, çıkarma, biçimlendirme)
  3. 5.000–10.000 örnek -- karmaşık görevler için üretim kalitesinde sonuçlar
  4. 10.000+ örnek -- görevinizde yüksek değişkenlik olmadıkça azalan getiriler

Veri Kalitesi Kontrol Listesi

Eğitimden önce veri kümenizi şu kriterlere göre doğrulayın:

  • Tüm örneklerde tutarlı biçimlendirme (aynı sistem komutu, aynı çıktı yapısı)
  • Uç durumları ve hata modlarını kapsayan çeşitli örnekler
  • Çelişki yok (aynı giriş desenine hem "evet" hem "hayır" demeyi öğretmeyin)
  • Çıktı türlerinin dengeli dağılımı (sınıflandırmada örneklerin %90'ı tek sınıfta olmasın)
  • Yinelenen veya neredeyse yinelenen girişleri kaldırın

Profesyonel ipucu: Başlangıç sentetik eğitim verisi oluşturmak için GPT-4 veya Claude kullanın, ardından insan incelemesiyle iyileştirin. 500 yüksek kaliteli sentetik örnek, genellikle 5.000 gürültülü gerçek örneği geride bırakır. Meta'nın ince ayar kılavuzu veri kümelerini başlatmak için bu yaklaşımı önermektedir.

Adım Adım: QLoRA ve Unsloth ile Llama 3 8B İnce Ayarı

İşte eksiksiz rehber. Her kod bloğu kopyalayıp yapıştırmaya hazırdır -- bunu bir ücretsiz Google Colab not defterinde veya 12+ GB VRAM'li herhangi bir makinede çalıştırabilirsiniz.

Adım 1: Unsloth'u Yükleyin

bash
pip install unsloth

Hepsi bu kadar. Unsloth tüm bağımlılıkları (transformers, peft, trl, bitsandbytes) otomatik olarak yönetir.

Adım 2: Temel Modeli 4 Bit'te Yükleyin

python
from unsloth import FastLanguageModel

# Llama 3.1 8B'yi 4 bit nicelleştirmeyle yükle
model, tokenizer = FastLanguageModel.from_pretrained(
    model_name="unsloth/Meta-Llama-3.1-8B-bnb-4bit",
    max_seq_length=2048,
    load_in_4bit=True,
)

Bu, 4 bit nicelleştirilmiş modeli (~4 GB) indirir ve GPU belleğine yükler. RTX 3060 (12 GB) üzerinde eğitim için yeterli alanınız olacak.

Adım 3: LoRA Adaptörlerini Yapılandırın

python
# Modele LoRA adaptörleri ekle
model = FastLanguageModel.get_peft_model(
    model,
    r=16,                # LoRA rankı -- 16 çoğu görev için ideal nokta
    target_modules=["q_proj", "k_proj", "v_proj", "o_proj",
                     "gate_proj", "up_proj", "down_proj"],
    lora_alpha=16,       # Ölçekleme faktörü (genellikle r'ye eşit)
    lora_dropout=0,      # Unsloth 0 dropout için optimize eder
    bias="none",
)

r=16 ile 8 milyardan yaklaşık 40 milyon parametreyi eğitiyorsunuz -- modelin %0,5'inden az. LoRA'nın sihri budur.

Adım 4: Veri Kümenizi Yükleyin

python
from datasets import load_dataset

# Hugging Face Hub veya yerel dosyadan JSONL veri kümenizi yükle
dataset = load_dataset("json", data_files="train.jsonl", split="train")

# Sohbet şablonuna biçimlendir
def format_chat(example):
    text = tokenizer.apply_chat_template(
        example["messages"],
        tokenize=False,
        add_generation_prompt=False,
    )
    return {"text": text}

dataset = dataset.map(format_chat)

Bu, önceki bölümdeki JSONL sohbet biçimini alır ve Llama 3'ün sohbet şablonunu uygular. Tokenizer tüm özel belirteçleri yönetir (<|begin_of_text|>, <|eot_id|>, vb.).

Adım 5: Eğitimi Yapılandırın ve Çalıştırın

python
from trl import SFTTrainer
from transformers import TrainingArguments
from unsloth import is_bfloat16_supported

trainer = SFTTrainer(
    model=model,
    train_dataset=dataset,
    dataset_text_field="text",
    max_seq_length=2048,
    args=TrainingArguments(
        per_device_train_batch_size=2,
        gradient_accumulation_steps=4,    # Efektif parti boyutu = 8
        warmup_steps=5,
        max_steps=60,                     # Veri kümesi boyutuna göre ayarlayın
        learning_rate=2e-4,               # QLoRA için standart
        fp16=not is_bfloat16_supported(),
        bf16=is_bfloat16_supported(),
        logging_steps=1,
        output_dir="outputs",
        seed=42,
    ),
)

# Eğitimi başlat
trainer.train()

Anlamanız gereken temel hiperparametreler:

  • Öğrenme hızı (2e-4): QLoRA için standart. Model genel yetenekleri unutuyorsa düşürün (2e-5).
  • Parti boyutu (2) x gradyan birikimi (4): 8'lik efektif parti boyutu. GPU'nuzun belleği bitiyorsa gradient_accumulation'ı artırın.
  • max_steps (60): 500 örnek için bu yaklaşık 1 dönemdir. 1–3 dönemle başlayın ve doğrulama kaybını izleyin.
  • r rankı (16): Basit görevler için daha düşük (4–8), karmaşık görevler için daha yüksek (32–64). 16 güvenli bir varsayılandır.

Adım 6: Kaydedin ve Test Edin

python
# LoRA adaptörlerini kaydet (küçük -- ~50-200 MB)
model.save_pretrained("my-fine-tuned-model")
tokenizer.save_pretrained("my-fine-tuned-model")

# Hızlı çıkarım testi
FastLanguageModel.for_inference(model)
inputs = tokenizer(
    [tokenizer.apply_chat_template(
        [{"role": "user", "content": "I need to return order #7742"}],
        tokenize=False,
        add_generation_prompt=True,
    )],
    return_tensors="pt",
).to("cuda")

outputs = model.generate(**inputs, max_new_tokens=256)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))

İşte boru hattının tamamı. Unsloth ile RTX 4090 üzerinde 500 örneği eğitmek yaklaşık 15–30 dakika sürer. Ücretsiz Colab T4'te 1–2 saat bekleyin.

API Tabanlı İnce Ayar Nasıl? (OpenAI, Google, Mistral)

Herkes GPU yönetmek istemez. API sağlayıcıları, basit bir yükleme ve eğitim iş akışıyla ince ayar yapmanıza olanak tanır. İşte bunların kendi başınıza çalıştırmakla karşılaştırması.

SağlayıcıModellerMin örnekMaliyet (1.000 örnek)Ağırlıkları indir?Veri gizliliği
OpenAIGPT-4o, GPT-4o-mini10~90–750 ₺HayırVeriler eğitim için kullanılabilir
Google Vertex AIGemma, Gemini100~150–900 ₺Yalnızca GemmaGCP kontrolünde
Mistral (La Plateforme)Mistral modelleri100~120–600 ₺HayırAB veri yerleşimi
Together AIAçık modeller (Llama, vb.)50~60–450 ₺Evet (açık modeller)Veriler saklanmaz
Yerel (Unsloth/LLaMA-Factory)Herhangi açık model1Yalnızca GPU maliyeti (0–810 ₺)Evet (her şeye sahipsiniz)Tam gizlilik

API ince ayarının mantıklı olduğu durumlar: Hızlı yineleme yapmanız gerekir, veri kümeniz küçüktür, altyapı yönetmek istemiyorsunuz veya özellikle GPT-4o gibi kapalı bir modele ihtiyacınız var.

Yerel ince ayarın kazandığı durumlar: Veri gizliliği önemlidir (sağlık, finans, hukuk), sık sık eğitim yapıyorsunuz, ağırlıklara sahip olmak ve dışa aktarmak istiyorsunuz veya büyük ölçekte maliyet optimizasyonu yapıyorsunuz.

Sonuç: API ince ayarı kavram kanıtına giden en hızlı yoldur. Yerel ince ayar üretime giden en ucuz yoldur. Çoğu ekip bir API'de prototip oluşturur, ardından yaklaşımı doğruladıktan sonra yerel Unsloth'a geçer.

Bir LLM'i İnce Ayarlamanın Maliyeti Ne Kadar?

"İnce ayar pahalıdır" anlatısı 2023'te takılı kalmış. İşte bugün gerçekte ne kadara mal olduğu.

SenaryoModelYöntemGPUEğitim süresiToplam maliyet
Hobi / ÖğrenmeLlama 3 8BQLoRAKendi RTX 3060'ım (12 GB)2–4 saat0 ₺ (elektrik)
Ücretsiz bulutLlama 3 8BQLoRAGoogle Colab T4 (ücretsiz)3–5 saat0 ₺
StartupLlama 3 8BQLoRA + UnslothRunPod RTX 4090 (0,34 $/saat)1–2 saat10–21 ₺
ÜretimLlama 3 70BQLoRARunPod A100 80 GB (3,39 $/saat)5–8 saat510–810 ₺
KurumsalLlama 3 70BTam ince ayar4x H100 (13,56 $/saat)20–40 saat8.100–16.200 ₺
API (GPU yok)GPT-4o-miniOpenAI APIYok~30 dk90–750 ₺

Maliyet eğrisi hızla düzleşir. RunPod'da 8B model ince ayarlayan bir startup, eğitime bir fincan kahveden daha az harcıyor. 70B üretim senaryosu bile 1.000 ₺'nin altında -- bu bir junior geliştiricinin aylık öğle yemeği bütçesi.

Karşılaştırılacak bulut GPU sağlayıcıları: RunPod (en iyi spot fiyatlandırması), Lambda (güvenilir isteğe bağlı H100'ler), Vast.ai (en ucuz ama değişken kalite) ve Modal (sunucusuz, saniye başına ödeme).

"Model Boyutu ve Yönteme Göre VRAM Gereksinimleri"

"QLoRA, 7B modeller için VRAM'i 100 GB'dan 12 GB'a, 70B modeller için 560 GB'dan 48 GB'a düşürür -- tüketici GPU'larını ince ayar için kullanılabilir kılar."
Veri tablosu
"Model Boyutu ve Yönteme Göre VRAM Gereksinimleri"
"Model Boyutu""Tam İnce Ayar""LoRA""QLoRA"
"7B"1001612
"13B"2003224
"70B"5608048

Yukarıdaki grafik, QLoRA'nın oyunu neden değiştirdiğini gösteriyor. Tam ince ayar için çok GPU'lu küme gerektiren 7B model, artık bir dizüstü bilgisayar GPU'suna sığıyor. 70B model, "yalnızca bulut"tan tek A100'e düşüyor.

Sonuç: Üretim kalitesinde bir 8B modeli 1 dolardan az bir maliyetle ince ayarlayabilirsiniz. İnce ayarın maliyet engeli ortadan kalktı. Asıl maliyet, veri kümesi hazırlık süresidir.

İnce Ayarlı Bir Model Nasıl Değerlendirilir?

Eğitim işin yalnızca yarısıdır. Uygun değerlendirme olmadan, ince ayarlı modelinizin gerçekten iyileşip iyileşmediğini -- ya da yalnızca eğitim verilerinizi ezberleyip ezberlediğini söyleyemezsiniz.

Otomatik Metrikler

Eğitim sırasında ve sonrasında bunları takip edin:

  • Eğitim kaybı / çelişki: Düzenli olarak azalmalı, ardından durağanlaşmalıdır. Sıfıra yaklaşırsa aşırı uyumuyla karşı karşıyasınızdır.
  • Göreve özgü metrikler: Doğruluk (sınıflandırma), BLEU/ROUGE (özetleme), tam eşleşme (çıkarma), F1 (çok etiketli). Görevinizle eşleşen metriği seçin.

İnsan Değerlendirmesi

Sayılar her şeyi yakalamaz. Üretken görevler için:

  • A/B testi: Temel model ile ince ayarlı modelin çıktısını yan yana gösterin. 3–5 değerlendirici, 50'den fazla örnekte daha iyi yanıtı seçsin. Kazanma oranını takip edin.
  • Likert ölçeği puanlaması: Çıktıları alaka düzeyi (1–5), doğruluk (1–5) ve ton (1–5) açısından puanlayın. Temel modele göre ortalama iyileşmeyi hesaplayın.

Felaket Unutması Kontrolü

Bu, çoğu geliştiricinin atladığı kontroldür. İnce ayardan sonra, modelinizi MMLU veya HellaSwag gibi genel bir kıyaslamada çalıştırın. Puanlar 2–3 noktadan fazla düşerse, modeliniz çok fazla genel bilgi kaybetmiştir. Çözüm: öğrenme hızınızı düşürün, dönem sayısını azaltın veya LoRA'ya geçin (temel ağırlıkları dondurur).

Pratik kural: Veri kümenizin her zaman %10–20'sini test kümesi olarak ayırın. Eğitim verilerini asla değerlendirmeyin -- bu, gerçek dünya performansı hakkında hiçbir şey söylemez.

İnce Ayarlı Bir Model Nasıl Dağıtılır?

Eğitim tamamlandı. Şimdi onu sunmanız gerekiyor. Çoğu kılavuz bu kısmı tamamen atlıyor.

Adım 1: LoRA Adaptörlerini Birleştirin

LoRA veya QLoRA kullandıysanız, çıkarım için adaptörleri temel modelle yeniden birleştirin:

python
# Adaptörleri temel modelle birleştir
model.merge_and_unload()
model.save_pretrained("merged-model")
tokenizer.save_pretrained("merged-model")

Adım 2: Dağıtım Yolunuzu Seçin

Yerel geliştirme ve test -- Ollama:

bash
# GGUF biçimine dönüştür (Ollama'nın yerel biçimi)
python llama.cpp/convert_hf_to_gguf.py merged-model --outfile model.gguf --outtype q4_k_m

# Ollama modeli oluştur
ollama create my-fine-tuned-model -f Modelfile
ollama run my-fine-tuned-model

Üretim sunumu -- vLLM:

bash
# OpenAI uyumlu API sunucusu başlat
python -m vllm.entrypoints.openai.api_server \
    --model merged-model \
    --host 0.0.0.0 \
    --port 8000

Sunucusuz (sıfır altyapı): Modelinizi Together AI, Fireworks veya Modal'a yükleyin. Sunucu yönetmeden bir API uç noktası elde edersiniz. Maliyet kullanımla ölçeklenir.

Gelişmiş: Çoklu Adaptör Sunumu

İşte daha fazla ekibin kullanması gereken bir desen: bellekte bir temel modeli tutun ve istek başına LoRA adaptörlerini değiştirin. Tek bir GPU'dan müşteri destek adaptörü, kod inceleme adaptörü ve özetleme adaptörü sunabilirsiniz. vLLM bunu --enable-lora bayrağıyla yerel olarak destekler.

En Yaygın İnce Ayar Hataları Nelerdir?

Düzinelerce ince ayar çalışmasındaki hataları ayıkladıktan sonra, bunlar tekrar tekrar karşılaşılan hatalardır.

1. Küçük veri kümelerinde aşırı uyum. 200 örnekte 10 dönem eğitirsiniz, eğitim kaybı sıfıra yaklaşır ve model eğitim verilerinizi kelimesi kelimesine tekrar eder. Düzeltme: maksimum 1–3 dönem, bir doğrulama kümesi kullanın ve eğitim kaybı ile değerlendirme kaybı arasındaki farkı izleyin.

2. Felaket unutması. Model belirli görevinizde mükemmelleşir ama artık temel bir konuşma yapamaz. Düzeltme: LoRA/QLoRA kullanın (temel ağırlıkları dondurur), öğrenme hızlarını düşük tutun (tam ince ayar için 2e-5, QLoRA için 2e-4) ve dağıtmadan önce genel kıyaslamalarda değerlendirin.

3. Düşük veri kalitesi. Tutarsız biçimlendirme, örnekler arasında çelişkiler veya yinelemeler. Model gürültüyü öğrenir. Düzeltme: eğitimden önce verilerinizi temizleyin. Her zaman. Hiperparametre ayarından çok veri düzenlemesine zaman harcayın.

4. Çok büyük modelle başlamak. Ekipler "daha büyük daha iyidir" mantığıyla 70B'ye atlıyor, ardından GPU maliyetlerini karşılayamıyor. Düzeltme: 8B ile başlayın. 8B iyi verilerle görevinizi çözemiyorsa, aynı verilerle 70B muhtemelen de çözemez. Önce veri kalitesini ölçeklendirin, ardından model boyutunu.

5. Değerlendirme boru hattı yok. Ayrılmış test kümesi olmadan eğitim yapıp sezgiyle dağıtım. Düzeltme: başlamadan önce verilerinizi 80/10/10 (eğitim/doğrulama/test) olarak bölün. Her test örneğinde temel modelle karşılaştırın.

6. Çok yüksek öğrenme hızı. İlk adımlarda önceden eğitilmiş bilgiyi yok eder. Model anlamsız şeyler çıkarır. Düzeltme: QLoRA için 2e-4, tam ince ayar için 2e-5'ten başlayın. Çıktılar bozulursa daha da düşürün.

Techsy LLM İnce Ayarına Nasıl Yaklaşıyor?

Techsy'de her yapay zeka projesi için katı bir yükseltme yolu izliyoruz: önce komut mühendisliği, ikinci RAG, yalnızca veriler gerektirdiğinde ince ayar. Müşteri projelerinin çoğu aslında ince ayar gerektirmiyor -- iyi hazırlanmış komutlar veya bir RAG boru hattı, sorunu daha düşük maliyet ve karmaşıklıkla çözüyor.

İnce ayarın doğru seçim olduğunda sürecimiz şöyle işliyor:

  1. Veri kümesi denetimi -- Müşterinin verilerini kalite, kapsam ve biçimlendirme açısından inceliyoruz. Yeterli örnek yoksa, GPT-4 veya Claude kullanarak insan incelemesiyle sentetik veri kümesi oluşturmaya yardımcı oluyoruz.
  2. Çerçeve seçimi -- Startup projelerinin %90'ı için Unsloth + QLoRA. Tekrar üretilebilir, çoklu GPU üretim boru hatlarına ihtiyaç duyan müşteriler için Axolotl.
  3. Eğitim ve değerlendirme -- Her zaman ayrılmış test kümesiyle eğitip temel modele karşı kıyaslıyoruz. İnce ayarlı model hedef metriği ölçülebilir biçimde iyileştirmiyorsa dağıtmıyoruz.
  4. Dağıtım -- Üretim sunumu için vLLM, müşterilerin tek bir GPU'dan birden fazla uzmanlaşmış modele ihtiyaç duyduğu durumlarda çoklu adaptör desenleri.

70B modeller için bile QLoRA RunPod üzerinde maliyetleri 1.000 ₺'nin altında tutarak kurumsal GPU bütçelerini karşılayamayan startuplar için ince ayarlı modeller teslim ettik.

Kullanım durumunuz için bir LLM'i ince ayarlamada yardıma ihtiyacınız var mı? Ham veriden dağıtılmış modele giden yolda ekiplere yardım ediyoruz. Ücretsiz danışmanlık alın

LLM İnce Ayarı Hakkında Sıkça Sorulan Sorular

LLM ince ayarı nedir?

LLM ince ayarı, önceden eğitilmiş bir dil modelini kendi göreve özgü verilerinizde eğiterek o görevi daha iyi gerçekleştirmesini sağlama sürecidir. Genel komutların güvenilir biçimde başaramadığı yeni davranışları, biçimleri veya alan uzmanlığını modele öğretiyorsunuz.

İnce ayar yerine ne zaman RAG kullanmalıyım?

Modelin farklı davranmasını istediğinizde ince ayar yapın -- tutarlı çıktı biçimi, alana özgü dil, belirli ton. Modelin farklı şeyler bilmesi gerektiğinde, özellikle bu bilgi sık değişiyorsa, RAG kullanın. Pek çok üretim sistemi için hibrit yaklaşım en iyi sonucu verir.

Bir LLM'i ince ayarlamanın maliyeti ne kadar?

Ölçeğe bağlı olarak 0 ile 16.200 ₺ arasında. Bireysel geliştiricilerin çoğu, RunPod RTX 4090 (0,34 $/saat) üzerinde QLoRA kullanarak 30 ₺'nin altında harcama yapıyor. A100 üzerinde 70B üretim modeli 510–810 ₺'ye mal oluyor. H100 kümelerinde tam ince ayar 8.100–16.200 ₺. API ince ayarı (OpenAI) 1.000 örnek için 90–750 ₺ tutarında.

Bir LLM'i dizüstü bilgisayarımda ince ayarlayabilir miyim?

Evet, dizüstü bilgisayarınızda 12+ GB VRAM'li bir GPU varsa. RTX 3060 dizüstü GPU, QLoRA ile 8B modelleri yönetebilir. 16+ GB birleşik bellekli Apple Silicon Mac'ler de MLX aracılığıyla ince ayar yapabilir, ancak CUDA'dan daha yavaştır. Daha büyük modeller için bulut GPU'larına ihtiyacınız olacak.

LoRA ile QLoRA arasındaki fark nedir?

Her ikisi de temel modeli dondururken küçük eğitilebilir adaptör katmanları ekler. Fark: QLoRA ayrıca temel modeli 4 bit hassasiyete (NF4 veri türü) nicelleştirir ve standart LoRA'ya kıyasla VRAM kullanımını ~%25 azaltır. Kalite neredeyse aynıdır -- QLoRA, tam ince ayar kalitesinin %97–99'unu elde eder.

Kaç eğitim örneğine ihtiyacım var?

Görev karmaşıklığına bağlıdır. 50–100 örnek, kavram kanıtı için yeterlidir. 500–1.000 örnek, çoğu tek görev için kullanışlı sonuçlar üretir. 5.000–10.000 örnek, karmaşık görevler için üretim kalitesi sağlar. 10.000'in üzerinde, görevinizde son derece yüksek değişkenlik olmadıkça azalan getiriler görürsünüz.

2026'da hangi temel modeli ince ayarlamalıyım?

Genel amaçlı görevler için Llama 3.x (en iyi kalite/boyut oranı). Avrupa dilleri ve verimli çıkarım için Mistral. Çok dilli ve kod görevleri için Qwen 2.5. Mümkün olan en küçük ayak izine ihtiyaç duyduğunuzda Phi-4. Google ekosistemi entegrasyonu için Gemma 2.

GRPO nedir ve neden önemlidir?

GRPO (Grup Göreli Politika Optimizasyonu), DeepSeek tarafından tanıtılan, hizalama eğitimi için RLHF'nin ardılıdır. Temel avantajı: ayrı bir ödül modeli eğitimi gerektirmez, bu da hesaplama maliyetini yaklaşık yarıya indirir. TRL v0.15.0, GRPO'yu yerel olarak destekler ve Hugging Face ekosistemini kullanan herkes için erişilebilir kılar.

Felaket unutmasını nasıl önlerim?

Tam ince ayar yerine LoRA veya QLoRA kullanın -- temel model ağırlıklarını dondururlar, bu da genel bilgiyi korur. Öğrenme hızınızı düşük tutun (QLoRA için 2e-4, tam için 2e-5). Gerektiği kadar az dönem için eğitin (genellikle 1–3 yeterlidir). Eğitimden sonra, gerilemediğini doğrulamak için modelinizi genel kıyaslamalarda (MMLU, HellaSwag) çalıştırın.

İnce ayar ve RAG'ı birlikte kullanabilir miyim?

Kesinlikle, ve pek çok üretim sistemi tam olarak bunu yapıyor. Davranış ve format tutarlılığı için ince ayar yapın, ardından güncel bilgi alımı için RAG'ı bağlayın. İnce ayarlı model, alınan bağlamı daha iyi kullanır çünkü alanınızın dilini ve çıktı gereksinimlerini anlar.

İnce ayar ne kadar sürer?

Çoğu proje için 30 dakika ile 8 saat arasında. Unsloth + RTX 4090'da 500 örnekli 8B model 15–30 dakikada tamamlanır. Aynı iş ücretsiz Colab T4'te 1–2 saat sürer. A100'lerdeki 70B modeller 5–8 saat alır. Çoklu GPU kurulumlarında tam ince ayar 20–40 saat sürebilir.

OpenAI'nin ince ayar API'si buna değer mi?

Hızlı prototipleme için evet. Bir JSONL dosyası yükleyip 30 dakikada GPU kurulumu olmadan ince ayarlı bir GPT-4o-mini elde edebilirsiniz. Üretim için yerel ince ayar genellikle daha iyidir: ağırlıklara sahip olursunuz, veri gizliliğinizi kontrol edersiniz ve ölçekte maliyetler daha düşüktür. Çoğu ekip yaklaşımı doğrulamak için API ile başlar, ardından yerel sisteme geçer.

Sonuç

Bir LLM'i ince ayarlamak iki yıl önceki kadar karmaşık değil. İşte temel çıkarımlar:

  1. QLoRA + Unsloth ile başlayın -- tüketici donanımında kullanım durumlarının %90'ını karşılar
  2. İyi veri, daha büyük modeli her zaman geçer. Çabanızı GPU yükseltmeleri değil, veri kümesi kalitesine harcayın.
  3. Maliyet engeli kalktı -- bulut GPU'larında 1 doların altında 8B model ince ayarı
  4. Dağıtmadan önce her zaman temel modele karşı değerlendirin. Ölçülebilir biçimde daha iyi değilse göndermeyin.
  5. Önce RAG'ı düşünün -- yalnızca modelin farklı davranmasını istediğinizde ince ayar yapın, farklı şeyler bilmesini değil

Uygulamaya hazır mısınız? Eğitim çerçeveleri ve dağıtım seçeneklerinin ayrıntılı karşılaştırması için En İyi LLM İnce Ayar Araçları ve Platformları [yakında] kılavuzumuza bakın.

Bu kılavuzu faydalı bulduysanız, yapay zeka destekli ürünlerdeki daha geniş mimari kararlar için doğru yapay zeka yığınını seçme konusundaki incelememize göz atın.

Kaynaklar

Etiketler

llm ince ayarı nasıl yapılırLoRAQLoRAUnslothllm ince ayar kılavuzubüyük dil modelleri ince ayarıPEFT

Bu makaleyi paylaş

Projenize Başlayın

Harika bir şey inşa etmeye hazır mısınız?

Vizyonunuzu hayata geçirelim. Fark yaratan yazılımlar için ekibimiz hazır.