LoRA Nedir ve Düşük Maliyetli Model Eğitimi Nasıl Yapılır?

Yazar: Deniz AltanYayın: 7 Eyl 2026Güncelleme: 7 Eyl 202616 dk Okuma

LoRA (Low-Rank Adaptation), büyük dil modellerinin parametre ağırlıklarını dondurarak daha az bellek ve düşük maliyetle ince ayar (fine-tuning) yapılmasını sağlayan bir yöntemdir.

LoRA Nedir ve Düşük Maliyetli Model Eğitimi Nasıl Yapılır? için öne çıkan görsel
LoRA Nedir ve Düşük Maliyetli Model Eğitimi Nasıl Yapılır? için öne çıkan görsel

LoRA (Low-Rank Adaptation), büyük dil modellerinin parametre ağırlıklarını dondurarak daha az bellek ve düşük maliyetle ince ayar (fine-tuning) yapılmasını sağlayan yenilikçi bir yapay zeka optimizasyon yöntemidir. Geleneksel model uyarlama süreçlerinin gerektirdiği devasa hesaplama bütçelerini ve yüksek bellekli GPU yatırımlarını ortadan kaldıran bu yaklaşım, kurumsal ölçekte özelleştirilmiş yapay zeka çözümleri geliştirmeyi ekonomik hale getirir. Bu rehberde, LoRA Nedir ve Düşük Maliyetli Model Eğitimi Nasıl Yapılır? sorusunun teknik temellerini, matematiksel çalışma prensibini, donanım optimizasyonlarını, adım adım uygulama aşamalarını ve kurumsal risk yönetim stratejilerini ayrıntılı olarak inceleyeceğiz.

LoRA (Low-Rank Adaptation) Nedir?

LoRA (Low-Rank Adaptation), Edward Hu ve ekibi tarafından Microsoft çatısı altında geliştirilen ve büyük dil modellerinin (LLM) ince ayar süreçlerini optimize eden parametre verimli bir eğitim metodolojisidir. Üretken yapay zeka modelleri milyarlarca parametreden oluşur. Bir modelin belirli bir sektörel terminolojiye, şirket içi dokümantasyona veya özel bir göreve uyarlanması gerektiğinde, modelin tüm parametrelerini baştan eğitmek (Full Fine-Tuning) olağanüstü hesaplama gücü ve bütçe gerektirir. LoRA, bu engeli aşmak amacıyla orijinal ağırlık matrislerini tamamen dondurur ve modele sadece eğitilebilir düşük dereceli (low-rank) ayrıştırma matrisleri ekler.

Bu metodoloji sayesinde, modelin temel genel kültür ve dil anlama kabiliyetleri korunurken, hedeflenen göreve özgü davranış kalıpları sadece toplam parametrelerin %0.1 ile %1'i arasındaki bir katsayı eğitilerek modele kazandırılır. LoRA, yapay zeka mühendisliğinde model özelleştirme maliyetlerini kökten değiştiren bir standart haline gelmiştir.

Geleneksel İnce Ayarın (Full Fine-Tuning) Yüksek Maliyet Problemi

Geleneksel ince ayar (Full Parameter Fine-Tuning) yaklaşımında, modelin sahip olduğu tüm ağırlıklar (WW) eğitim verisi ile her iterasyonda güncellenir. 70 milyar parametreli (70B) modern bir dil modelini tam parametreyle eğitmek, yalnızca modelin kendisini değil; gradyanları, momentum değerlerini ve optimizasyon durumlarını (Adam optimizer state) saklamak için yüzlerce gigabayt VRAM gerektirir.

16-bit hassasiyette (FP16/BF16) çalışan 70B bir modelin ağırlıkları yaklaşık 140 GB bellek kaplarken, tam parametre eğitim sırasında AdamW optimizasyonunun gerektirdiği ek bellek katmanlarıyla birlikte bu ihtiyaç 800 GB ila 1 TB VRAM sınırını aşar. Bu durum, eğitim sürecinin en az 8 ila 16 adet 80 GB NVIDIA A100/H100 Tensor Core GPU kümesi üzerinde dağıtık olarak çalışmasını zorunlu kılar. Bulut sağlayıcılarındaki saatlik GPU kiralama bedelleri ve haftalarca süren eğitim döngüleri göz önüne alındığında, tek bir model adaptasyonunun maliyeti on binlerce dolara ulaşabilir.

Ayrıca tam parametre ince ayar, her yeni kurumsal kullanım senaryosu (müşteri destek, sözleşme analizi, kod asistanı) için modelin tamamının diskte ayrı bir kopya olarak saklanmasını gerektirir. Her biri 140 GB tutan onlarca farklı model varyantının depolanması ve servis edilmesi, altyapı operasyonlarını hem teknik hem de finansal açıdan sürdürülemez hale getirir.

LoRA’nın Matematiksel Çalışma Mantığı: Parametre Ağırlıklarını Dondurmak

LoRA’nın arkasındaki matematiksel ilke, derin öğrenme modellerindeki aşırı parametrelendirilmiş matrislerin aslında düşük bir "içsel boyuta" (intrinsic dimension) sahip olduğu hipotezine dayanır. Yani bir modeli belirli bir göreve uyarlarken gerçekleşen ağırlık değişimi (ΔW\Delta W), aslında orijinal ağırlık matrisi (W0W_0) kadar yüksek bir serbestlik derecesine ihtiyaç duymaz.

Modelin bir katmanındaki d×kd \times k boyutlarındaki orijinal önceden eğitilmiş ağırlık matrisini W0W_0 olarak tanımlayalım. Standart ince ayarda amaç doğrudan W=W0+ΔWW = W_0 + \Delta W matrisini öğrenmektir. LoRA ise W0W_0 matrisini tamamen dondurur ve gradyan güncellemelerini durdurur. Bunun yerine ΔW\Delta W ağırlık güncellemesini iki küçük matrisin çarpımı olarak modeller:

ΔW=B×A\Delta W = B \times A

Burada BRd×rB \in \mathbb{R}^{d \times r} ve ARr×kA \in \mathbb{R}^{r \times k} boyutlarındadır. Ayrıştırmanın derecesi (rank) olan rr, rmin(d,k)r \ll \min(d, k) koşulunu sağlar. Örneğin d=4096d = 4096 ve k=4096k = 4096 boyutunda bir matris için r=8r = 8 veya r=16r = 16 gibi son derece küçük bir değer seçilir.

Eğitimin başlangıcında AA matrisi Gauss dağılımı ile rastgele başlatılırken, BB matrisi sıfır (0) olarak başlatılır. Bu sayede eğitimin en başında ΔW=0\Delta W = 0 olur ve modelin orijinal davranışı korunur. Girdi vektörü xx için ileriye doğru hesaplama şu şekilde gerçekleşir:

h=W0x+ΔWx=W0x+αrBAxh = W_0 x + \Delta W x = W_0 x + \frac{\alpha}{r} B A x

Formüldeki α\alpha (Alpha), LoRA çıktısının orijinal model ağırlıkları üzerindeki etki katsayısını belirleyen sabit bir hiperparametredir. Bu matematiksel tasarım sayesinde optimize edilmesi gereken parametre sayısı yüzlerce kat azalır.

PEFT (Parameter-Efficient Fine-Tuning) Yaklaşımı ve Rolü

PEFT (Parametre Verimli İnce Ayar), modelin parametrelerinin büyük çoğunluğunu sabit tutarak sadece belirli alt modülleri veya ek katmanları eğiten tekniklerin çatı adıdır. LoRA, PEFT ekosisteminin en yaygın ve kararlı bileşenidir.

PEFT yaklaşımının temel avantajı, çıkarım (inference) aşamasında hiçbir ek gecikme süresi (latency) yaratmamasıdır. LoRA ile eğitilen B×AB \times A matrisleri, eğitim tamamlandıktan sonra doğrudan orijinal W0W_0 matrisine matematiksel olarak eklenebilir (Wyeni=W0+αrBAW_{yeni} = W_0 + \frac{\alpha}{r} B A). Bu durum, model yayına alındığında fazladan hesaplama maliyeti oluşmasını engeller ve sıfır çıkarım gecikmesi sağlar.

Neden LoRA? Kurumsal İşletmeler ve Geliştiriciler İçin Avantajları

Kurumsal düzeyde yapay zeka benimsemesinde karşılaşılan en büyük darboğazlar; donanım tedarik süreleri, astronomik bulut işlemci faturaları ve hassas kurumsal verilerin üçüncü taraf API sağlayıcılarına aktarılmasından doğan uyumluluk (GDPR/KVKK) endişeleridir. LoRA, bu üç kritik engeli aynı anda ortadan kaldıran pratik bir optimizasyon çerçevesi sunar.

İşletmeler genel amaçlı kapalı kaynak API'lere bağımlı kalmak yerine, açık kaynaklı temel modelleri (Llama 3, Mistral, Qwen vb.) kendi bünyelerinde LoRA ile eğitebilir. Bu durum kurumlara tam veri egemenliği ve öngörülebilir bir maliyet yapısı kazandırır.

GPU ve VRAM İhtiyacında Dramatik Düşüş (Maliyet Optimizasyonu)

Geleneksel model eğitiminde VRAM gereksiniminin aslan payını model parametrelerinin kendisi değil, gradyanlar ve optimizer durumları oluşturur. FP32 hassasiyetindeki Adam optimizer, eğitilen her parametre için bellekte 8 bayt ek alan tutar. 8 milyar parametreli bir modelde (8B) tam parametre eğitimi yapıldığında yalnızca optimizer için yaklaşık 64 GB ek VRAM gerekir.

LoRA kullanıldığında ise eğitilen parametre sayısı toplam modelin %0.2'sine kadar düşer. Bu sayede optimizer belleği megabayt seviyesine geriler. 8 milyar parametreli bir Llama modeli, 80 GB'lık kurumsal bir A100 yerine 24 GB VRAM'e sahip standart bir NVIDIA RTX 4090 veya RTX 3090 üzerinde rahatlıkla eğitilebilir.

KARŞILAŞTIRMA TABLOSU

Karşılaştırma Tablosu

Kriter bazında avantajlar ve dezavantajları karşılaştırın.

Kriter
Avantajlar
Dezavantajlar
01 Full Fine-Tuning
8B Parametre
2x A100 (80 GB) / 160 GB
02 LoRA
8B Parametre
1x RTX 4090 (24 GB) / 24 GB
03 QLoRA (4-bit)
8B Parametre
1x T4 / RTX 3060 (12-16 GB)
04 Full Fine-Tuning
70B Parametre
8x A100/H100 (80 GB) / 640 GB
05 LoRA
70B Parametre
2x A100 (80 GB) / 160 GB
06 QLoRA (4-bit)
70B Parametre
2x RTX 4090 veya 1x A100 (48-80 GB)
01

Full Fine-Tuning

Avantaj

8B Parametre

Dezavantaj

2x A100 (80 GB) / 160 GB

02

LoRA

Avantaj

8B Parametre

Dezavantaj

1x RTX 4090 (24 GB) / 24 GB

03

QLoRA (4-bit)

Avantaj

8B Parametre

Dezavantaj

1x T4 / RTX 3060 (12-16 GB)

04

Full Fine-Tuning

Avantaj

70B Parametre

Dezavantaj

8x A100/H100 (80 GB) / 640 GB

05

LoRA

Avantaj

70B Parametre

Dezavantaj

2x A100 (80 GB) / 160 GB

06

QLoRA (4-bit)

Avantaj

70B Parametre

Dezavantaj

2x RTX 4090 veya 1x A100 (48-80 GB)

Bu donanım tasarrufu, Ar-Ge ve geliştirme döngülerindeki deneme maliyetlerini %80 ila %90 oranında aşağı çeker. Ekipler başarısız denemelerden finansal zarar görmeden farklı veri kümeleriyle hızlı iterasyonlar yapabilir.

Depolama ve Dağıtım Kolaylığı: Gigabaytlar Yerine Megabaytlar

LoRA eğitiminin çıktısı, modelin tamamını içeren devasa bir dosya kümesi değildir. Yalnızca eğitilen düşük dereceli AA ve BB matrislerinin ağırlıklarını içeren bir adapter_model.safetensors ve yapılandırma dosyasından (adapter_config.json) oluşur.

Bu adaptör dosyalarının boyutu genellikle 20 MB ile 300 MB arasında değişir. Bu durum operasyonel dağıtımda benzersiz esneklikler sağlar:

  • Çoklu Görev Yönetimi: Tek bir temel model belleğe yüklenir; müşteri hizmetleri, hukuki analiz veya kod yazımı için farklı LoRA adaptörleri milisaniyeler içinde dinamik olarak takılıp çıkarılabilir (hot-swapping).

  • Bant Genişliği ve CI/CD: Dağıtım hatlarında yüzlerce gigabaytlık modelleri sunuculara taşımak yerine, küçük adaptör dosyaları saniyeler içinde Kubernetes kümelerine dağıtılabilir.

  • Versiyon Kontrolü: Git LFS veya model kayıt defterlerinde (Hugging Face Hub, MLflow) her model sürümünü megabayt seviyesinde versiyonlamak mümkün hale gelir.

Hassas Veriler İçin Veri Gizliliği ve On-Premise Eğitim Avantajı

Finans, sağlık, hukuk ve savunma sanayii gibi regülasyona tabi sektörlerde müşteri verilerinin, hasta kayıtlarının veya ticari sırların genel bulut API'lerine gönderilmesi yasal riskler doğurur. LoRA'nın düşük donanım gereksinimi, şirketlerin model eğitim süreçlerini tamamen kendi yerel sunucularında (on-premise) veya güvenli özel sanal bulutlarında (VPC) yürütmelerine olanak tanır.

Kurumlar, GDPR, KVKK ve HIPAA standartlarına tam uyum sağlayarak, hiçbir hassas veriyi şirket dışına sızdırmadan kendi özel modellerini inşa edebilir. Bu durum, veri egemenliğini kurumsal stratejinin merkezine koyan yapılar için en güvenli yoldur.

LoRA vs. QLoRA vs. Geleneksel Fine-Tuning: Karşılaştırmalı Değerlendirme

Model uyarlama stratejisi belirlenirken yöneticilerin ve teknik liderlerin en sık karşılaştığı ikilem; Full Fine-Tuning, standart LoRA ve QLoRA (Quantized Low-Rank Adaptation) arasındaki doğru dengeyi kurmaktır. Her yöntemin donanım gereksinimi, eğitim süresi ve model performansı üzerinde farklı etkileri bulunur.

QLoRA, Tim Dettmers ve ekibi tarafından 2023 yılında tanıtılan, LoRA mantığını 4-bit NormalFloat (NF4) kuantizasyonu ve çift kuantizasyon (Double Quantization) teknikleriyle birleştiren ileri düzey bir yaklaşımdır. QLoRA, temel modelin ağırlıklarını 4-bite sıkıştırarak VRAM tüketimini daha da aşağı çeker.

Karşılaştırma KriteriGeleneksel (Full) Fine-TuningStandart LoRA (16-bit)QLoRA (4-bit)
Temel Model HassasiyetiFP16 / BF16 (16-bit)FP16 / BF16 (16-bit)NF4 / FP4 (4-bit Kuantize)
Adaptör HassasiyetiYok (Tüm model eğitilir)FP16 / BF16FP16 / BF16
VRAM Tüketimi (Göreceli)Çok Yüksek (%100)Düşük (%25 - %35)Çok Düşük (%10 - %15)
Eğitim Hızı (Throughput)Hızlı (Büyük GPU kümesinde)Çok Hızlı (Düşük veri transferi)Kısmen Yavaş (Dequantize yükü)
Çıkarım (Inference) EntegrasyonuDoğrudan modelSıfır gecikmeyle birleştirilebilirKuantize model veya FP16 birleştirme
Genel Performans/Doğruluk%100 (Referans)%98 - %99.5%96 - %99
Gereken Donanım SeviyesiÇoklu Kurumsal GPU KümeleriOrta/Üst Seviye Tekil GPUGiriş/Orta Seviye Tekil GPU

Temel Model Hassasiyeti

Geleneksel (Full) Fine-Tuning

FP16 / BF16 (16-bit)

Standart LoRA (16-bit)

FP16 / BF16 (16-bit)

QLoRA (4-bit)

NF4 / FP4 (4-bit Kuantize)

Adaptör Hassasiyeti

Geleneksel (Full) Fine-Tuning

Yok (Tüm model eğitilir)

Standart LoRA (16-bit)

FP16 / BF16

QLoRA (4-bit)

FP16 / BF16

VRAM Tüketimi (Göreceli)

Geleneksel (Full) Fine-Tuning

Çok Yüksek (%100)

Standart LoRA (16-bit)

Düşük (%25 - %35)

QLoRA (4-bit)

Çok Düşük (%10 - %15)

Eğitim Hızı (Throughput)

Geleneksel (Full) Fine-Tuning

Hızlı (Büyük GPU kümesinde)

Standart LoRA (16-bit)

Çok Hızlı (Düşük veri transferi)

QLoRA (4-bit)

Kısmen Yavaş (Dequantize yükü)

Çıkarım (Inference) Entegrasyonu

Geleneksel (Full) Fine-Tuning

Doğrudan model

Standart LoRA (16-bit)

Sıfır gecikmeyle birleştirilebilir

QLoRA (4-bit)

Kuantize model veya FP16 birleştirme

Genel Performans/Doğruluk

Geleneksel (Full) Fine-Tuning

%100 (Referans)

Standart LoRA (16-bit)

%98 - %99.5

QLoRA (4-bit)

%96 - %99

Gereken Donanım Seviyesi

Geleneksel (Full) Fine-Tuning

Çoklu Kurumsal GPU Kümeleri

Standart LoRA (16-bit)

Orta/Üst Seviye Tekil GPU

QLoRA (4-bit)

Giriş/Orta Seviye Tekil GPU

Hangi Durumda Hangi Yöntemi Seçmelisiniz? (Karar Matrisi)

Doğru metodolojiyi seçmek kurumsal bütçenin ve zamanın verimli kullanılmasını sağlar:

  1. Tam Parametre Fine-Tuning Tercih Edilmelidir:

  • Modelin sıfırdan yeni bir dil veya alfabe öğrenmesi gerekiyorsa.

  • Modelin temel mantık yürütme yeteneklerinin tamamen yeniden yapılandırılması hedefleniyorsa.

  • Bütçe ve donanım kısıtı bulunmuyorsa ve en yüksek teorik performans aranıyorsa.

  1. Standart LoRA Tercih Edilmelidir:

  • Modelin kurumsal bir formata, üsluba, JSON/XML çıktı şablonuna veya belirli bir alan terminolojisine uyarlanması isteniyorsa.

  • Eğitim hızının ve işlem akışının (throughput) yüksek olması hedefleniyorsa.

  • Çıkarım aşamasında model ağırlıklarının taban modelle kalıcı olarak birleştirilip sıfır gecikmeyle çalıştırılması planlanıyorsa.

  1. QLoRA Tercih Edilmelidir:

  • Çok kısıtlı donanım kaynaklarıyla (örneğin tek bir 16 GB veya 24 GB GPU ile 30B-70B modeller) çalışılıyorsa.

  • Maksimum maliyet tasarrufu öncelikliyse ve eğitim süresindeki %20-30'luk uzama tolere edilebiliyorsa.

Performans ve Bellek Tüketimi Dengesi

Pratik testler ve akademik literatür, doğru hiperparametrelerle yapılandırılmış bir LoRA adaptörünün, tam parametre ince ayar performansının %99'una ulaştığını kanıtlamaktadır. QLoRA tarafında ise 4-bit kuantizasyon kaynaklı ufak bir bilgi kaybı riski bulunsa da, Page Optimizers ve NormalFloat4 veri tipi sayesinde bu kayıp çoğu pratik kurumsal görevde önemsiz seviyededir.

Bellek tarafındaki tasarruf ise lineer değil çarpanlıdır. LoRA, küçük bütçeli girişimlerin dahi 70 milyar parametrelik son teknoloji açık kaynak modeller üzerinde kendi özel modellerini inşa etmelerine imkan tanır.

Adım Adım LoRA ile Düşük Maliyetli Model Eğitimi Nasıl Yapılır?

LoRA ile düşük maliyetli model eğitimi gerçekleştirmek; doğru veri mühendisliği, altyapı seçimi ve hiperparametre optimizasyonunu bir araya getiren sistematik bir mühendislik sürecidir. Başarılı bir adaptasyon için sürecin dört ana aşamada ele alınması gerekir.

SÜREÇ ADIMLARI

LoRA Model Eğitimi Uygulama Aşamaları

Düşük maliyetli ve yüksek doğruluklu model eğitimi için izlenmesi gereken operasyonel adımlar.

01

Veri Hazırlığı ve Formatlama

İşletme verilerini temizleyin, tokenize edin ve Alpaca/ShareGPT gibi standart JSON formatlarına dönüştürün.

02

Altyapı ve Kütüphane Kurulumu

PyTorch, Transformers, PEFT, TRL ve BitsAndBytes kütüphanelerini GPU ortamında yapılandırın.

03

LoRA Hiperparametre Yapılandırması

Rank (

04

), Alpha (

) ve hedef katmanları (Target Modules) görevin karmaşıklığına göre belirleyin.

05

Eğitim ve Kayıp (Loss) Takibi

SFTTrainer ile eğitimi başlatın; doğrulama kaybını (validation loss) izleyerek aşırı uyumu (overfitting) engelleyin.

1. Aşama: Veri Seti Hazırlığı ve Kalite Standartları (Garbage In, Garbage Out)

Model eğitiminde en sık yapılan hata, model boyutuna veya eğitim süresine odaklanıp veri kalitesini ihmal etmektir. LoRA gibi yöntemler modelin mevcut bilgisini yeniden şekillendirdiği için, eğitim verisindeki tutarsızlıklar ve hatalar hızla model davranışına yansır.

  1. Veri Çeşitliliği ve Hacmi: Görev odaklı ince ayar için genellikle 1.000 ile 10.000 arasında yüksek kaliteli, filtrelenmiş ve doğrulanmış örnek veri çifti yeterlidir. Milyonlarca satırlık kalitesiz veri yerine, özenle denetlenmiş 2.000 örnek çok daha üstün sonuç verir.

  2. Format Standartları: Veriler genellikle instruction-input-output (Alpaca formatı) veya çoklu diyalog (ShareGPT formatı) yapısında hazırlanır:

[
  {
    "instruction": "Aşağıdaki kurumsal sözleşme maddesindeki fesih süresini ve cezai şartı analiz et.",
    "input": "Taraflardan herhangi biri, 30 gün önceden yazılı bildirimde bulunmak kaydıyla sözleşmeyi tek taraflı feshedebilir. Süreye uyulmaması durumunda son 3 aylık fatura bedeli kadar cezai şart ödenir.",
    "output": "Fesih Bildirim Süresi: 30 gün (yazılı bildirim şartı).\nCezai Şart: Bildirim süresine uyulmaması halinde son 3 aylık fatura bedeli tutarı."
  }
]
  1. Veri Temizliği: Yinelenen (duplicate) veriler elenmeli, HTML/özel karakter artıkları temizlenmeli ve hassas kişisel veriler (PII - Personally Identifiable Information) regex veya anonimleştirme araçlarıyla maskelenmelidir.

2. Aşama: Altyapı ve GPU Kaynağının Seçilmesi (Bulut vs. Local Donanım)

Eğitim altyapısı bütçeye ve güvenlik gereksinimlerine göre seçilmelidir:

  • Yerel Donanım (Local): 8B-14B modeller için en az 16-24 GB VRAM'e sahip NVIDIA GPU'lar (RTX 3090, RTX 4090, RTX 6000 Ada) yeterlidir. Sabit donanım yatırımı uzun vadede en düşük maliyeti sunar.

  • Bulut GPU Kiralama: RunPod, Lambda Labs, Vast.ai veya kurumsal düzeyde AWS/GCP/Azure üzerinden saatlik kiralama yapılabilir. RTX 4090 için saatlik maliyet ~$0.40 - $0.80, A100 (80GB) için ise ~$1.50 - $2.50 bandındadır.

Gerekli temel Python kütüphaneleri ortamda yapılandırılmalıdır:

pip install torch transformers datasets peft trl bitsandbytes accelerate

3. Aşama: Hugging Face PEFT ile Hiperparametrelerin (Rank r ve Alpha) Ayarlanması

LoRA eğitiminin başarısı, LoraConfig parametrelerinin doğru seçilmesine bağlıdır:

  • Rank (rr): Düşük dereceli matrislerin boyutunu belirler. Genellikle r=8,16,32,64r = 8, 16, 32, 64 değerleri kullanılır. Sınıflandırma ve basit formatlama görevleri için r=8r = 8 veya $16$ yeterliyken; karmaşık mantık yürütme, tıp/hukuk gibi uzmanlık alanları için r=32r = 32 veya $64$ tercih edilir.

  • Alpha (α\alpha): LoRA güncellemelerinin ölçeklendirme çarpanıdır. Standart kural olarak α=2×r\alpha = 2 \times r veya α=r\alpha = r seçilir. Alpha değeri büyüdükçe adaptörün model çıktısı üzerindeki baskısı artar.

  • LoRA Dropout: Adaptör katmanlarında aşırı uyumu engellemek için kullanılan nöron bırakma oranıdır (genellikle $0.05$ veya $0.1$).

  • Target Modules: LoRA'nın uygulanacağı dikkat (attention) ve MLP katmanlarıdır. Modern mimarilerde en iyi sonuç, yalnızca q_proj ve v_proj katmanlarına değil; tüm lineer katmanlara (q_proj, k_proj, v_proj, o_proj, gate_proj, up_proj, down_proj) adaptör eklenerek alınır.

Örnek bir Python PEFT konfigürasyonu:

from peft import LoraConfig, TaskType

lora_config = LoraConfig(
    r=16,
    lora_alpha=32,
    target_modules=[
        "q_proj",
        "k_proj",
        "v_proj",
        "o_proj",
        "gate_proj",
        "up_proj",
        "down_proj"
    ],
    lora_dropout=0.05,
    bias="none",
    task_type=TaskType.CAUSAL_LM
)

4. Aşama: Eğitim Süreci, Kayıp (Loss) Grafikleri ve İzleme

Model eğitimi Hugging Face TRL kütüphanesinin SFTTrainer (Supervised Fine-tuning Trainer) sınıfı ile yürütülür. Eğitim sürecinde aşağıdaki dinamikler yakından izlenmelidir:

from transformers import TrainingArguments
from trl import SFTTrainer

training_args = TrainingArguments(
    output_dir="./lora_output",
    per_device_train_batch_size=4,
    gradient_accumulation_steps=4,
    learning_rate=2e-4,
    lr_scheduler_type="cosine",
    logging_steps=10,
    num_train_epochs=3,
    optim="paged_adamw_8bit", # Bellek optimizasyonu
    fp16=True, # veya donanım destekliyorsa bf16=True
    evaluation_strategy="steps",
    eval_steps=50,
    save_strategy="steps",
    save_steps=100,
    warmup_ratio=0.03,
    weight_decay=0.01
)

Eğitim sırasında Training Loss ve Validation Loss grafikleri sürekli takip edilmelidir. Eğitim kaybı düzenli olarak düşerken doğrulama kaybı artmaya başlıyorsa model eğitim verisini ezberlemeye (overfitting) başlamış demektir. Bu noktada eğitim erken durdurulmalı (early stopping) veya dropout artırılmalıdır.

Model Doğrulaması ve Risk Yönetimi: Eğitilen Modeli Yayına Alma

LoRA eğitimi tamamlandıktan sonra elde edilen adaptörün hemen üretim ortamına alınması ciddi kurumsal riskler taşır. İnce ayar yapılmış modeller, belirli bir alanda uzmanlaşırken beklenmedik şekillerde halüsinasyon üretebilir veya genel anlama yeteneklerini kaybedebilir. Bu nedenle kapsamlı bir doğrulama ve risk yönetimi çerçevesi zorunludur.

Halüsinasyon (Doğruluk) Riski ve Çıktı Testleri

İnce ayar, bir modele yepyeni bilgiler eklemekten ziyade modelin davranışını, üslubunu ve çıktı formatını hizalama konusunda etkilidir. Modele eğitim verisi üzerinden doğrudan bilgi depolamaya çalışmak, modelin bilmediği konularda özgüvenli şekilde yanlış bilgiler (halüsinasyon) üretme riskini artırır.

Bilgiye dayalı kurumsal görevlerde LoRA, RAG (Retrieval-Augmented Generation) mimarisiyle hibrit olarak kullanılmalıdır. Model bilgiyi RAG üzerinden kurumsal veri tabanından almalı, LoRA adaptörü ise yalnızca bu bilgiyi doğru formatta işleme, özetleme ve sektörel üslupla sunma görevini üstlenmelidir.

Doğrulama testlerinde:

  • G-Eval ve LLM-as-a-Judge: Eğitilen modelin yanıtları, daha büyük bir hakem model (örneğin GPT-4o veya Claude 3.5 Sonnet) tarafından doğruluk, alaka düzeyi ve format uyumu kriterlerine göre puanlanmalıdır.

  • Kör Testler (Blind A/B Testing): Model çıktıları, konu uzmanı insan operatörler tarafından temel model ve rakip adaptörlerle kör testlere tabi tutulmalıdır.

Katastrofik Unutma (Catastrophic Forgetting) ve Genel Yetenek Koruma

Katastrofik unutma, bir yapay zeka modelinin yeni bir görevi öğrenirken önceden sahip olduğu genel dil anlama, mantık yürütme veya kodlama yeteneklerini dramatik şekilde kaybetmesi durumudur.

LoRA, temel modelin parametrelerini dondurduğu için geleneksel tam eğitime göre katastrofik unutmaya karşı çok daha dirençlidir. Ancak yine de adaptör katsayıları aşırı yüksek seçildiğinde veya eğitim verisi çok dar bir alana odaklandığında genel performans düşüşleri gözlemlenebilir.

Bunu engellemek için eğitim veri setine %10-15 oranında genel anlama, özetleme ve mantık yürütme örnekleri (OpenHermes, UltraChat gibi genel veri kümelerinden) dahil edilmelidir.

İnsan Denetimi (Human-in-the-Loop) Mekanizmasının Kurgulanması

Hiçbir yapay zeka modeli kritik kurumsal süreçlerde %100 otonom bırakılmamalıdır. Modelin ürettiği çıktılar için güven skoru eşikleri (confidence thresholds) tanımlanmalıdır.

Modelin güven skorunun düşük olduğu durumlar, istisnai sözleşme maddeleri veya regülasyon riski taşıyan tıbbi/hukuki çıktılar otomatik olarak insan operatörün onay ekranına yönlendirilmelidir. Bu insan denetimi döngüsü (Human-in-the-Loop), hem hataların müşteriye yansımasını önler hem de gelecekteki LoRA eğitimleri için mükemmel bir düzeltilmiş veri kaynağı oluşturur.

Sıkça Sorulan Sorular

LoRA eğitimi için minimum kaç GB VRAM gerekir?

8 milyar parametreli bir model için standart 16-bit LoRA eğitimi en az 24 GB VRAM gerektirirken, QLoRA (4-bit kuantizasyon) tekniğiyle bu gereksinim 12-16 GB VRAM seviyesine (örneğin RTX 3060 veya RTX 4080) kadar düşmektedir.

LoRA adaptörleri çıkarım (inference) hızını yavaşlatır mı?

Hayır, LoRA adaptörleri eğitim tamamlandıktan sonra merge_and_unload() fonksiyonu ile orijinal model ağırlıklarına matematiksel olarak kalıcı biçimde eklenebilir, bu sayede sıfır çıkarım gecikmesiyle çalışır.

LoRA ile eğitilen bir adaptör farklı bir temel modele takılabilir mi?

Hayır, LoRA adaptörleri yalnızca eğitildikleri temel modelin spesifik mimarisi, katman boyutları ve ağırlık uzayı için geçerlidir; örneğin Llama 3 8B için eğitilen bir adaptör Mistral 7B modeline doğrudan uygulanamaz.

QLoRA ile standart LoRA arasındaki temel performans farkı nedir?

QLoRA temel modeli 4-bit kuantize ederek VRAM tüketimini yarı yarıya azaltır; genel görevlerde standart LoRA ile neredeyse aynı çıktıyı verirken dekuantizasyon işlemleri nedeniyle eğitim süresi yaklaşık %20-30 daha uzun sürebilir.

LoRA eğitimi sırasında Rank (r) değeri kaç seçilmelidir?

Metin sınıflandırma, özetleme veya sabit formatlı JSON çıktıları gibi standart görevler için veya yeterlidir; ancak karmaşık muhakeme, kod üretimi ve derin alan uzmanlığı gerektiren projelerde veya tercih edilmelidir.

Şirket verilerimizi LoRA ile eğitirken veri gizliliğini nasıl sağlarız?

Açık kaynaklı modelleri ve Hugging Face PEFT kütüphanesini kendi yerel donanımınızda veya izole sanal özel bulutunuzda (VPC) çalıştırarak hiçbir veriyi üçüncü taraf API sunucularına göndermeden tam uyumlu ve güvenli eğitim yapabilirsiniz.

LoRA yöntemi büyük dil modelleri dışındaki mimarilerde kullanılabilir mi?

Evet, LoRA mimarisi Stable Diffusion, Flux ve Midjourney benzeri üretken görsel modellerinin yanı sıra ses işleme ve çok modlu (multimodal) yapay zeka modellerinde de yaygın olarak kullanılmaktadır.

LoRA ile model eğitmek halüsinasyon riskini tamamen ortadan kaldırır mı?

Hayır, LoRA modelin format ve üslup uyumunu artırsa da halüsinasyon riskini sıfırlamaz; olgusal doğruluğun kritik olduğu kurumsal senaryolarda LoRA adaptörünün bir RAG (Retrieval-Augmented Generation) mimarisiyle desteklenmesi gerekir.

Son Adım

Dijital projenizi bugün planlayalım

Web, yazılım, e-ticaret, mobil uygulama, entegrasyon, SEO veya GEO ihtiyacınızı net bir kapsama dönüştürelim.

LoRA Nedir ve Düşük Maliyetli Model Eğitimi Nasıl Yapılır? | Webizm