Yerel Yapay Zeka Modeli Nasıl Çalıştırılır?
Yerel yapay zeka modelleri, LM Studio ve Ollama benzeri araçlarla yerel donanımda çalıştırılarak veri gizliliği ve internet bağımsızlığı sağlar.

İÇİNDEKİLER
%0 okundu
- Neden Yerel Yapay Zeka (Local LLM)? İşletmeler İçin Avantajları
- Yerel Yapay Zeka İçin Gerekli Donanım Altyapısı Nedir?
- En Popüler Yerel Yapay Zeka Araçları: Ollama ve LM Studio
- Adım Adım Yerel Yapay Zeka Modeli Kurulum Rehberi
- Kurumsal Entegrasyon: Yerel Modelleri İş Süreçlerine Dahil Etmek
- Yerel Yapay Zekanın Sınırları ve Risk Yönetimi
Yerel yapay zeka modelleri, LM Studio ve Ollama benzeri araçlarla yerel donanımda çalıştırılarak veri gizliliği ve internet bağımsızlığı sağlar.
Bulut tabanlı yapay zeka servislerinin getirdiği veri güvenliği endişeleri, değişken API maliyetleri ve ağ bağımlılığı; kurumları ve teknik karar vericileri kendi altyapılarında çalışan çözümlere yönlendirmektedir. Açık kaynak kodlu büyük dil modellerinin (LLM) donanım verimliliğinin artmasıyla birlikte, tüketici sınıfı donanımlardan kurumsal sunuculara kadar geniş bir yelpazede yerel model çalıştırmak mümkün hale gelmiştir. Yerel Yapay Zeka Modeli Nasıl Çalıştırılır sorusunun yanıtı; doğru donanım seçimi, uygun model mimarisinin belirlenmesi, kuantizasyon optimizasyonu ve Ollama veya LM Studio gibi çalıştırma motorlarının yapılandırılmasından oluşan çok aşamalı bir mühendislik sürecini kapsar. Bu rehber, işletmelerin hassas verilerini dışarı sızdırmadan kendi yapay zeka altyapılarını kurmaları için gereken tüm teknik adımları ve mimari kararları ayrıntılı olarak ele almaktadır.
Neden Yerel Yapay Zeka (Local LLM)? İşletmeler İçin Avantajları
Geleneksel bulut tabanlı yapay zeka sağlayıcıları, verilerin üçüncü taraf sunucularda işlenmesini zorunlu kılar. Bu durum, özellikle finans, sağlık, hukuk ve Ar-Ge odaklı çalışan kurumlar için ciddi bir uyumluluk ve bilgi güvenliği riski yaratır. Yerel büyük dil modelleri (Local LLM), hesaplama gücünü tamamen şirket içi sunucularda veya yerel iş istasyonlarında tutarak verinin fiziksel sınırların dışına çıkmasını engeller. Çıktı üretim hızı, harici internet bant genişliğinden bağımsız hale gelirken, kurumun fikri mülkiyeti ve müşteri verileri tam kontrol altında kalır.
Maliyet yönetimi açısından incelendiğinde, bulut API'leri kullanılan token başına ücretlendirme modeline dayanır. Yüksek hacimli belge analizi, müşteri hizmetleri otomasyonu veya sürekli veri çıkarma süreçlerinde API maliyetleri logaritmik olarak artış gösterebilir. Yerel yapay zeka modellerinde ise başlangıçtaki donanım amortismanı ve elektrik tüketimi haricinde marjinal token maliyeti sıfırdır. Bu durum, operasyonel giderleri (OpEx) sabit ve öngörülebilir sermaye giderlerine (CapEx) dönüştürerek uzun vadede bütçe avantajı sağlar.
KVKK ve GDPR Perspektifinden Veri Gizliliği
6698 sayılı Kişisel Verilerin Korunması Kanunu (KVKK) ve Avrupa Birliği Genel Veri Koruma Tüzüğü (GDPR), kişisel verilerin sınır ötesine aktarımı konusunda katı düzenlemeler getirmektedir. Genel amaçlı bulut yapay zeka servislerine gönderilen prompt (komut istemi) içerikleri, sağlayıcıların hizmet şartlarına bağlı olarak model eğitimi amacıyla işlenebilir veya üçüncü taraf sunucularda depolanabilir. Bu durum, açık bir veri ihlali riski oluşturur ve yasal yaptırımlara yol açabilir.
Yerel ortamda koşan açık kaynaklı modeller (Llama 3, Mistral, Qwen vb.), tamamen izole edilmiş bir ağda (Air-Gapped) çalıştırılabilir. İstemler ve yanıtlar doğrudan yerel bellek üzerinden işlenir, diske kaydedilse dahi kurumun kendi şifreli veri depolama standartlarına tabi olur. Böylece veri işleme sözleşmeleri (DPA) imzalanmasına gerek kalmaksızın mevzuata yüzde yüz uyumluluk sağlanır.
İnternet Bağımsızlığı ve Sürekli Erişim Kolaylığı
Bulut tabanlı sistemler; servis sağlayıcının planlı bakım kesintileri, sunucu yoğunluğuna bağlı hız düşüşleri (rate limiting), bölgesel ağ arızaları veya internet kesintilerinden doğrudan etkilenir. Kritik üretim hatlarında, çağrı merkezi operasyonlarında veya saha analizlerinde bu tür kesintiler iş akışını tamamen durdurabilir.
Yerel yapay zeka modelleri, harici ağ bağlantısı olmadan çalışan bağımsız bir yazılım katmanı gibi görev yapar. İster internete kapalı güvenli bir veri merkezinde ister sahada çalışan bir dizüstü bilgisayarda olsun, çıkarım (inference) yetenekleri kesintisiz devam eder. Bu operasyonel süreklilik, sistemin dış faktörlerden kaynaklanan risklere karşı dayanıklılığını maksimum seviyeye çıkarır.
Yerel Yapay Zeka İçin Gerekli Donanım Altyapısı Nedir?
Büyük dil modellerinin çıkarım süreci, yoğun matris çarpımlarına ve yüksek bellek bant genişliğine dayanır. Standart bir merkezi işlemci (CPU), paralel hesaplama gerektiren tensör işlemlerinde grafik işlem birimlerine (GPU) kıyasla çok daha yavaş kalır. Modelin parametreleri, çıkarım anında doğrudan belleğe (özellikle VRAM) yüklenir. Eğer model belleğe sığmazsa, sistem takas belleğine (swap memory) veya ana sistem RAM'ine başvurur; bu da token üretim hızını saniyede 1-2 token gibi kullanılamaz seviyelere düşürür.
Yerel çıkarım performansını belirleyen en kritik donanım metriği bellek bant genişliğidir (Memory Bandwidth). Model ağırlıkları her yeni token üretiminde bellekten hesaplama çekirdeklerine aktarılır. Örneğin, 1000 GB/s bant genişliğine sahip bir GPU, 500 GB/s bant genişliğine sahip bir GPU'ya kıyasla parametreleri iki kat daha hızlı okur ve doğrudan daha yüksek saniyedeki token sayısına () ulaşır.
GPU ve VRAM (Video RAM) Gereksinimleri Nelerdir?
NVIDIA ekran kartları, yapay zeka hesaplamalarında endüstri standardı haline gelen CUDA çekirdekleri ve Tensor çekirdekleri sayesinde en yüksek çıkarım hızlarını sunar. Ancak burada dikkat edilmesi gereken temel kural, ham hesaplama gücünden (TFLOPS) ziyade VRAM kapasitesidir. 24 GB VRAM'e sahip bir RTX 3090, 16 GB VRAM'e sahip daha yeni ve hızlı bir RTX 4080'den daha büyük modelleri (örneğin 32B veya quantize edilmiş 70B'nin belirli katmanlarını) hafızasında tutabilir.
Apple Silicon (M1, M2, M3, M4 serisi) işlemciler ise Birleşik Bellek Mimarisi (Unified Memory) ile kurumsal alanda önemli bir alternatif oluşturmaktadır. Apple sistemlerinde GPU ve CPU aynı yüksek hızlı bellek havuzunu paylaşır. Örneğin 64 GB veya 128 GB Birleşik Belleğe sahip bir Apple Mac Studio, 70 milyar parametreli bir Llama 3 modelini tek başına belleğe yükleyebilir. Bu kapasiteye x86 mimarisinde ulaşmak için birden fazla pahalı sunucu GPU'sunun birbirine bağlanması gerekir.
RAM, İşlemci (CPU) ve Depolama Standartları
Ekran kartının VRAM kapasitesinin yetersiz kaldığı durumlarda modelin belirli katmanları sistem RAM'ine aktarılabilir (CPU Offloading). Ancak bu senaryoda kabul edilebilir bir hız elde edebilmek için sistem RAM'inin çift kanallı (Dual Channel) veya dört kanallı (Quad Channel) DDR5 olması ve minimum 32 GB kapasite barındırması önerilir. CPU tarafında ise AVX-512 veya ARM NEON gibi gelişmiş vektör komut setlerini destekleyen modern çok çekirdekli işlemciler gereklidir.
Depolama tarafında büyük dil modelleri gigabaytlarca yer kaplar. Örneğin ham bir 70B model 140 GB, quantize edilmiş hali ise yaklaşık 40 GB disk alanı gerektirir. Modelin belleğe hızlı yüklenmesi ve bağlam önbellekleme (context caching) işlemlerinin takılmaması için modeller mutlaka yüksek hızlı NVMe PCIe 4.0 veya 5.0 SSD sürücülerinde depolanmalıdır. Geleneksel mekanik sabit diskler (HDD) yükleme sürelerini dakikalara çıkararak operasyonel verimsizlik yaratır.
En Popüler Yerel Yapay Zeka Araçları: Ollama ve LM Studio
Açık kaynaklı yapay zeka modellerini doğrudan kaynak koddan derlemek (llama.cpp kütüphanesini manuel derleme gibi) teknik uzmanlık ve zaman gerektirir. Model ağırlıklarını yönetmek, donanım katmanını optimize etmek ve modelle etkileşime geçmek için geliştirilmiş modern araçlar bu süreci standartlaştırmıştır. Kurumsal ve bireysel kullanımda öne çıkan iki ana araç Ollama ve LM Studio'dur.
Her iki araç da arka planda yüksek performanslı C/C++ tabanlı llama.cpp çıkarım motorunu kullanır. Ancak hedef kitleleri, çalışma prensipleri ve sistem mimarileri birbirinden farklı operasyonel ihtiyaçlara yanıt verir.
Ollama: Terminal Odaklı ve Geliştirici Dostu Entegrasyon
Ollama, büyük dil modellerini tıpkı Docker konteynerleri gibi paketleyen, yöneten ve çalıştıran hafif bir arka plan servisidir. Geliştiricilerin sistem kaynaklarını tüketmeyen, arka planda sessizce çalışan ve tek bir komutla yeni modeller indirip çalıştıran bir araca ihtiyaç duyduğu senaryolarda standart haline gelmiştir.
Ollama'nın en güçlü yönü, işletim sistemi seviyesinde bir daemon olarak çalışarak http://localhost:11434 portu üzerinden standart bir REST API sunmasıdır. Bu sayede Python, Node.js veya Go gibi dillerle geliştirilen kurumsal yazılımlara birkaç satır kodla bağlanabilir. Ayrıca Modelfile yapısı sayesinde sistem istemlerini (system prompts), sıcaklık (temperature) değerlerini ve bağlam boyutunu kurumsal standartlara göre önceden paketleyip şirket içinde dağıtmayı mümkün kılar.
LM Studio: Görsel Arayüz (GUI) ile Kolay Model Yönetimi
LM Studio, teknik bilgisi olmayan karar vericilerin, ürün yöneticilerinin ve prompt mühendislerinin yerel modelleri hızla deneyimlemesini sağlayan gelişmiş bir masaüstü uygulamasıdır. Hugging Face ekosistemiyle doğrudan entegre çalışarak platform içinden ayrılmadan binlerce farklı modeli arama, filtreleme ve tek tıkla indirme imkanı sunar.
LM Studio'nun arayüzü; modelin donanım üzerinde ne kadar VRAM kapladığını gerçek zamanlı olarak gösterir, GPU'ya kaç katman (GPU offload) aktarılacağını manuel olarak ayarlamaya izin verir ve farklı modellerin yanıt kalitesini yan yana karşılaştırma (side-by-side) olanağı tanır. Dahili yerel sunucu (Local Inference Server) özelliği, OpenAI API standardını (/v1/chat/completions) birebir taklit ederek üçüncü taraf araçların (örneğin web eklentileri veya analiz yazılımları) yerel modele kolayca yönlendirilmesini sağlar.
Adım Adım Yerel Yapay Zeka Modeli Kurulum Rehberi
Yerel bir yapay zeka sistemini kurup devreye almak; modelin seçilmesinden, donanıma uygun dosya formatının optimize edilmesine ve çalıştırma motorunun başlatılmasına kadar uzanan sistemli bir süreçtir. Bu aşamada yapılacak yanlış bir seçim, donanım kaynaklarının yetersiz kalmasına ya da modelin mantıksal kapasitesinin ciddi oranda düşmesine yol açabilir.
Aşağıdaki adımlar, kurumsal bir ortamda en verimli çıktıyı almak için izlenmesi gereken standart mühendislik adımlarını açıklamaktadır.
Adım 1: Uygun Açık Kaynaklı Modelin Seçilmesi (Llama 3, Mistral, Phi-3)
Piyasada bulunan açık kaynaklı modeller farklı kullanım amaçlarına ve donanım kısıtlarına göre optimize edilmiştir. Model seçimi yaparken kurumun öncelikli ihtiyacı (kod yazımı, genel muhakeme, çok dilli metin işleme, belge özetleme) netleştirilmelidir.
Meta Llama 3.1 / 3.2 Ailesi: Genel muhakeme, bağlam anlama ve kurumsal entegrasyonlarda en dengeli performansı sunan amiral gemisi model ailesidir. 8B modeli çoğu iş akışı için mükemmel bir fiyat/performans sunarken, 70B modeli karmaşık analizlerde ticari bulut modellerine yakın kalitede sonuçlar üretir.
Mistral / Mixtral (Mistral AI): Fransız yapay zeka laboratuvarı Mistral AI tarafından geliştirilen modeller, özellikle Mixture of Experts (MoE) mimarisiyle öne çıkar. Düşük parametre sayısıyla yüksek çıkarım hızı sağlar ve mantıksal muhakemede oldukça başarılıdır.
Microsoft Phi-3 / Phi-3.5: Küçük dil modelleri (SLM) kategorisinde liderdir. 3.8 milyar parametrelik boyutuyla standart ofis dizüstü bilgisayarlarında dahi yüksek hızda çalışır; basit veri sınıflandırma ve yapılandırılmış metin çıkarma görevleri için idealdir.
Qwen 2.5 (Alibaba Cloud): Kodlama yetenekleri, matematiksel muhakeme ve geniş bağlam penceresi (128k token'a kadar) ile kurumsal yazılım geliştirme ekipleri için güçlü bir alternatiftir.
Adım 2: Model Formatı ve Kuantizasyon (Quantization) Tercihi
Orijinal büyük dil modelleri genellikle 16-bit kayan nokta (FP16 veya BF16) formatında eğitilir. 7 milyar parametreli bir FP16 model yaklaşık 14-16 GB VRAM gerektirir. Kuantizasyon (Quantization), modelin ağırlıklarını 16-bit hassasiyetten 8-bit, 4-bit hatta 2-bit seviyesine sıkıştırarak bellek gereksinimini dramatik şekilde azaltan bir optimizasyon tekniğidir.
Yerel çıkarımda endüstri standardı dosya formatı GGUF (GPT-Generated Unified Format)'tır. GGUF formatı, model ağırlıklarını ve hiperparametreleri tek bir dosyada birleştirerek llama.cpp tabanlı motorlarda maksimum CPU/GPU uyumluluğu sağlar. Kuantizasyon tercihinde en yaygın standart Q4KM (4-bit Medium) seviyesidir. Bu seviye, modelin orijinal zeka kapasitesinde gözle görülür bir kayıp yaratmadan bellek ayak izini yarıdan fazla küçültür.
FP16 (16-bit): En yüksek doğruluk | En yüksek VRAM ihtiyacı (1x)
Q8_0 (8-bit): Sıfıra yakın doğruluk kaybı | Orta-yüksek VRAM ihtiyacı (0.55x)
Q4_K_M (4-bit): Optimum Fiyat/Performans | Düşük VRAM ihtiyacı (0.30x)
Q2_K (2-bit): Yüksek doğruluk kaybı | Çok düşük VRAM (Tavsiye edilmez)Adım 3: Ollama veya LM Studio ile Kurulumun Tamamlanması
Araç seçimi yapıldıktan sonra kurulum süreci başlatılır. İşletim sistemine uygun kurulum adımları şu şekildedir:
Ollama ile Kurulum:
Resmi web sitesinden (
ollama.com) işletim sisteminize (macOS, Linux, Windows) uygun yükleyiciyi indirin ve kurun.Terminali (veya Komut İstemi'ni) açarak model indirme ve başlatma komutunu girin:
ollama run llama3.1:8bKomut çalıştırıldığında Ollama, optimize edilmiş GGUF dosyasını otomatik olarak indirir, arka planda bir servis oluşturur ve doğrudan etkileşime geçebileceğiniz terminal sohbet arayüzünü açar.
LM Studio ile Kurulum:
lmstudio.aiadresinden masaüstü uygulamasını indirin ve standart yükleme adımlarını tamamlayın.Sol menüdeki arama (büyüteç) simgesine tıklayın ve arama kutusuna indirmek istediğiniz modeli yazın (Örn:
Llama-3.1-8B-Instruct-GGUF).Sağ panelde listelenen kuantizasyon seviyelerinden donanımınıza uygun olanı (tercihen
Q4_K_M) seçerek Download butonuna tıklayın.İndirme tamamlandıktan sonra üst bardaki Chat sekmesine geçin, modelinizi seçin ve GPU Offload ayarını
Maxseviyeye getirerek sohbeti başlatın.
Kurumsal yerel yapay zeka mimarisini sıfırdan ayağa kaldırmak için gereken operasyonel adımlar. İş süreçlerinize en uygun model ailesini (Llama 3, Mistral, Phi-3) ve parametre boyutunu (8B, 14B, 70B) belirleyin. Kullanılacak donanımın VRAM limitlerine göre Q4 M veya Q8_0 kuantize edilmiş GGUF dosya formatını seçin. Ollama veya LM Studio aracılığıyla modeli yerel belleğe yükleyin ve API uç noktalarının çalıştığını test edin.Adım Adım Model Kurulum Süreci
İhtiyaç Analizi ve Model Seçimi
Kuantizasyon Seviyesinin Belirlenmesi
K
Çalıştırma Motorunun Kurulumu ve Doğrulama
Kurumsal Entegrasyon: Yerel Modelleri İş Süreçlerine Dahil Etmek
Yerel yapay zeka modelleri yalnızca bağımsız bir sohbet robotu olarak değil, şirket içi CRM, ERP, doküman yönetim sistemleri ve intranet portallarına entegre edilmiş bir zeka katmanı olarak çalıştığında gerçek kurumsal değer üretir. Bu entegrasyonun merkezinde standart API arayüzleri ve RAG (Retrieval-Augmented Generation) mimarisi yer alır.
Açık kaynaklı ekosistem, bulut servisleriyle geliştirilmiş mevcut kod bloklarının yerel modellere taşınmasını son derece kolaylaştırmıştır. Standart HTTP REST API mimarisi sayesinde, şirketlerin mevcut yazılımlarında tek bir satır URL değişikliği yaparak bulut bağımlılığını sonlandırması mümkündür.
API Kullanımı ile İç Sistemlere Bağlantı Sağlama
Hem Ollama hem de LM Studio, endüstri standardı haline gelen OpenAI API spesifikasyonunu destekler. Bu durum, LangChain, LlamaIndex, Flowise veya AutoGen gibi kurumsal yapay zeka geliştirme kütüphanelerinin hiçbir kod değişikliği gerektirmeden yerel altyapıda çalışabilmesini sağlar.
Örneğin, Python ortamında yerel Ollama motoruna bağlanmak ve bir çıkarım gerçekleştirmek için standart HTTP kütüphaneleri veya resmi SDK'lar şu şekilde kullanılır:
import requests
# Ollama yerel API uç noktası
url = "http://localhost:11434/api/generate"
payload = {
"model": "llama3.1:8b",
"prompt": "Aşağıdaki teknik destek talebini önceliklendir ve özetle: Sunucu bağlantısı kesildi.",
"stream": False,
"options": {
"temperature": 0.2
}
}
response = requests.post(url, json=payload)
print(response.json()["response"])RAG (Retrieval-Augmented Generation) ile Şirket Verilerini Güvenli İşleme
Büyük dil modellerinin eğitim verileri statiktir ve şirketinizin dahili prosedürlerini, müşteri kayıtlarını veya güncel sözleşmelerini bilmez. Modelleri kurum verileriyle eğitmek (fine-tuning) hem yüksek GPU maliyeti gerektirir hem de güncellenen verileri anlık olarak yansıtamaz. Bu problemin modern çözümü RAG (Geri Getirme ile Zenginleştirilmiş Üretim) mimarisidir.
Tamamen yerel bir RAG mimarisi üç ana bileşenden oluşur:
Yerel Gömme Modeli (Embedding Model): Şirket belgeleri (PDF, Word, Excel) metin parçalarına (chunks) ayrılır ve
nomic-embed-textveyabge-m3gibi yerel çalışan gömme modelleriyle vektör sayı dizilerine dönüştürülür.Yerel Vektör Veritabanı: Üretilen vektörler ChromaDB, Qdrant veya Milvus gibi kurum içi sunucularda barındırılan bir vektör veritabanında saklanır.
Sorgu ve Yanıt Üretimi: Kullanıcı bir soru sorduğunda, vektör veritabanından en alakalı belge parçaları bulunur, sistem istemine (system prompt) eklenir ve yerel LLM'e iletilir. Model sadece bu güvenli bağlamı kullanarak doğru yanıtı üretir.
Bu mimari sayesinde kurumun en hassas finansal raporları dahi hiçbir harici bulut sunucusuna gönderilmeden, saniyeler içinde analiz edilebilir ve özetlenebilir.
Yerel Yapay Zekanın Sınırları ve Risk Yönetimi
Yerel büyük dil modelleri sundukları gizlilik ve maliyet avantajlarına rağmen mucizevi ve sınırsız sistemler değildir. Kurumların bu teknolojiyi benimserken karşılaşacakları donanım sınırlarını, ölçekleme zorluklarını ve modelin doğasından kaynaklanan muhakeme hatalarını gerçekçi bir şekilde analiz etmesi gerekir.
Yapay zeka modellerinin "her işi kusursuz yapacağı" varsayımı, kurumsal operasyonlarda hatalı veri üretimine ve operasyonel aksaklıklara zemin hazırlar. Başarılı bir yerel yapay zeka stratejisi, risklerin önceden tanımlanmasını ve katı doğrulama mekanizmalarının kurulmasını gerektirir.
Donanım Darboğazları ve Ölçeklenebilirlik Sorunu
Bulut servisleri arkalarında binlerce GPU'dan oluşan devasa sunucu kümeleri barındırır ve eşzamanlı binlerce kullanıcı isteğini kolayca karşılayabilir. Ancak tek bir yerel sunucuda çalışan model, donanım kaynaklarıyla doğrudan sınırlandırılmıştır.
Özellikle bağlam penceresi (Context Window) genişledikçe (örneğin 4.000 tokendan 32.000 veya 128.000 tokene çıkıldığında) KV Cache (Key-Value Belleği) adı verilen geçici veri yapısı VRAM'i hızla tüketir. 8 GB VRAM'e sahip bir sistemde 8B parametreli bir model 4.000 tokenlik bir bağlamda sorunsuz çalışırken, 16.000 tokenlik büyük bir PDF yüklendiğinde "Out of Memory (OOM)" hatası vererek çökebilir. Ayrıca eşzamanlı istek sayısı arttığında çıkarım süreleri uzar; bu durum yoğun kullanıcı trafiğine sahip genel kurumsal portallarda sunucu ölçekleme (Load Balancing) ve ek GPU yatırımı ihtiyacı doğurur.
Halüsinasyon Riski ve İnsan Denetimi (Human-in-the-Loop) İhtiyacı
Büyük dil modelleri istatistiksel olasılık temelli metin tamamlama motorlarıdır; gerçekliği veya doğruluğu "bilmezler". Bu nedenle, model kendine son derece güvenen bir üslupla tamamen uydurma bilgiler, yanlış finansal hesaplamalar veya var olmayan yasal maddeler üretebilir. Bu fenomene halüsinasyon (hallucination) adı verilir.
Açık kaynaklı ve kuantize edilmiş küçük/orta ölçekli modellerde (özellikle 3B - 8B arası), karmaşık çok adımlı muhakeme gerektiren konularda halüsinasyon riski daha yüksektir. Bu riskleri minimize etmek için kurumsal prensipler uygulanmalıdır:
Sıcaklık (Temperature) Ayarı: Yaratıcılık gerektirmeyen, doğrudan bilgi çıkarma ve özetleme görevlerinde model sıcaklık parametresi $0.0$ ile $0.2$ arasında tutulmalıdır.
Human-in-the-Loop Prensibi: Yerel yapay zekanın ürettiği raporlar, kod blokları veya müşteri yanıtları doğrudan nihai işlem olarak kabul edilmemeli; kritik süreçlerde mutlaka alanında uzman bir personel tarafından incelenip onaylanmalıdır.
Kaynak Gösterme Zorunluluğu: RAG sistemlerinde modele yalnızca verilen bağlam dahilinde cevap üretmesi ve cevabın hangi belgeden alındığını referans göstermesi yönünde katı sistem komutları (system prompts) verilmelidir.
Sıkça Sorulan Sorular
Yerel yapay zeka çalıştırmak için internet bağlantısı gerekir mi?
Hayır, model dosyaları ve çalıştırma motoru (Ollama, LM Studio vb.) bir kez indirildikten sonra çıkarım süreci tamamen çevrimdışı olarak yerel donanımda gerçekleşir.
Yerel bir büyük dil modeli için minimum ne kadar ekran kartı belleği (VRAM) gerekir?
4-bit kuantize edilmiş 8 milyar parametreli bir model (Llama 3.1 8B gibi) için en az 6-8 GB VRAM gereklidir; daha büyük 70B modeller için minimum 40-48 GB VRAM gerekir.
Ekran kartı (GPU) olmadan sadece işlemci (CPU) ve RAM ile yerel model çalışır mı?
Evet, llama.cpp tabanlı araçlar CPU ve sistem RAM'i üzerinden çalışabilir; ancak çıkarım hızı GPU'ya kıyasla saniyedeki token üretimi bazında önemli ölçüde daha yavaş olacaktır.
Kuantizasyon (Quantization) nedir ve modelin doğruluğunu nasıl etkiler?
Kuantizasyon, model ağırlıklarını 16-bit hassasiyetten 4-bit veya 8-bit seviyesine sıkıştırarak bellek kullanımını azaltan bir tekniktir; Q4 K M seviyesinde doğruluk kaybı minimum düzeydedir.
Yerel modeller kurumsal sistemlere nasıl entegre edilir?
Ollama ve LM Studio gibi araçlar, yerel ağda OpenAI uyumlu REST API uç noktaları ( /v1/chat/completions ) sunarak mevcut kurumsal yazılımlara ve RAG sistemlerine doğrudan bağlanabilir.
Yerel yapay zeka kullanmak şirket verilerini KVKK ve GDPR açısından korur mu?
Evet, yerel modellerde tüm veri işleme süreçleri kurumun kendi donanımında gerçekleştiği ve dış sunuculara veri aktarılmadığı için veri egemenliği ve yasal uyumluluk tam olarak sağlanır.
Açık kaynaklı modeller ticari projelerde yasal olarak kullanılabilir mi?
Llama 3, Mistral ve Apache 2.0 lisanslı çoğu açık kaynaklı model, lisans şartlarında belirtilen kullanıcı sınırları dahilinde ticari ürün ve hizmetlerde serbestçe kullanılabilir.
Ollama ve LM Studio arasındaki temel fark nedir?
Ollama arka planda çalışan terminal ve servis odaklı bir motor iken, LM Studio görsel kullanıcı arayüzü ve model parametre testleri sunan masaüstü odaklı bir araçtır.