Yapay Zeka Ajanlarında Log ve Trace Verileri Nasıl İzlenir?
Yapay zeka ajanlarında log ve trace izleme; LLM çağrıları, araç kullanımları ve bellek akışlarının OpenTelemetry ve LangSmith gibi protokollerle gözlemlenmesini sağlar.

İÇİNDEKİLER
%0 okundu
- Yapay Zeka Ajanlarında Loglama ve Tracing Neden Kritik Derecede Farklıdır?
- Ajan Gözlemlenebilirliğinin (Observability) 3 Ana Sütunu
- Yapay Zeka İzleme Standartları ve Protokolleri
- En Popüler Yapay Zeka İzleme ve Trace Araçları
- Kurumsal Entegrasyonda Veri Gizliliği ve Güvenlik (Caution-Aware)
- Gerçekçi Bir Senaryo: Hatalı Bir Ajan Kararı Trace Verisiyle Nasıl Teşhis Edilir?
- Sonuç ve Kurumsal Yapay Zeka Operasyonları (AIOps) İçin Öneriler
Yapay zeka ajanlarında log ve trace verilerinin izlenmesi; karmaşık, çok adımlı LLM çağrılarının, harici araç kullanımlarının ve dinamik bellek akışlarının denetlenebilir ve ölçülebilir hale getirilmesini sağlar. Stokastik modeller üzerinde kurulu bu sistemlerde gözlemlenebilirlik (observability), beklenmeyen sistem sapmalarını, yüksek maliyetli sonsuz döngüleri ve güvenlik açıklarını önlemek için zorunlu bir mühendislik disiplinidir. Bu rehberde, OpenTelemetry LLM standartlarından LangSmith ve Langfuse gibi araçlara, kişisel veri (PII) maskelemeden insan denetimli (human-in-the-loop) hata ayıklama süreçlerine kadar kurumsal düzeyde bir izleme altyapısının nasıl kurulacağı operasyonel adımlarla ele alınmaktadır.
Yapay Zeka Ajanlarında Loglama ve Tracing Neden Kritik Derecede Farklıdır?
Geleneksel yazılım mimarilerinde hata ayıklama süreçleri deterministik temellere dayanır. Belirli bir girdi (), kod tabanındaki belirli bir mantıksal patikayı izleyerek her zaman öngörülebilir bir çıktı () üretir. Sistem çöktüğünde veya beklenmeyen bir durum oluştuğunda, standart log dosyalarında yer alan yığın izleme (stack trace) kayıtları hatanın kaynağını doğrudan satır numarası düzeyinde gösterir. Oysa yapay zeka ajanları (AI Agents), büyük dil modellerinin (LLM) olasılıksal doğası üzerine kuruludur. Aynı kullanıcı girdisi, model parametrelerindeki dinamik değişimler, bağlam penceresi (context window) optimizasyonları veya modelin rastlantısallık katsayısı ($temperature$) nedeniyle farklı mantıksal adımların atılmasına yol açabilir. Bu durum, geleneksel tek satırlık hata loglarını ajan sistemlerinde yetersiz kılar.
Geleneksel Yazılımlar vs. Stokastik (Olasılıksal) AI Sistemleri
Geleneksel mimarilerde HTTP durum kodları (, ) sistem sağlığı hakkında kesin bilgi verirken, yapay zeka ajanlarında dönen bir API çağrısı tamamen anlamsız, halüsinasyon içeren veya kurumsal güvenlik politikalarını ihlal eden bir yanıt barındırabilir. Stokastik sistemlerin izlenmesi, yalnızca çağrının teknik olarak başarılı olup olmadığını değil; modelin muhakeme zincirini (chain of thought), bağlam uygunluğunu ve üretilen çıktının anlamsal kalitesini denetlemeyi gerektirir. Modelin girdiyi nasıl yorumladığı, hangi ara çıkarımları yaptığı ve nihai karara varırken hangi olasılık dağılımlarını kullandığı ancak çok katmanlı telemetri yapılarıyla anlaşılabilir.
Tekli LLM Çağrılarından Çok Adımlı (Multi-Step) Ajan İş Akışlarına Geçiş
Basit bir metin özetleme görevi tek bir model çağrısıyla çözülebilirken; kurumsal bir müşteri destek veya pazar analizi ajanı, ReAct (Reasoning + Acting) veya Plan-and-Solve yaklaşımlarını kullanır. Bu akışlarda ajan; önce bir plan yapar, ardından harici veritabanına SQL sorgusu atar, gelen veriyi doğrulamak için bir web arama aracını tetikler ve nihayetinde bir özet çıkarır. Bu süreç, yönlendirilmiş asiklik grafikler (DAG - Directed Acyclic Graph) yapısında dallanan onlarca alt adımdan oluşur. Ajanın nihai çıktısındaki bir sapmayı tespit etmek için, grafiğin her bir düğümündeki girdi-çıktı çiftlerinin, modelin sistem talimatlarına (system prompts) verdiği reaksiyonların ve ara araç çağrılarının zaman damgalı olarak hiyerarşik bir trace yapısında birbirine bağlanması şarttır.
Kontrolsüz Döngü (Infinite Loop) Tehdidi ve Maliyet Yönetimi
Otonom ajanların en büyük operasyonel risklerinden biri, görev tamamlama kriterini yanlış değerlendirmesi sonucu ortaya çıkan sonsuz döngülerdir. Ajan, bir web sayfasını ayrıştırırken veya veritabanından veri çekerken beklediği formatı bulamadığında, aynı aracı farklı prompt varyasyonlarıyla arka arkaya yüzlerce kez çağırabilir. Bu durum saniyeler içinde binlerce dolarlık token tüketimi üretir ve altyapı limitlerini tüketir. Gelişmiş trace sistemleri, adım sayısı (step count) ve harcanan kümülatif token metriklerini anlık olarak izleyerek, eşik değerler aşıldığında ajanın yürütme sürecini otomatik kesen devre kesici (circuit breaker) mekanizmalarını devreye sokar.
Ajan Gözlemlenebilirliğinin (Observability) 3 Ana Sütunu
Kurumsal bir yapay zeka ajanı gözlemlenebilirlik mimarisi, izole edilmiş metrikler yerine birbiriyle ilişkili üç ana telemetri sütunu üzerinden kurgulanmalıdır. Bu sütunlar bir araya geldiğinde, ajanın tüm operasyonel yaşam döngüsü şeffaf ve denetlenebilir hale gelir.
+-------------------------------------------------------------------------+
| ROOT TRACE |
| [Session ID: 94b1-e2a8] | [Latency: 1.42s] | [Total Tokens: 1,845] |
+------------------------------------+------------------------------------+
|
+------------------------------+------------------------------+
| |
v v
+-------------------------------+ +-------------------------------+
| 1. LLM INFERENCE | | 2. TOOL EXECUTION |
| Span: 'Agent_Reasoning_Step' | | Span: 'Execute_SQL_Query' |
| TTFT: 180ms | Tokens: 420 in | | Duration: 45ms | Status: OK |
| System Prompt & Dynamic State | | Params: { "table": "orders" } |
+---------------+---------------+ +---------------+---------------+
| |
+----------------------+----------------------+
|
v
+-------------------------------+
| 3. MEMORY & STATE |
| Span: 'Vector_Context_Lookup' |
| Top-K: 4 | Similarity: 0.89 |
| Injected Context: 1.2k tokens |
+-------------------------------+1. LLM Çağrıları ve Prompt Geçmişinin Kaydedilmesi
Model düzeyindeki telemetri, yalnızca son kullanıcı mesajını değil; ajanın dinamik olarak inşa ettiği sistem talimatlarını (system prompts), önbelleğe alınmış bağlamı ve modele iletilen parametre yapılandırmalarını ($temperature$, , ceza katsayıları) kaydetmelidir. Bu sütun altında izlenmesi gereken kritik metrikler şunlardır:
Token Tüketimi: Giriş (prompt), çıktı (completion) ve önbellek okuma/yazma (cache read/write) token miktarları.
Gecikme Süreleri: Toplam yanıt süresi ve akış (streaming) mimarilerinde kullanıcı deneyimini doğrudan belirleyen İlk Tokena Kadar Geçen Süre (TTFT - Time to First Token).
Model Sürümü: Sağlayıcıların sessiz güncellemelerine (silent model drift) karşı kullanılan tam model versiyon etiketi (ör.
gpt-4o-2024-08-06veyaclaude-3-5-sonnet-20241022).
2. Araç (Tool) ve API Çalıştırma Tracing Verileri
Ajanlar, iş mantıklarını yürütmek için harici fonksiyonları ve API uçlarını tetikler (function/tool calling). Bir trace spans hiyerarşisinde, modelin aracı çağırma kararı verdiği andan itibaren şu veriler kayıt altına alınmalıdır:
JSON Şeması ve Parametreler: Modelin fonksiyona ilettiği argümanların geçerliliği ve şema uyumu.
Yürütme Gecikmesi: Harici servisin (ör. CRM veritabanı, ödeme geçidi API'si) yanıt verme süresi.
Hata Yönetimi ve Yeniden Deneme (Retry): Araç yürütmesi hata verdiğinde ajanın aldığı hata mesajı ve buna karşılık geliştirdiği kurtarma stratejisi.
3. Bellek (Memory) ve State (Durum) Değişimlerinin İzlenmesi
Uzun soluklu görevlerde ajanlar; kısa vadeli bellek (oturum içi konuşma geçmişi) ve uzun vadeli bellek (vektör veritabanları veya semantik arama katmanları) kullanır. Bellek akışlarının (memory streams) izlenmesi şu aşamaları kapsar:
Geri Getirme (Retrieval) Kalitesi: Vektör veritabanından çekilen parçaların (chunks) alaka düzeyi skorları ve semantik benzerlik metrikleri.
Durum Dönüşümleri (State Mutations): Çok adımlı akışlarda ajanın iç durum değişkenlerinin (örneğin tamamlanan alt görev listesi) her döngüde nasıl güncellendiği.
Bağlam Zehirlenmesi (Context Pollution): Geçmiş oturumlardan kalan ilgisiz verilerin bağlam penceresine dahil edilip edilmediğinin tespiti.
Yapay Zeka İzleme Standartları ve Protokolleri
Yapay zeka ekosisteminde araç çeşitliliği arttıkça, izleme verilerinin standartlaştırılması kurumsal mimarilerin sürdürülebilirliği için zorunlu hale gelmiştir. Tescilli (proprietary) izleme formatları, kurumları belirli bir yazılım sağlayıcısına bağımlı (vendor lock-in) kılarken; açık kaynaklı standartlar, toplanan trace verilerinin farklı analiz motorlarına sorunsuz aktarılmasını sağlar.
OpenTelemetry (OTel) LLM Semantik Standartları ile Entegrasyon
Cloud Native Computing Foundation (CNCF) bünyesindeki OpenTelemetry projesi, üretken yapay zeka ve LLM iş yükleri için özel semantik konvansiyonlar (Semantic Conventions) geliştirmiştir. Bu standartlar, bir LLM çağrısının veya ajan adımının telemetri verisi olarak nasıl temsil edileceğini katı kurallarla tanımlar.
Bu standardizasyon sayesinde, uygulamanızın kod tabanına entegre ettiğiniz tek bir OTel SDK'sı, toplanan verileri Jaeger, Zipkin, Prometheus veya kurumsal APM sistemlerine hiçbir veri kaybı olmadan iletebilir.
Geleneksel APM (Datadog, Grafana) ve AI-Native Sistemlerin Hibrit Kullanımı
Kurumsal BT altyapılarında mikroservisler, veritabanları ve ağ katmanları genellikle Datadog, Dynatrace, New Relic veya açık kaynaklı Grafana mimarileriyle izlenir. Yapay zeka ajanlarını bu ekosisteme dahil ederken iki temel yaklaşım öne çıkar:
Birleşik Dağıtık İzleme: Kullanıcının web uygulamasından başlattığı bir işlem, arka plandaki mikroservislerden geçerek yapay zeka ajanına ulaştığında, aynı
trace_idbağlamı korunur. Bu sayede ajanın yanıt süresindeki bir gecikmenin LLM çıkarımından mı yoksa kurumsal ERP sistemindeki bir yavaşlıktan mı kaynaklandığı tek bir ekrandan analiz edilir.Özelleşmiş AI Katmanı: Geleneksel APM'ler sayısal metrikleri ve sistem sağlığını takip ederken; prompt regresyon testleri, halüsinasyon skorlaması ve model değerlendirme (evaluation) süreçleri AI-native gözlemlenebilirlik araçlarına yönlendirilir.
En Popüler Yapay Zeka İzleme ve Trace Araçları
Pazardaki yapay zeka gözlemlenebilirlik araçları; kurulum kolaylığı, veri egemenliği (data sovereignty) ve analiz derinliği açısından farklı segmentlere ayrılır. İşletmelerin bütçe, regülasyon ve mühendislik kaynaklarına göre doğru aracı seçmesi kritik önem taşır.
SaaS Odaklı Gelişmiş Çözümler: LangSmith
LangChain ekosisteminin arkasındaki ekip tarafından geliştirilen LangSmith, özellikle karmaşık LCEL (LangChain Expression Language) zincirleri ve LangGraph üzerinde inşa edilen çok ajanlı sistemler için optimize edilmiştir.
Öne Çıkan Yetenekler: Sıfır kod yapılandırmasına yakın entegrasyon, görselleştirilmiş DAG yürütme akışları, otomatik veri kümesi (dataset) oluşturma ve prompt versiyonlama.
Hedef Kitle: Geliştirme hızına öncelik veren, altyapı yönetimiyle uğraşmak istemeyen ve LangChain kütüphanelerini yoğun olarak kullanan ekipler.
Açık Kaynaklı ve Yerel (On-Premise) Alternatifler: Langfuse ve Arize Phoenix
Veri gizliliği düzenlemeleri (KVKK, GDPR) nedeniyle müşteri verilerinin veya model promptlarının üçüncü taraf SaaS platformlarına aktarılamadığı senaryolarda açık kaynaklı sistemler tercih edilir.
Langfuse: Açık kaynak kodlu, OTel uyumlu, PostgreSQL tabanlı ve kendi sunucularınızda (self-hosted) kolayca barındırılabilen bir platformdur. Kullanıcı oturumlarını (sessions), maliyet takibini ve insan geri bildirim döngülerini (human feedback loops) kapsamlı bir arayüzle sunar.
Arize Phoenix: Özellikle yerel ortamda çalıştırma (local notebook/container), RAG sistemlerinde gömme (embedding) analizi ve halüsinasyon tespiti için gelişmiş model değerlendirme araçları sunar.
Kurumsal Entegrasyonda Veri Gizliliği ve Güvenlik (Caution-Aware)
Yapay zeka ajanlarının loglanması sırasında en sık karşılaşılan kurumsal risk, kullanıcıların promptlar içinde paylaştığı hassas verilerin (kredi kartı bilgileri, kimlik numaraları, kurumsal sırlar) merkezi log sistemlerine şifrelenmemiş olarak yazılmasıdır. Bu durum veri sızıntılarına ve regülasyon cezalarına yol açabilir.
PII (Kişisel Veri) Maskeleme ve Log Güvenliği
Kurumsal mimarilerde telemetri katmanına veri gönderilmeden önce, istemci veya ara katman (middleware) seviyesinde çalışan PII Maskeleme (PII Scrubbing) kütüphaneleri devreye alınmalıdır. Microsoft Presidio gibi açık kaynaklı araçlar veya özel regex/NER modelleri kullanılarak; ad, soyad, e-posta, IP adresi ve ödeme bilgileri gibi veriler trace kayıtlarına girmeden önce <REDACTED_EMAIL> veya <PII_TOKEN_1> şeklinde anonimleştirilmelidir.
Prompt Enjeksiyonu (Prompt Injection) ve Güvenlik İhlallerinin Trace Üzerinden Tespiti
Kötü niyetli kullanıcılar veya güvenliği ihlal edilmiş harici veri kaynakları, ajanın sistem talimatlarını geçersiz kılmak için prompt enjeksiyonu tekniklerini kullanabilir. Trace sistemleri şu saldırı vektörlerini tespit etmek için yapılandırılmalıdır:
Girdi Güvenlik Duvarları (Input Guardrails): Promptfoo veya NeMo Guardrails gibi sistemlerle, kullanıcı girdilerindeki istismar kalıpları analiz edilmeli ve riskli bulunan işlemler doğrudan loglanarak ajan yürütmesi durdurulmalıdır.
Çıktı Manipülasyonu: Modelin sistem promptundaki gizli kuralları harici bir araca iletmeye çalışıp çalışmadığı, fonksiyon çağrısı span'leri üzerinden doğrulanmalıdır.
Çıktı Doğruluğu: Halüsinasyonların ve Hatalı Kararların İzlenmesi
Ajanların başarısı yalnızca teknik çalışma süresiyle (uptime) değil, ürettiği çıktının anlamsal doğruluğuyla ölçülür. Üretim ortamında gerçek zamanlı halüsinasyon tespiti için referanssız metrikler (reference-free evaluation metrics) kullanılır. Model çıktısı, bağlam (context) verisiyle çapraz sorgulanarak "sadakat" (faithfulness) ve "cevap alaka düzeyi" (answer relevance) skorları $0.0 - 1.0$ arasında derecelendirilir ve düşük skorlu trace'ler otomatik olarak inceleme kuyruğuna alınır.
Gerçekçi Bir Senaryo: Hatalı Bir Ajan Kararı Trace Verisiyle Nasıl Teşhis Edilir?
Teorik prensipleri somutlaştırmak adına; bir e-ticaret platformunda sipariş iptali ve iade süreçlerini yöneten otonom bir müşteri destek ajanının hatalı işlem yaptığı senaryoyu ele alalım.
Senaryo: Kullanıcı "Dün verdiğim 4812 numaralı siparişimi iptal etmek ve ücret iademi almak istiyorum" talebinde bulunur. Ajan, sistemdeki kurallara aykırı olarak kargoya verilmiş ürünü iptal eder ve iade sürecini başlatır.
Hatalı kararın hangi alt adımda gerçekleştiğini tespit etmek için izlenen operasyonel adımlar. Oturum ID'si üzerinden ana trace açılır; toplam gecikme süresi (3.4s) ve 3 alt span'in hiyerarşik yapısı doğrulanır. Ajanın kural tabanından çektiği 'İptal ve İade Politikası' metin parçası incelenir; politikanın bağlama doğru eklendiği görülür. Modelin check_shipping_status aracını çağırdığı ve sistemin 'Kargoya Verildi' yanıtı döndüğü doğrulanır. Nihai model çağrısının sistem talimatında kargo durumu 'Kargoya Verildi' olan ürünlerin iptal edilemeyeceğine dair kuralın prompt optimizasyonu sırasında kesildiği (truncated) tespit edilir.Dağıtık Trace Üzerinden Kök Neden Analizi
Kök Trace (Root Span) İncelemesi
Vektör Bellek (Retrieval) Adımının Denetimi
Araç Parametre Validasyonu
Muhakeme (Reasoning) ve LLM Prompt Analizi
Bu tespitin ardından insan denetimi (human-in-the-loop) devreye girerek hatalı iade işlemi finans sisteminde askıya alınır, ajan promptundaki sistem kuralları güncellenir ve regresyon testi olarak kaydedilir.
Sonuç ve Kurumsal Yapay Zeka Operasyonları (AIOps) İçin Öneriler
Yapay zeka ajanlarının deneysel ortamlardan kurumsal üretim sistemlerine taşınması, sıkı bir telemetri ve gözlemlenebilirlik altyapısını zorunlu kılar. Stokastik modellerin öngörülemez doğası, ancak çok adımlı trace mekanizmaları, açık telemetri standartları ve sıkı veri güvenliği filtreleriyle kontrol altına alınabilir.
Kurumsal AIOps stratejinizi olgunlaştırırken şu temel prensipleri benimseyin:
Açık Standartlara Yatırım Yapın: Sağlayıcı bağımlılığından kaçınmak için OpenTelemetry LLM semantik standartlarını temel alan kütüphanelerle mimarinizi kurun.
Maliyet Devre Kesicileri Tanımlayın: Her ajan oturumu için maksimum adım sayısı () ve maksimum bütçe () belirleyerek kontrolsüz harcamaların önüne geçin.
Sürekli Değerlendirme Döngüleri Kurun: Üretim ortamından toplanan trace verilerini düzenli aralıklarla altın veri kümelerine (gold datasets) dönüştürerek model güncellemelerinde gerileme (regression) testleri yürütün.
Sıkça Sorulan Sorular
Loglama ile Tracing arasındaki temel fark yapay zeka ajanlarında nedir?
Loglama belirli bir zaman diliminde gerçekleşen tekil bir olayı (ör. model çağrısı başarılı) metin olarak kaydederken; Tracing, bir kullanıcının başlattığı görevin alt adımlarını, araç çağrılarını ve bellek sorgularını birbirine bağlı bir hiyerarşi (ağaç yapısı) içinde uçtan uca görselleştirir.
OpenTelemetry'nin LLM izlemedeki rolü nedir?
OpenTelemetry, farklı sağlayıcıların (OpenAI, Anthropic, yerel modeller) ürettiği metrik, log ve trace verilerini ortak semantik standartlar altında toplayarak herhangi bir tescilli platforma bağımlı kalmadan analiz edilmesini sağlar.
Ajanlarda sonsuz döngü (infinite loop) riski nasıl önlenir?
Ajan mimarisine maksimum adım sayısı (step count) ve oturum başına harcanabilecek maksimum token limiti tanımlanarak trace izleme araçları üzerinden eşik değer aşıldığında işlem otomatik olarak sonlandırılır.
LangSmith ile Langfuse arasındaki temel ayrım nedir?
LangSmith, LangChain ekosistemiyle derin entegrasyona sahip tam yönetilen bir SaaS platformuyken; Langfuse, açık kaynak kodlu yapısıyla kurumların kendi sunucularında (on-premise) çalıştırabildiği ve veri egemenliği sağladığı bir çözümdür.
PII Maskeleme (Scrubbing) işlemi trace akışında nerede yapılmalıdır?
Kişisel verilerin maskelenmesi, veri ağ üzerinden herhangi bir loglama servisine veya harici LLM sağlayıcısına iletilmeden önce uygulamanın ara katman (middleware) seviyesinde gerçekleştirilmelidir.
Time to First Token (TTFT) metriği neden önemlidir?
Akış (streaming) mimarilerinde kullanıcının modelden ilk yanıtı almaya başladığı süreyi temsil eder ve arayüz tepkiselliği ile doğrudan kullanıcı deneyimini ölçmede temel performans göstergesidir.
İnsan denetimi (Human-in-the-Loop) izleme sistemine nasıl entegre edilir?
Belirli bir güven skorunun (confidence score) altında kalan veya yüksek maliyetli/riskli araçları tetikleyen ajan trace'leri otomatik olarak bir onay kuyruğuna yönlendirilerek insan operatörün onayından sonra yürütülür.
RAG sistemlerinde bellek getirme (retrieval) kalitesi nasıl ölçülür?
Vektör veritabanından çekilen metin parçalarının benzerlik skorları, model yanıtının çekilen bağlama sadakati (faithfulness) ve gereksiz bağlam oranı reference-free evaluation kütüphaneleriyle hesaplanarak trace panellerinde puanlanır.