Workflow'ları test etmek: Pin Data, Mock Data, Debug modu
n8n'de Pin Data, Mock Data ve Debug modu: workflow'ları üretim sistemlerine karşı canlı olarak değil, sabitlenmiş test verileriyle nasıl test edersin.
Yapay zeka ajanlarını müşteride kullanılmadan önce n8n değerlendirmeleriyle nasıl test edersiniz: test veri kümeleri, metrikler ve güvenilir workflow'lar için LLM-as-a-Judge.
Bir müşteride üretimde çalışan bir yapay zeka (YZ) ajanı, önceden kanıtlanabilir şekilde yeterince güvenilir yanıt vermelidir ve n8n tam da bunun için Evaluations adı verilen yerleşik bir test özelliği sunar: örnek girdiler ve çoğunlukla beklenen çıktılar içeren bir test veri kümesi, workflow üzerinden tekrar tekrar çalıştırılır, gerçek yanıtlar beklenen yanıtlarla karşılaştırılır ve projenin olgunluk derecesine bağlı olarak değerlendirme ya küçük örneklerde görsel olarak ya da daha büyük veri kümelerinde sayısal metrikler üzerinden yapılır. Durum: Temmuz 2026.
Klasik kod satır satır izlenebilir, bir yapay zeka modeli ise izlenemez. n8n'in yapay zeka workflow'larını test etmeye ilişkin dokümantasyonu bunu şöyle açıklar: yapay zeka modelleri, mantık yoluyla sonuca ulaşılan bir kara kutu değildir, aksine çıktılarının ölçülmesi gerekir ve ancak birçok farklı girdi üzerinde tekrarlanan testler, bir modelin güvenilir çalıştığına dair güven oluşturur. Bu nedenle, daha sonra bir müşteride kullanılacak bir ajan workflow'u için geliştirme sırasında yapılan tek seferlik manuel bir test yeterli değildir. Hafifçe değiştirilmiş ifadeler, nadir görülen ek sorular veya sonradan yapılan bir model değişikliği bile, sistematik kontrol yapılmadan ancak müşteride fark edilen sapan yanıtlara yol açabilir.
n8n, farklı amaçlara hizmet eden iki değerlendirme türü arasında ayrım yapar. Light Evaluations geliştirme aşaması için uygundur: özenle seçilmiş küçük bir test senaryosu koleksiyonu workflow üzerinden tek tek çalıştırılır, sonuçlar test veri kümesine geri yazılır ve ardından beklenen yanıtlarla görsel olarak karşılaştırılabilir. Bu, ajan müşteriye ulaşmadan önce kısa sürede kaba hataları ve aykırı değerleri tespit etmek için yeterlidir. Üretim ortamı için n8n, metrik tabanlı değerlendirmelere geçilmesini önerir: her test çalıştırmasının, zaman içinde karşılaştırılabilen bir veya birden fazla sayısal puan aldığı, daha büyük ve temsil niteliğinde veri kümeleri; örneğin bir prompt değişikliğinden veya model değişikliğinden sonra bir kötüleşmeyi erken fark etmek için.
n8n'in yapay zeka ajanlarının değerlendirilmesine ilişkin blog yazısı, ajan yanıtlarının kalitesini kontrol etmek için dört tamamlayıcı yöntem tanımlar:
Ek olarak n8n, deterministik metrikler olarak görev tamamlama oranı, araç doğruluğu ve format uyumu gibi göstergeleri, model tabanlı metrikler olarak da doğruluk, yararlılık ve gerçeklere dayanma (groundedness) gibi göstergeleri sayar.
Somut olarak, n8n'de bir değerlendirme, dört adımda ilerler: önce, örneğin Data Table veya Google Sheet olarak, girdi sütunları, genellikle beklenen çıktı için bir sütun ve gerçek çıktı için boş bir sütun içeren bir test veri kümesi oluşturulur. Ardından bir Evaluation Trigger bu veri kümesinden satır satır veri çeker ve her test senaryosu için workflow'u tetikler. Değerlendirme düğümü içindeki bir Set Outputs düğümü, gerçek sonuçları veri kümesine geri yazar. Son olarak çıktılar yan yana karşılaştırılabilir; metrik tabanlı değerlendirmelerde ayrıca Evaluations sekmesinde puanlarla birlikte, böylece prompt, model veya workflow mantığındaki değişiklikler birden fazla çalıştırma boyunca izlenebilir kalır. Canlıya geçmeden önce çevrimdışı yapılan değerlendirmeleri, canlı ortamda sürekli çevrimiçi izlemeyle birleştirmek mantıklıdır, çünkü hiçbir test veri kümesinin tam olarak kapsayamadığı uç durumları ancak gerçek trafik ortaya çıkarır.
Müşteri beklentisi açısından önemli olan: bir yapay zeka ajanı bu yöntemlerle belirgin şekilde daha güvenilir hale getirilebilir, ancak yüzde yüze getirilemez. Bir test serisinin amacı, ölçülmüş ve belgelenmiş bir hata oranı ile ajan emin olmadığında insana net bir eskalasyon gibi kalan hataları yakalayan bir süreçtir. Üretim ortamında müşteri kullanımı için bir ajan oluşturan kişi, bu nedenle bu test aşamasını ajan canlıya geçmeden önce kesin olarak planlamalıdır. NordFlux'ta bu tür bir kalite güvencesi, müşteriye teslim edilen her yapay zeka ajanı projesinin bir parçasıdır.
Yapay zeka ajanlarında yüzde yüz güvenilirlik gerçekçi olarak ulaşılabilir değildir. Belirleyici olan, somut kullanım durumu için ölçülmüş ve belgelenmiş bir hata oranı ile örneğin emin olunmayan yanıtlarda insana eskalasyon yoluyla kalıntı hataları yakalayan bir süreçtir.
Hayır. Canlıya geçmeden önce yapılan tek seferlik bir test yalnızca o andaki durumu kapsar. Prompt'larda, modellerde veya bağlı araçlarda yapılan değişikliklerden sonra aynı test serisi yeniden çalıştırılmalı ve kötüleşmeleri erken fark etmek için canlı ortamda sürekli izlemeyle desteklenmelidir.
Zorunlu değil. n8n zaten bir Evaluation Trigger ve değerlendirme düğümü içerir, test veri kümeleri n8n Data Tables'ta veya bir Google Sheet'te tutulabilir. Geliştirme sırasında yapılan Light Evaluations için bu yerleşik araç seti genellikle yeterlidir.
Deterministik kontroller, format veya tam eşleşme gibi nesnel ve açıkça tanımlanmış kriterleri inceler ve ucuz ile tekrarlanabilir niteliktedir. LLM-as-a-Judge, açık uçlu ve nüanslı yanıtları başka bir dil modeline değerlendirtir; bu, daha fazla nüans yakalar ancak ek maliyetlere yol açar ve düzenli olarak yeniden kontrol edilmelidir.
NordFlux, kuruluşlar için dijital çalışanlar kurar: tekrar eden işleri üstlenen otomasyonlar ve KI ajanları. Kontrol sizde kalır.
n8n'de Pin Data, Mock Data ve Debug modu: workflow'ları üretim sistemlerine karşı canlı olarak değil, sabitlenmiş test verileriyle nasıl test edersin.
npm, Docker veya masaustu uygulamasi: n8n'i yerel olarak nasil test edebileceginiz, kalicilik ve emek acisindan farklarin neler oldugu ve masaustu uygulamasinin neden artik var olmadigi.
Error workflow'lar, Retry On Fail ve Teams bildirimleri: n8n'de güvenilir hata işleme nasıl kurulur.
Klasik testler yapay zeka ajanları için yeterli değildir, çünkü yanıtlar değişkenlik gösterir ve hatalar genellikle ancak canlı ortamda fark edilir. NordFlux, güvenilirliği canlıya geçmeden önce kanıtlayan test veri setleri ve metriklerle değerlendirme süreçleri kurar, sonradan değil. İlk görüşmede n8n workflow'unuzu inceliyor ve müşteri kullanımı öncesinde hangi testlerin eksik olduğunu gösteriyoruz.