Yapay zekâ asistanı pilotlarında ilk soru çoğu zaman “Hangi modeli kullanalım?” olur. Oysa daha sağlıklı başlangıç, kullanım senaryosu keşfinden önce hangi iş ihtiyacının ölçüleceğini belirlemektir. Çalışanların bilgiye erişim süresini azaltmak, destek taleplerini doğru yönlendirmek veya kurumsal içeriklerde arama deneyimini iyileştirmek gibi hedefler netleşmeden yapılan pilotlar, teknik olarak çalışan ancak iş değeri belirsiz çözümlere dönüşebilir.
Yapay zekâ asistanı pilotunda başarı ölçütleri; yalnızca yanıtların akıcı olup olmadığına değil, yanıtların onaylı içeriğe dayanmasına, kaynak göstermesine, bilmediğinde bunu açıkça belirtmesine ve güvenli biçimde kullanılmasına odaklanmalıdır. Bu yaklaşım, pilot sonunda “Asistan çalışıyor mu?” sorusu yerine “Belirlediğimiz iş ihtiyacını kabul edilebilir riskle karşılıyor mu?” sorusuna yanıt vermenizi sağlar.
01Önce ölçülecek iş ihtiyacını tanımlayın
Pilotun kapsamını teknoloji değil, ölçülebilir bir iş problemi belirlemelidir. Örneğin “kurumsal bir chatbot geliştirmek” tek başına başarı ölçütü değildir. Bunun yerine “çalışanların güncel prosedürleri bulmak için harcadığı zamanı azaltmak” veya “destek ekibine ulaşan tekrarlı bilgi taleplerini daha erken aşamada yanıtlamak” gibi bir ihtiyaç tanımlanabilir.
Bu aşamada aşağıdaki sorulara yazılı yanıt verin:
- Asistanı kimler kullanacak?
- Kullanıcılar hangi içerik veya süreç hakkında soru soracak?
- Mevcut yöntemde hangi gecikme, tekrar veya hata yaşanıyor?
- Pilot başarılı olursa hangi davranışın değişmesi bekleniyor?
- Yanlış bir yanıtın iş, güvenlik veya uyum açısından etkisi nedir?
Örneğin insan kaynakları iç prosedürlerine erişim senaryosunda ölçülecek ihtiyaç, yalnızca yanıt üretmek değil, çalışanların doğru dokümana daha kısa yoldan ulaşması olabilir. Finans, sağlık veya kişisel veri içeren süreçlerde ise yanıt hızından önce erişim yetkileri, veri minimizasyonu ve izlenebilirlik değerlendirilmelidir.
02Başarı ölçütlerini üç katmanda kurun
İyi tasarlanmış bir pilot, başarıyı tek bir puana indirgemez. İş sonucu, yanıt kalitesi ve risk kontrolü birlikte değerlendirilir. Bu üç katman, teknik ekip ile iş birimlerinin aynı çerçevede konuşmasına yardımcı olur.
| Katman | Ölçülebilecek konu | Örnek kontrol sorusu |
|---|---|---|
| İş değeri | Bilgiye erişim, talep yönlendirme ve süreç verimliliği | Kullanıcı aradığı bilgiye daha az adımla ulaşabiliyor mu? |
| Yanıt kalitesi | Doğruluk, ilgililik, açıklık ve kaynak gösterimi | Yanıt onaylı içeriğe dayanıyor ve ilgili kaynağı gösteriyor mu? |
| Risk ve yönetişim | Yetkilendirme, kişisel veri, kayıt ve belirsizlik yönetimi | Asistan bilmediği durumda bunu açıkça belirtiyor mu? |
Bu katmanlar için hedefler pilot başlamadan önce belirlenmelidir. Hedeflerin sayısal olması yararlı olabilir; ancak işletmeye, içerik türüne ve risk seviyesine göre değişeceği için dışarıdan hazır bir oranı doğrudan kullanmak doğru değildir. Değerlendirme ölçütleri, kurumun kabul edilebilir hata düzeyi ve süreç sahipleriyle birlikte oluşturulmalıdır.
03Onaylı içeriğe dayanmayı nasıl test edersiniz?
Kurumsal yapay zekâ asistanının güvenilirliği, yalnızca dil akıcılığıyla değerlendirilemez. Asistanın yanıtlarını kurumun onayladığı bilgi bankası, prosedür, politika veya dokümanlarla ilişkilendirmesi gerekir. Bu nedenle pilot veri kümesi hazırlanırken içeriklerin kaynağı, sahibi, güncellik durumu ve kullanım yetkisi belirlenmelidir.
Test sorularını birkaç grupta hazırlayın:
- Yanıtı doğrudan onaylı dokümanda bulunan sorular.
- Birden fazla dokümandaki bilgilerin birlikte değerlendirilmesini gerektiren sorular.
- İçerikte karşılığı olmayan veya kapsam dışında kalan sorular.
- Güncel olmayan, çelişkili ya da yetkisiz bir dokümana yönlendirme ihtimali bulunan sorular.
Her yanıt için “Kaynak doğru mu?”, “Kaynak soruyu gerçekten destekliyor mu?” ve “Yanıt kaynakta olmayan bir sonucu ekliyor mu?” sorularını sorun. Kaynak gösterimi yalnızca bir doküman adını yazmaktan ibaret olmamalıdır. Mümkünse dokümanın ilgili bölümü, başlığı veya bağlantısı kullanıcıya sunulmalıdır. Böylece kullanıcı yanıtı kontrol edebilir ve kurum içinde denetlenebilirlik artar.
Bu test, kurumsal bilgi bankası çözümlerinde kullanılan RAG yaklaşımının iş ihtiyacına uygun biçimde uygulanıp uygulanmadığını anlamaya yardımcı olur. Ancak kaynak gösterimi, yanıtın otomatik olarak doğru olduğu anlamına gelmez; içerik sahiplerinin örnek yanıtları incelemesi ve bulguları kayıt altına alması gerekir.
04Bilmediğinde belirtme davranışını ölçün
Bir asistanın her soruya yanıt vermeye çalışması başarı göstergesi değildir. Kurumun onaylı içeriğinde karşılığı olmayan bir konuda tahminde bulunması, özellikle operasyonel, finansal veya kişisel veri içeren süreçlerde risk oluşturabilir. Bu nedenle pilotta “yanıt verememe” davranışı ayrı bir başarı ölçütü olarak tanımlanmalıdır.
Asistanın bilmediğini belirtmesi şu özellikleri taşımalıdır:
- İçerikte yeterli bilgi bulunmadığını açıkça söylemesi.
- Tahmin yürütmek veya kaynak dışı bilgi üretmek yerine sınırını belirtmesi.
- Kullanıcıyı uygun bir ekip, süreç veya dokümana yönlendirmesi.
- Gerekli olduğunda destek talebi oluşturulması için sonraki adımı açıklaması.
Test senaryolarında özellikle benzer görünen ancak bilgi bankasında yer almayan sorulara yer verin. Ayrıca kullanıcı soruyu belirsiz sorduğunda asistanın varsayım yapmak yerine açıklayıcı soru sorup sormadığını inceleyin. Bu değerlendirme, yanıtların yalnızca içerik açısından değil, karar destek süreci açısından da ele alınmasını sağlar.
İyi bir pilot, her soruya yanıt veren asistanı değil; hangi soruya yanıt verebileceğini ve hangi durumda durması gerektiğini öngörülebilir biçimde gösteren asistanı değerlendirir.
05Pilot değerlendirmesi için kontrol listesi oluşturun
Pilot başlamadan önce iş birimi, ürün yöneticisi, bilgi güvenliği ve teknik ekip tarafından ortak bir değerlendirme formu hazırlanabilir. Her test sorusu aynı ölçütlerle incelendiğinde sonuçların karşılaştırılması kolaylaşır.
- İş uygunluğu: Yanıt, kullanıcının gerçek ihtiyacını karşılıyor mu?
- Kaynak uygunluğu: Yanıt, onaylı ve yetkili bir içeriğe dayanıyor mu?
- Kaynak görünürlüğü: Kullanıcı, yanıtın dayandığı bölümü inceleyebiliyor mu?
- Belirsizlik yönetimi: Asistan bilgi yoksa bunu açıkça belirtiyor mu?
- Anlaşılabilirlik: Yanıt, hedef kullanıcı için açık ve uygulanabilir mi?
- Güvenlik ve KVKK: Yanıt, yetkisiz kişisel veya kurumsal bilgiyi açığa çıkarıyor mu?
- İzlenebilirlik: Test sonucu, kaynak ve değerlendirme notu kayıt altına alınıyor mu?
Sonuçları yalnızca ortalama puanla raporlamak yerine, başarısızlık türlerini ayırın. Örneğin kaynak göstermeyen yanıtlar, kapsam dışı sorulara verilen yanıtlar ve yanlış dokümana dayanan yanıtlar ayrı kategorilerde incelenmelidir. Böylece sonraki iyileştirme adımı; model değişikliği, içerik düzenleme, erişim yetkisi güncellemesi veya kullanıcı arayüzü iyileştirmesi olarak daha doğru seçilebilir.
Pilotun sonunda devam kararı da önceden tanımlanan koşullara bağlanmalıdır. Hangi iş ihtiyacında anlamlı ilerleme sağlandı? Hangi riskler açık kaldı? İçerik sahipliği ve güncelleme süreci sürdürülebilir mi? Kullanıcılar yanıtları doğrulayabiliyor mu? Bu soruların yanıtı olumlu değilse pilotu büyütmek yerine kapsamı daraltmak veya bilgi altyapısını iyileştirmek daha uygun olabilir.
06Sık sorulan sorular
Yapay zekâ asistanı pilotunda yalnızca yanıt doğruluğu mu ölçülmelidir?
Hayır. Yanıt doğruluğunun yanında iş ihtiyacına katkı, kaynak gösterimi, belirsizliği belirtme, güvenlik, KVKK ve izlenebilirlik de değerlendirilmelidir. Akıcı bir yanıt, iş sürecinde kullanılabilir veya denetlenebilir değilse tek başına yeterli değildir.
Asistanın kaynak göstermesi neden önemlidir?
Kaynak gösterimi, kullanıcının yanıtı kontrol etmesini ve içerik sahibinin bilgi bankasındaki eksikleri görmesini sağlar. Ayrıca yanıtın kurumun onaylı içeriğine dayanıp dayanmadığını incelemeyi kolaylaştırır. Kaynağın yalnızca adını değil, mümkün olduğunda ilgili bölümünü göstermek daha işlevseldir.
Bilmediğini belirleyen bir asistan nasıl test edilir?
Bilgi bankasında karşılığı olmayan, kapsam dışında kalan veya çelişkili içerik gerektiren sorular hazırlanır. Asistanın tahmin yürütmek yerine sınırını belirtmesi, gerekirse açıklayıcı soru sorması ve uygun bir sonraki adıma yönlendirmesi beklenir. Bu sonuçlar ayrıca güvenlik ve içerik sahipliği ekipleriyle değerlendirilmelidir.
07Sonuç
Yapay zekâ asistanı pilotunda başarı ölçütlerini kullanım senaryosu keşfinden önce belirlemek, teknik denemeyi ölçülebilir bir iş çalışmasına dönüştürür. Önce hangi ihtiyacın karşılanacağını tanımlayın; ardından iş değeri, onaylı içeriğe dayalı yanıt, kaynak gösterimi, bilinmeyeni belirtme ve risk yönetimini birlikte test edin. Kurumsal bilgi bankası ve KVKK uyumu gerektiren yapay zekâ uygulamalarınız için OPEIS Teknoloji yapay zekâ çözümleri hizmet sayfasını inceleyebilirsiniz.
DESTEK
Bu konuda destek alın
Yazıdaki yaklaşımı kendi altyapınıza uyarlamak için ekibimize yazın. 1 iş günü içinde dönüş yapıyoruz.
İletişime geçin