VERİ REHBERİ · AI HAZIRLIĞI

AI-ready data nedir ve kurumsal veri nasıl hazırlanır?

AI-ready data, yalnız temizlenmiş veya büyük miktarda veri değildir. Belirli bir AI kullanım amacı için yeterli kaliteye, anlama, kapsama, güncelliğe, kullanım hakkına, güvenlik kontrolüne, erişilebilirliğe ve izlenebilirliğe sahip veri bütünüdür. Aynı veri bir raporlama işi için yeterli, müşteri kararı veren bir model için yetersiz olabilir. Hazırlık değerlendirmesi her zaman kullanım senaryosu ve hata etkisiyle birlikte yapılmalıdır.

KISA CEVAP

AI-ready data; tanımlı bir AI görevi için kaynağı, anlamı, kalitesi, kapsamı, güncelliği, erişim yetkisi, kullanım hakkı ve riskleri bilinen; eğitim, retrieval veya değerlendirme sürecinde izlenebilir biçimde kullanılabilen veridir. Veri çokluğu hazırlık anlamına gelmez. Kullanım amacı, hata maliyeti, temsil eksikleri, kişisel veri, telif, ticari sır ve değişiklik yönetimi birlikte değerlendirilmelidir.

AI-ready tanımı kullanım amacından başlar

“Verimiz AI için hazır mı?” sorusu tek başına cevaplanamaz. Sınıflandırma modeli, belge arama sistemi, tahmin motoru, üretken asistan ve AI ajanı farklı veri özellikleri ister. Örneğin finansal tahmin için zaman serisinin sürekliliği ve geriye dönük revizyon bilgisi kritik olabilir; RAG sistemi için belge güncelliği, erişim yetkisi ve kaynak gösterilebilirlik öne çıkar.

KullanımKritik veri özelliğiTipik hata
Model eğitimiTemsil, etiket kalitesi, bölünme ve kullanım hakkı.Geçmiş önyargıyı hedef değişkeni sanmak.
RAGBelge kaynağı, parçalama, güncellik, yetki ve alıntı.Eski ve yeni politikanın aynı ağırlıkla geri getirilmesi.
TahminZaman bütünlüğü, gecikme, veri sızıntısı ve dış değişkenler.Geleceğe ait bilgiyi eğitim verisine yanlışlıkla katmak.
AI ajanıİşlem durumu, güvenilir kimlik, yetki ve geri bildirim.Okuma verisini işlem yetkisiyle karıştırmak.
Karar ilkesi: Veri hazırlık seviyesi, verinin genel “temizliği” ile değil, belirli kullanımın hata toleransı ve karar etkisiyle ölçülmelidir.

Veri envanteri dosya listesinden daha ayrıntılı olmalıdır

Her veri varlığı için iş sahibi, teknik kaynak, sistem, format, güncelleme sıklığı, kapsadığı dönem, veri konusu, sınıflandırma, erişim rolleri, kullanım hakkı, kalite göstergesi ve bağımlı rapor/model kaydedilmelidir. Aynı müşterinin CRM, faturalama ve destek sistemlerinde farklı kimliklerle tutulması envanter ve master data problemi olarak görünür olmalıdır.

  • Kaynak: Veri hangi işlem veya kurum tarafından üretiliyor?
  • Sahip: Tanım, kalite ve kullanım kararını kim onaylıyor?
  • Tüketici: Hangi rapor, model, RAG koleksiyonu veya ajan kullanıyor?
  • Sınıf: Kamuya açık, kurum içi, gizli, kişisel veya özel nitelikli mi?
  • Hak: Toplama, yeniden kullanım, model eğitimi ve üçüncü taraf paylaşımı yetkisi var mı?
  • Yaşam döngüsü: Ne zaman güncellenir, arşivlenir veya silinir?

Kalite tek bir doğruluk yüzdesine indirgenmemelidir

BoyutSoruAI etkisiÖlçüm örneği
DoğrulukDeğer gerçek durumu temsil ediyor mu?Yanlış sınıflandırma veya öneri.Doğrulanmış kayıtla hata oranı.
TamlıkGerekli alan ve dönemler mevcut mu?Belirli gruplar için eksik sonuç.Zorunlu alan doluluk oranı.
TutarlılıkAynı kavram sistemler arasında aynı mı?Çelişkili cevap ve kimlik eşlemesi.Kaynaklar arası uyuşmazlık.
GüncellikVeri karar anına yeterince yakın mı?Eski politika veya fiyatla işlem.Gecikme ve son güncelleme yaşı.
TemsilGerçek kullanıcı ve durum çeşitliliğini kapsıyor mu?Belirli gruplarda sistematik düşük performans.Segment kapsamı ve hata farkı.
GeçerlilikFormat, aralık ve iş kurallarına uyuyor mu?Modelin anlamsız değerleri öğrenmesi.Kural ihlali oranı.

NIST AI RMF, veri ve girdileri AI sisteminin temel boyutlarından biri olarak ele alır; ölçüm ve risk yönetiminin kullanım bağlamına göre yürütülmesini ister. Kalite değerlendirmesi bu nedenle yalnız veri mühendisliği ekibinin teknik testi değildir.

Metadata ve iş anlamı olmadan veri yeniden kullanılamaz

“Gelir”, “aktif müşteri”, “başarılı işlem” veya “riskli kayıt” gibi alanlar ekipler arasında farklı tanımlanabilir. AI sistemi bu belirsizliği kendiliğinden çözmez; çoğu zaman tutarsızlığı ölçeklendirir. İş sözlüğü, veri sözlüğü, kod listeleri, birim, para birimi, zaman dilimi ve geçerlilik dönemi görünür olmalıdır.

TANIM

İş sözlüğü

Kavramın sahibi, hesaplama yöntemi, kapsamı ve istisnaları yazılır.

ŞEMA

Teknik sözlük

Alan tipi, kaynak, format, zorunluluk ve ilişki tanımlanır.

BAĞLAM

Kullanım notu

Verinin hangi karar için uygun veya uygunsuz olduğu belirtilir.

DEĞİŞİM

Sürüm kaydı

Tanım ve hesaplama değişiklikleri geriye dönük izlenir.

Kullanılabilir veri, kullanılmasına izin verilen veridir

Teknik olarak erişilebilir bir veri kümesi; kişisel veri, telif, lisans, sözleşme, ticari sır veya amaç sınırlaması nedeniyle AI kullanımı için uygun olmayabilir. Web’den alınmış içerik, çalışan dosyaları veya müşteri belgeleri “kurumda bulunuyor” diye model eğitimi ya da üçüncü taraf AI aracına aktarım için serbest sayılmaz.

  • Veri toplama amacı ile AI kullanım amacı uyumlu mu?
  • Kişisel veri için hukuki dayanak, minimizasyon ve saklama planı var mı?
  • Telifli veya lisanslı içerik yeniden kullanım hakkı taşıyor mu?
  • Ticari sır ve müşteri gizliliği korunuyor mu?
  • Alt sağlayıcı, model eğitimi veya loglama için veriyi kullanıyor mu?
  • Silme, itiraz ve erişim talepleri türetilmiş veri setlerine uygulanabiliyor mu?

Eğitim, RAG ve analitik için farklı veri hazırlığı gerekir

YolHazırlık odağıKontrol
Model eğitimi/fine-tuningÖrnek temsil, etiket, bölünme, lisans ve veri sızıntısı.Dataset card, train/validation/test ayrımı.
RAGBelge seçimi, parçalama, metadata, yetki ve güncellik.Retrieval ve groundedness değerlendirmesi.
BI/tahminKaynak bütünlüğü, zaman, master data ve hesaplama tanımı.Data contract ve kalite karnesi.
Ajan işlemleriGerçek zamanlı durum, idempotency, yetki ve işlem sonucu.İnsan onayı, limit ve bağımsız log.

Lineage ve sürüm yönetimi model sonucunu açıklamayı sağlar

Bir AI çıktısı sorunlu olduğunda hangi kaynak kaydın, hangi dönüşümün, hangi veri seti sürümünün ve hangi model/prompt sürümünün kullanıldığı izlenebilmelidir. Lineage; kaynaktan sonuca veri akışını, filtreleri, birleştirmeleri ve sahipliği gösterir.

  • Veri seti ve belge koleksiyonu sürüm kimliği.
  • Kaynak sistem ve çıkarım zamanı.
  • Temizleme, maskeleme ve dönüşüm adımları.
  • Etiketleyen ekip veya otomatik yöntem.
  • Model, prompt, retrieval ve değerlendirme sürümü.
  • Hangi çıktıların hangi veri sürümünden üretildiği.

Değerlendirme verisi üretim verisinden ayrılmalıdır

AI sistemi yalnız ortalama doğrulukla değerlendirilmemelidir. Kritik, nadir ve olumsuz durumları içeren altın test setleri; farklı kullanıcı ve veri segmentleri; güncellik senaryoları ve adversarial örnekler oluşturulmalıdır. Test sorularının üretim sistemine sızması veya aynı kayıtların eğitim ve testte bulunması sonuçları yapay biçimde yükseltir.

Ölçüm sınırı: Yüksek offline skor, üretimde güvenilir karar garantisi değildir. Veri dağılımı, kullanıcı davranışı, süreç değişikliği ve dış sistem hataları için canlı izleme ve insan geri bildirimi gerekir.

90 günlük veri hazırlık planı

  1. 0–15 gün: Kullanım amacı, karar etkisi ve veri kaynaklarını kesinleştirin.
  2. 15–30 gün: Veri sahibi, sınıf, hak, kalite ve erişim envanteri çıkarın.
  3. 30–50 gün: Kritik kalite kurallarını, iş sözlüğünü ve master data eşlemesini kurun.
  4. 50–70 gün: Lineage, sürüm, maskeleme ve erişim kontrollerini uygulayın.
  5. 70–85 gün: Altın test seti ve segment bazlı değerlendirme çalıştırın.
  6. 85–90 gün: Pilot kullanım, açık risk, durdurma kriteri ve güncelleme sahibini karara bağlayın.

Kaynaklar ve gözden geçirme notu

Bu rehberde değişebilir veya teknik iddialar için öncelikle resmî kurum, ürün geliştiricisi ve birincil araştırma kaynakları kullanılmıştır. Bağlantılar 27 Temmuz 2026 tarihinde gözden geçirilmiştir.

  1. 01
    NIST — Artificial Intelligence Risk Management Framework 1.0

    AI sistemlerinde uygulama bağlamı, veri ve girdi, model, görev ve çıktı boyutlarını risk yönetimiyle ilişkilendirir.

  2. 02
    NIST — Generative Artificial Intelligence Profile

    Üretken AI yaşam döngüsünde veri kalitesi, ön işleme, değerlendirme, dokümantasyon ve geri bildirim pratiklerini ele alır.

  3. 03
    OECD.AI / GPAI — The Role of Data in AI

    AI geliştirmede veri kalitesi, erişilebilirlik, bulunabilirlik ve veri kaynaklı toplumsal etkileri değerlendirir.

  4. 04
    OECD.AI / GPAI — A practical tool for government data sharing for AI

    AI için veri paylaşımında kalite, erişilebilirlik, hak, güvenlik ve hesap verebilirlik kriterlerini sunar.

  5. 05
    NIST — Big Data Interoperability Framework, Volume 9

    Metadata, veri akışı, uzun vadeli veri yönetişimi ve kaliteli veri seti üretimi konularını ele alır.

Yayın sorumluluğu: Bu içerik kişisel yazar profili kullanılmadan Vatansever Bilişim Anonim Şirketi kurumsal yayın sorumluluğunda hazırlanmıştır. Genel bilgilendirme niteliğindedir; belirli bir kurum için hukuki görüş, yatırım tavsiyesi, güvenlik veya sonuç garantisi değildir.
İLGİLİ HİZMET

AI projesinden önce veri hazırlığını kanıtlayın.

Kullanım amacı, veri kalitesi, hak, güvenlik, lineage ve değerlendirme gereksinimlerini tek hazırlık dosyasında yönetin.