AI-ready data; tanımlı bir AI görevi için kaynağı, anlamı, kalitesi, kapsamı, güncelliği, erişim yetkisi, kullanım hakkı ve riskleri bilinen; eğitim, retrieval veya değerlendirme sürecinde izlenebilir biçimde kullanılabilen veridir. Veri çokluğu hazırlık anlamına gelmez. Kullanım amacı, hata maliyeti, temsil eksikleri, kişisel veri, telif, ticari sır ve değişiklik yönetimi birlikte değerlendirilmelidir.
AI-ready tanımı kullanım amacından başlar
“Verimiz AI için hazır mı?” sorusu tek başına cevaplanamaz. Sınıflandırma modeli, belge arama sistemi, tahmin motoru, üretken asistan ve AI ajanı farklı veri özellikleri ister. Örneğin finansal tahmin için zaman serisinin sürekliliği ve geriye dönük revizyon bilgisi kritik olabilir; RAG sistemi için belge güncelliği, erişim yetkisi ve kaynak gösterilebilirlik öne çıkar.
| Kullanım | Kritik veri özelliği | Tipik hata |
|---|---|---|
| Model eğitimi | Temsil, etiket kalitesi, bölünme ve kullanım hakkı. | Geçmiş önyargıyı hedef değişkeni sanmak. |
| RAG | Belge kaynağı, parçalama, güncellik, yetki ve alıntı. | Eski ve yeni politikanın aynı ağırlıkla geri getirilmesi. |
| Tahmin | Zaman bütünlüğü, gecikme, veri sızıntısı ve dış değişkenler. | Geleceğe ait bilgiyi eğitim verisine yanlışlıkla katmak. |
| AI ajanı | İşlem durumu, güvenilir kimlik, yetki ve geri bildirim. | Okuma verisini işlem yetkisiyle karıştırmak. |
Veri envanteri dosya listesinden daha ayrıntılı olmalıdır
Her veri varlığı için iş sahibi, teknik kaynak, sistem, format, güncelleme sıklığı, kapsadığı dönem, veri konusu, sınıflandırma, erişim rolleri, kullanım hakkı, kalite göstergesi ve bağımlı rapor/model kaydedilmelidir. Aynı müşterinin CRM, faturalama ve destek sistemlerinde farklı kimliklerle tutulması envanter ve master data problemi olarak görünür olmalıdır.
- Kaynak: Veri hangi işlem veya kurum tarafından üretiliyor?
- Sahip: Tanım, kalite ve kullanım kararını kim onaylıyor?
- Tüketici: Hangi rapor, model, RAG koleksiyonu veya ajan kullanıyor?
- Sınıf: Kamuya açık, kurum içi, gizli, kişisel veya özel nitelikli mi?
- Hak: Toplama, yeniden kullanım, model eğitimi ve üçüncü taraf paylaşımı yetkisi var mı?
- Yaşam döngüsü: Ne zaman güncellenir, arşivlenir veya silinir?
Kalite tek bir doğruluk yüzdesine indirgenmemelidir
| Boyut | Soru | AI etkisi | Ölçüm örneği |
|---|---|---|---|
| Doğruluk | Değer gerçek durumu temsil ediyor mu? | Yanlış sınıflandırma veya öneri. | Doğrulanmış kayıtla hata oranı. |
| Tamlık | Gerekli alan ve dönemler mevcut mu? | Belirli gruplar için eksik sonuç. | Zorunlu alan doluluk oranı. |
| Tutarlılık | Aynı kavram sistemler arasında aynı mı? | Çelişkili cevap ve kimlik eşlemesi. | Kaynaklar arası uyuşmazlık. |
| Güncellik | Veri karar anına yeterince yakın mı? | Eski politika veya fiyatla işlem. | Gecikme ve son güncelleme yaşı. |
| Temsil | Gerçek kullanıcı ve durum çeşitliliğini kapsıyor mu? | Belirli gruplarda sistematik düşük performans. | Segment kapsamı ve hata farkı. |
| Geçerlilik | Format, aralık ve iş kurallarına uyuyor mu? | Modelin anlamsız değerleri öğrenmesi. | Kural ihlali oranı. |
NIST AI RMF, veri ve girdileri AI sisteminin temel boyutlarından biri olarak ele alır; ölçüm ve risk yönetiminin kullanım bağlamına göre yürütülmesini ister. Kalite değerlendirmesi bu nedenle yalnız veri mühendisliği ekibinin teknik testi değildir.
Metadata ve iş anlamı olmadan veri yeniden kullanılamaz
“Gelir”, “aktif müşteri”, “başarılı işlem” veya “riskli kayıt” gibi alanlar ekipler arasında farklı tanımlanabilir. AI sistemi bu belirsizliği kendiliğinden çözmez; çoğu zaman tutarsızlığı ölçeklendirir. İş sözlüğü, veri sözlüğü, kod listeleri, birim, para birimi, zaman dilimi ve geçerlilik dönemi görünür olmalıdır.
İş sözlüğü
Kavramın sahibi, hesaplama yöntemi, kapsamı ve istisnaları yazılır.
Teknik sözlük
Alan tipi, kaynak, format, zorunluluk ve ilişki tanımlanır.
Kullanım notu
Verinin hangi karar için uygun veya uygunsuz olduğu belirtilir.
Sürüm kaydı
Tanım ve hesaplama değişiklikleri geriye dönük izlenir.
Kullanılabilir veri, kullanılmasına izin verilen veridir
Teknik olarak erişilebilir bir veri kümesi; kişisel veri, telif, lisans, sözleşme, ticari sır veya amaç sınırlaması nedeniyle AI kullanımı için uygun olmayabilir. Web’den alınmış içerik, çalışan dosyaları veya müşteri belgeleri “kurumda bulunuyor” diye model eğitimi ya da üçüncü taraf AI aracına aktarım için serbest sayılmaz.
- Veri toplama amacı ile AI kullanım amacı uyumlu mu?
- Kişisel veri için hukuki dayanak, minimizasyon ve saklama planı var mı?
- Telifli veya lisanslı içerik yeniden kullanım hakkı taşıyor mu?
- Ticari sır ve müşteri gizliliği korunuyor mu?
- Alt sağlayıcı, model eğitimi veya loglama için veriyi kullanıyor mu?
- Silme, itiraz ve erişim talepleri türetilmiş veri setlerine uygulanabiliyor mu?
Eğitim, RAG ve analitik için farklı veri hazırlığı gerekir
| Yol | Hazırlık odağı | Kontrol |
|---|---|---|
| Model eğitimi/fine-tuning | Örnek temsil, etiket, bölünme, lisans ve veri sızıntısı. | Dataset card, train/validation/test ayrımı. |
| RAG | Belge seçimi, parçalama, metadata, yetki ve güncellik. | Retrieval ve groundedness değerlendirmesi. |
| BI/tahmin | Kaynak bütünlüğü, zaman, master data ve hesaplama tanımı. | Data contract ve kalite karnesi. |
| Ajan işlemleri | Gerçek zamanlı durum, idempotency, yetki ve işlem sonucu. | İnsan onayı, limit ve bağımsız log. |
Lineage ve sürüm yönetimi model sonucunu açıklamayı sağlar
Bir AI çıktısı sorunlu olduğunda hangi kaynak kaydın, hangi dönüşümün, hangi veri seti sürümünün ve hangi model/prompt sürümünün kullanıldığı izlenebilmelidir. Lineage; kaynaktan sonuca veri akışını, filtreleri, birleştirmeleri ve sahipliği gösterir.
- Veri seti ve belge koleksiyonu sürüm kimliği.
- Kaynak sistem ve çıkarım zamanı.
- Temizleme, maskeleme ve dönüşüm adımları.
- Etiketleyen ekip veya otomatik yöntem.
- Model, prompt, retrieval ve değerlendirme sürümü.
- Hangi çıktıların hangi veri sürümünden üretildiği.
Değerlendirme verisi üretim verisinden ayrılmalıdır
AI sistemi yalnız ortalama doğrulukla değerlendirilmemelidir. Kritik, nadir ve olumsuz durumları içeren altın test setleri; farklı kullanıcı ve veri segmentleri; güncellik senaryoları ve adversarial örnekler oluşturulmalıdır. Test sorularının üretim sistemine sızması veya aynı kayıtların eğitim ve testte bulunması sonuçları yapay biçimde yükseltir.
90 günlük veri hazırlık planı
- 0–15 gün: Kullanım amacı, karar etkisi ve veri kaynaklarını kesinleştirin.
- 15–30 gün: Veri sahibi, sınıf, hak, kalite ve erişim envanteri çıkarın.
- 30–50 gün: Kritik kalite kurallarını, iş sözlüğünü ve master data eşlemesini kurun.
- 50–70 gün: Lineage, sürüm, maskeleme ve erişim kontrollerini uygulayın.
- 70–85 gün: Altın test seti ve segment bazlı değerlendirme çalıştırın.
- 85–90 gün: Pilot kullanım, açık risk, durdurma kriteri ve güncelleme sahibini karara bağlayın.
Kaynaklar ve gözden geçirme notu
Bu rehberde değişebilir veya teknik iddialar için öncelikle resmî kurum, ürün geliştiricisi ve birincil araştırma kaynakları kullanılmıştır. Bağlantılar 27 Temmuz 2026 tarihinde gözden geçirilmiştir.
- 01NIST — Artificial Intelligence Risk Management Framework 1.0
AI sistemlerinde uygulama bağlamı, veri ve girdi, model, görev ve çıktı boyutlarını risk yönetimiyle ilişkilendirir.
- 02NIST — Generative Artificial Intelligence Profile
Üretken AI yaşam döngüsünde veri kalitesi, ön işleme, değerlendirme, dokümantasyon ve geri bildirim pratiklerini ele alır.
- 03OECD.AI / GPAI — The Role of Data in AI
AI geliştirmede veri kalitesi, erişilebilirlik, bulunabilirlik ve veri kaynaklı toplumsal etkileri değerlendirir.
- 04OECD.AI / GPAI — A practical tool for government data sharing for AI
AI için veri paylaşımında kalite, erişilebilirlik, hak, güvenlik ve hesap verebilirlik kriterlerini sunar.
- 05NIST — Big Data Interoperability Framework, Volume 9
Metadata, veri akışı, uzun vadeli veri yönetişimi ve kaliteli veri seti üretimi konularını ele alır.