Her temizlik kuralı, çıkarılan kayıt, dönüşüm parametresi, veri bölmesi, sızıntı kontrolü ve kabul edilen istisna değiştirdiği ham ve hazırlanmış sürüme bağlı kalmadığında hazırlanmış veriye güvenilemiyor.

Onaylı ham sürümü belirli bir eğitim ya da değerlendirme işi için hazırlıyoruz. Temizlik kuralı, çıkarılan kayıt, veri bölmesi ve doğrulama sonucu hangi dataset sürümünü değiştirdiyse onunla bağlı kalıyor.

Veri sorumlunuz ham veri baseline'ını, tekrarlanabilir dönüşüm kayıtlarını, bölme ve sızıntı bulgularını, ayrıca tek bir kullanım için onaylanan sürümü gösteren veri kartını devralıyor.

Yapay Zeka Veri Hazırlama ve Doğrulama illüstrasyonu: yapay zeka kullanımı için bir veri setini hazırlayan ve doğrulayan ekip

Birlikte çalıştığımız 500'den fazla markadan birkaçı

Tüm referansları gör
  • Mustela
  • A101
  • Atasun Optik
  • İstikbal
  • Hepsikredi
  • Ajansspor
  • Tatilsepeti

Önemli hiçbir değişiklik kayıt dışında kalmıyor. Ham sürüm, dönüşüm parametreleri, çıkarılan kayıtlar, önerilen veri bölmeleri, test sonuçları ve kabul edilen dataset birbirine bağlı ilerliyor.

  1. Kaynak veriyi profille

    Şemayı, dağılımları, eksik değerleri, bilinen kusurları, hassas alanları ve tanımlı kesitleri hedef eğitim ya da değerlendirme kullanımıyla karşılaştırıyoruz.

    Yapay zeka desteği
    Ham veri şeması ve kusur baseline tablosunun taslağını çıkarır.
    İnsan onayı
    Kaynak sürümler kullanılabilir durumda mı, kabul ölçütleri net mi? Hangi kaynak sürümlerin kullanılacağına ve kabul ölçütlerine veri sorumlunuz karar verir.
  2. Kaydını tutarak temizle

    Veriyi temizliyor, normalleştiriyor ve dönüştürüyoruz. Bu sırada parametreleri, çıkarmaları ve istisnaları kaydediyoruz. Nadir ama etkisi büyük vakaları, datasetten kaybolmadan önce ayrıca kontrol ediyoruz.

    Yapay zeka desteği
    Temizlik sırasında sessizce silinmeden önce, nadir ama etkisi büyük vakaları işaretler.
    İnsan onayı
    Hazırlanan sürümü, onaylı girdilerden yeniden kurabiliyor muyuz? Hangi temizlik parametresinin ve çıkarmanın kabul edilebilir sayılacağına veri sorumlunuz karar verir.
  3. Bölmeleri ve sızıntıyı zorla

    Tekrarları, bulaşmayı, eğitim/değerlendirme sızıntısını, bölme bütünlüğünü, şema geçerliliğini, kapsamı ve kritik kesitleri test ediyoruz. Ölçülen kaliteyi şişiren ya da önemli boşlukları gizleyen sorunlar bu aşamada ortaya çıkıyor.

    Yapay zeka desteği
    Önerilen bölmelerde tekrar ve bulaşma adayı olan kayıtları tarar.
    İnsan onayı
    Birlikte belirlediğimiz kalite ve sızıntı ölçütleri, gerekli kesitlerde karşılanıyor mu? İşaretlenen her sızıntı ya da bulaşma vakasını veri sorumlunuz kabul veya reddeder.
  4. Kabul edilen sürümü kayda geçir

    Manifesti, dataset kartını, data lineage'ı, doğrulama kanıtını, bilinen sınırlılıkları ve kabul edilen istisnaları belirtilen kullanım için bir araya getiriyoruz.

    Yapay zeka desteği
    Doğrulama kanıtından yola çıkarak manifesti ve dataset kartını bir araya getirir.
    İnsan onayı
    Hangi dataset sürümü ve hangi istisnalar, kullanım için onaylandı? Hangi dataset sürümünün ve istisnaların onaylanacağına veri sorumlunuz karar verir.

Bir kayıt ham verinin durumunu gösteriyor, diğeri nasıl değiştiğini anlatıyor. Son teslim kaydı da veri sorumlunuzun hangi sürümü ve istisnaları kabul ettiğini belirtiyor.

  • Rapor

    Ham veri şeması ve kusur baseline tablosu

    Ham dataset sürümü için şemanın, dağılımların, eksik değerlerin, tekrarların, hassas alanların, bilinen kusurların ve tanımlı kesitlerin başlangıç görünümünü sunar.

  • Playbook

    Dönüşüm kuralları ve temizleme kayıtları

    Hazırlanan veriyi üretmek için kullanılan sıralı dönüşümleri, temizlik kurallarını, parametreleri, çıkarılan kayıtları, istisnaları ve sürüm geçmişini içerir.

  • Test kanıtı

    Tekilleştirme, sızıntı ve veri bölme raporu

    Tekrarlar, bulaşma, eğitim/değerlendirme sızıntısı, bölme bütünlüğü ve gerekli kesitler için sonuçları gösterir. Açık kalan istisnalar da bu raporda görünür kalır.

  • Dataset

    Doğrulanmış sürüm manifestosu ve veri kartı

    Kabul edilen dataset sürümünü, data lineage'ı, şemayı, hedef kullanımı, kalite kanıtını, sınırlılıkları, istisnaları ve sorumlulukları tek bir teslim kaydında bir araya getirir.

Bu çalışma, ham verinin toplanmasıyla eğitim ya da değerlendirme setine güvenilmesi arasındaki boşluğu kapatıyor. Dönüşümlerin ve veri bölme kararlarının yeniden kurulabilmesi gereken işlere uygundur.

Şu durumlarda iyi bir seçim

  • Hedef kullanım belli, ama şema, kalite beklentileri, hassas veri kuralları ve kritik kesitler henüz tek bir kabul kaydında buluşmuyor.
  • Bilinen kusurlar, tekrarlar, bulaşma ve veri bölme kısıtları ayrı yerlerde izleniyor, bu yüzden ham dataset tek sürüm olarak değerlendirilemiyor.
  • Hazırlanan dataset kullanılabilir görünüyor, fakat onaylı ham sürümler ve kayıtlı dönüşümler üzerinden aynı sonuç yeniden kurulamıyor.
  • Temizlik ve normalleştirme notebook içinde yapılıyor, ama şema kontrolleriyle dönüşüm parametreleri değiştirdikleri dataset sürümüne bağlanmıyor.
  • Tekilleştirme ve hassas veri yönetimi bölmelerden önce uygulanıyor, ancak eğitim/değerlendirme sızıntısı ve bulaşma açık kalıyor.
  • Toplam kalite kabul edilebilir görünüyor, yine de kritik kesit kapsamı, data lineage ve tekrarlanabilirlik önemli kayıtlarda bozuluyor.
  • Dataset kartı hazırlanıyor, ama kabul edilen sürümü, hedef kullanımı, açık istisnaları ve bunları onaylayan veri sorumlusunu göstermiyor.

Şu durumlarda başka bir çalışma daha doğru

  • Kaynak veri veya hassas veri kullanımı için hukuki onay istiyorsunuz. Kullanım kanıtını koruyoruz, kararı yetkin hukuk sorumlunuz veriyor.
  • Temizliğin her önyargıyı, kusuru ve gelecekteki sızıntı riskini kaldırmasını istiyorsunuz. Doğrulama incelenen kontrol ve kesitleri kaydediyor, garanti vermiyor.
  • Eksik veriyi toplamamızı veya aşağı akış pipeline'ını işletmemizi istiyorsunuz. Bu çalışma tek onaylı sürümü hazırlıyor, diğer işler ayrı kapsam gerektiriyor.

Bunlardan biri sizin durumunuza daha yakınsa, buradan başlayın: AI veri hizmetlerini inceleyin

Zeo'nun kod yazıp teslim eden tarafı burası. Kıdemli mühendislerimiz agent, chatbot ve RAG sistemleri geliştiriyor, çevrelerindeki otomasyon ve veri işlerini üstleniyor, sistemler canlıya çıktıktan sonra da işletmeyi sürdürüyor. 2011'den beri 500'den fazla markayla çalıştık.

  • DVC

    Temizleme kurallarını değiştirdiği veri seti sürümüne bağladığımız kayıt

  • Hugging Face

    Hazırlık ve sınırlamaları sonraki ekipler için belgelediğimiz hosted dataset card

  • Jupyter

    Temizliğin yapıldığı ve kaydının tutulduğu aynı çalıştırılabilir notebook

  • Snorkel AI

    Temizleme kuralını yeniden kullanılabilir ve denetlenebilir kılan programatik labeling-function katmanı

  • Tonic

    Gerçek seti açmadan split ve doğrulama mantığını sınadığımız sentetik veri

  • Labelbox

    Temiz verinin yanında doğrulama ve reviewer kararlarını tuttuğumuz yapılandırılmış kayıt

Onaylı ham sürümleri, hedef kullanımı, hassas veri kurallarını ve veri bölme kısıtlarını paylaşın. Bir sürüm kabul edilmeden önce gereken dönüşümleri ve doğrulama kanıtını çıkaralım.
Veri uzmanıyla konuşun

Hazırlık başlamadan önce neleri paylaşmalıyız?

Ham dataset sürümlerine, hedef eğitim ya da değerlendirme kullanımına, şema ve kalite beklentilerine, hassas veri kurallarına, kesit tanımlarına, bilinen kusurlara ve kabul ölçütlerine ihtiyaç duyuyoruz. Ayrıca veri bölme kuralları ve istisnalar konusunda karar verecek bir sorumlu da gerekiyor.

AI desteği bu işte nerede işe yarar?

Onaylı araçlar profilleri karşılaştırabilir, sınırları belli kontroller önerebilir ve olası tekrar ya da bulaşma adaylarını işaretleyebilir. Uzmanımız bu önerileri kaynak kayıtlar ve deterministik testlerle doğruluyor. Hassas verinin nasıl kullanılacağına, veri bölmelerine, istisnalara ve kullanılacak sürüme insanlar karar veriyor.

Datasetin hazır olduğunu ne gösterir?

Şema doğrulama geçiş oranını, tekrar ve bulaşma oranını, veri bölmeleri arası sızıntı oranını ve dönüşüm tekrarlanabilirliğini anlaştığımız ölçütlere göre inceliyoruz. Önem taşıyan kesitlere ayrıca bakıyoruz. Temiz görünen bir toplam sonuç, kritik bir vakanın temizleme sırasında silinmesini ya da sızıntının kaliteyi olduğundan iyi göstermesini gizleyemez.

Doğrulama datasetin önyargısız olduğunu kanıtlar mı?

Hayır. Hangi kontrollerin çalıştırıldığını, hangi kesitlerin incelendiğini ve bu sürümde hangi kusur ya da sınırlılıkların bulunduğunu gösterir. Gelecekteki her kullanımın adil, doğru ya da sızıntısız olacağını kanıtlamaz.