Yapay Zeka Verisi ve Annotasyon · Kalite kapılarıyla ilerleyen geliştirme
Yapay Zeka Veri Hazırlama ve Doğrulama
Her temizlik kuralı, çıkarılan kayıt, dönüşüm parametresi, veri bölmesi, sızıntı kontrolü ve kabul edilen istisna değiştirdiği ham ve hazırlanmış sürüme bağlı kalmadığında hazırlanmış veriye güvenilemiyor.
Onaylı ham sürümü belirli bir eğitim ya da değerlendirme işi için hazırlıyoruz. Temizlik kuralı, çıkarılan kayıt, veri bölmesi ve doğrulama sonucu hangi dataset sürümünü değiştirdiyse onunla bağlı kalıyor.
Veri sorumlunuz ham veri baseline'ını, tekrarlanabilir dönüşüm kayıtlarını, bölme ve sızıntı bulgularını, ayrıca tek bir kullanım için onaylanan sürümü gösteren veri kartını devralıyor.


Birlikte çalıştığımız 500'den fazla markadan birkaçı
Tüm referansları görAdımlar, kapılar ve kararı verenler
Çalışma şeklimiz
Önemli hiçbir değişiklik kayıt dışında kalmıyor. Ham sürüm, dönüşüm parametreleri, çıkarılan kayıtlar, önerilen veri bölmeleri, test sonuçları ve kabul edilen dataset birbirine bağlı ilerliyor.
Kaynak veriyi profille
Şemayı, dağılımları, eksik değerleri, bilinen kusurları, hassas alanları ve tanımlı kesitleri hedef eğitim ya da değerlendirme kullanımıyla karşılaştırıyoruz.
- Yapay zeka desteği
- Ham veri şeması ve kusur baseline tablosunun taslağını çıkarır.
- İnsan onayı
- Kaynak sürümler kullanılabilir durumda mı, kabul ölçütleri net mi? Hangi kaynak sürümlerin kullanılacağına ve kabul ölçütlerine veri sorumlunuz karar verir.


Kaydını tutarak temizle
Veriyi temizliyor, normalleştiriyor ve dönüştürüyoruz. Bu sırada parametreleri, çıkarmaları ve istisnaları kaydediyoruz. Nadir ama etkisi büyük vakaları, datasetten kaybolmadan önce ayrıca kontrol ediyoruz.
- Yapay zeka desteği
- Temizlik sırasında sessizce silinmeden önce, nadir ama etkisi büyük vakaları işaretler.
- İnsan onayı
- Hazırlanan sürümü, onaylı girdilerden yeniden kurabiliyor muyuz? Hangi temizlik parametresinin ve çıkarmanın kabul edilebilir sayılacağına veri sorumlunuz karar verir.


Bölmeleri ve sızıntıyı zorla
Tekrarları, bulaşmayı, eğitim/değerlendirme sızıntısını, bölme bütünlüğünü, şema geçerliliğini, kapsamı ve kritik kesitleri test ediyoruz. Ölçülen kaliteyi şişiren ya da önemli boşlukları gizleyen sorunlar bu aşamada ortaya çıkıyor.
- Yapay zeka desteği
- Önerilen bölmelerde tekrar ve bulaşma adayı olan kayıtları tarar.
- İnsan onayı
- Birlikte belirlediğimiz kalite ve sızıntı ölçütleri, gerekli kesitlerde karşılanıyor mu? İşaretlenen her sızıntı ya da bulaşma vakasını veri sorumlunuz kabul veya reddeder.


Kabul edilen sürümü kayda geçir
Manifesti, dataset kartını, data lineage'ı, doğrulama kanıtını, bilinen sınırlılıkları ve kabul edilen istisnaları belirtilen kullanım için bir araya getiriyoruz.
- Yapay zeka desteği
- Doğrulama kanıtından yola çıkarak manifesti ve dataset kartını bir araya getirir.
- İnsan onayı
- Hangi dataset sürümü ve hangi istisnalar, kullanım için onaylandı? Hangi dataset sürümünün ve istisnaların onaylanacağına veri sorumlunuz karar verir.


Adı konmuş, sizde kalan çıktılar
Elinize geçenler
Bir kayıt ham verinin durumunu gösteriyor, diğeri nasıl değiştiğini anlatıyor. Son teslim kaydı da veri sorumlunuzun hangi sürümü ve istisnaları kabul ettiğini belirtiyor.


Rapor
Ham veri şeması ve kusur baseline tablosu
Ham dataset sürümü için şemanın, dağılımların, eksik değerlerin, tekrarların, hassas alanların, bilinen kusurların ve tanımlı kesitlerin başlangıç görünümünü sunar.


Playbook
Dönüşüm kuralları ve temizleme kayıtları
Hazırlanan veriyi üretmek için kullanılan sıralı dönüşümleri, temizlik kurallarını, parametreleri, çıkarılan kayıtları, istisnaları ve sürüm geçmişini içerir.


Test kanıtı
Tekilleştirme, sızıntı ve veri bölme raporu
Tekrarlar, bulaşma, eğitim/değerlendirme sızıntısı, bölme bütünlüğü ve gerekli kesitler için sonuçları gösterir. Açık kalan istisnalar da bu raporda görünür kalır.


Dataset
Doğrulanmış sürüm manifestosu ve veri kartı
Kabul edilen dataset sürümünü, data lineage'ı, şemayı, hedef kullanımı, kalite kanıtını, sınırlılıkları, istisnaları ve sorumlulukları tek bir teslim kaydında bir araya getirir.
Kapsam ve dürüst sınırlar
Bu çalışmanın size uyduğu durumlar
Bu çalışma, ham verinin toplanmasıyla eğitim ya da değerlendirme setine güvenilmesi arasındaki boşluğu kapatıyor. Dönüşümlerin ve veri bölme kararlarının yeniden kurulabilmesi gereken işlere uygundur.
Şu durumlarda iyi bir seçim
- Hedef kullanım belli, ama şema, kalite beklentileri, hassas veri kuralları ve kritik kesitler henüz tek bir kabul kaydında buluşmuyor.
- Bilinen kusurlar, tekrarlar, bulaşma ve veri bölme kısıtları ayrı yerlerde izleniyor, bu yüzden ham dataset tek sürüm olarak değerlendirilemiyor.
- Hazırlanan dataset kullanılabilir görünüyor, fakat onaylı ham sürümler ve kayıtlı dönüşümler üzerinden aynı sonuç yeniden kurulamıyor.
- Temizlik ve normalleştirme notebook içinde yapılıyor, ama şema kontrolleriyle dönüşüm parametreleri değiştirdikleri dataset sürümüne bağlanmıyor.
- Tekilleştirme ve hassas veri yönetimi bölmelerden önce uygulanıyor, ancak eğitim/değerlendirme sızıntısı ve bulaşma açık kalıyor.
- Toplam kalite kabul edilebilir görünüyor, yine de kritik kesit kapsamı, data lineage ve tekrarlanabilirlik önemli kayıtlarda bozuluyor.
- Dataset kartı hazırlanıyor, ama kabul edilen sürümü, hedef kullanımı, açık istisnaları ve bunları onaylayan veri sorumlusunu göstermiyor.
Şu durumlarda başka bir çalışma daha doğru
- Kaynak veri veya hassas veri kullanımı için hukuki onay istiyorsunuz. Kullanım kanıtını koruyoruz, kararı yetkin hukuk sorumlunuz veriyor.
- Temizliğin her önyargıyı, kusuru ve gelecekteki sızıntı riskini kaldırmasını istiyorsunuz. Doğrulama incelenen kontrol ve kesitleri kaydediyor, garanti vermiyor.
- Eksik veriyi toplamamızı veya aşağı akış pipeline'ını işletmemizi istiyorsunuz. Bu çalışma tek onaylı sürümü hazırlıyor, diğer işler ayrı kapsam gerektiriyor.
Bunlardan biri sizin durumunuza daha yakınsa, buradan başlayın: AI veri hizmetlerini inceleyin
AI'ı production'a taşıyan mühendisler
Zeo'nun kod yazıp teslim eden tarafı burası. Kıdemli mühendislerimiz agent, chatbot ve RAG sistemleri geliştiriyor, çevrelerindeki otomasyon ve veri işlerini üstleniyor, sistemler canlıya çıktıktan sonra da işletmeyi sürdürüyor. 2011'den beri 500'den fazla markayla çalıştık.
Kullandığımız araçlar
Bu işin arkasındaki araçlar
DVCTemizleme kurallarını değiştirdiği veri seti sürümüne bağladığımız kayıt
Hugging FaceHazırlık ve sınırlamaları sonraki ekipler için belgelediğimiz hosted dataset card
JupyterTemizliğin yapıldığı ve kaydının tutulduğu aynı çalıştırılabilir notebook
Snorkel AITemizleme kuralını yeniden kullanılabilir ve denetlenebilir kılan programatik labeling-function katmanı
TonicGerçek seti açmadan split ve doğrulama mantığını sınadığımız sentetik veri
LabelboxTemiz verinin yanında doğrulama ve reviewer kararlarını tuttuğumuz yapılandırılmış kayıt
Sonraki adım
Hazırlanan sürümü yeniden kurulabilir hale getirelim


Karar vermeden önce




























