Yapay Zeka Verisi ve Annotasyon · Tanımlı bir evrenden başlayan toplama
Yapay Zeka Veri Seti Toplama
Datasetin tanımlanan evreni temsil etmesi için hedef evren, kritik kesitler, kaynak hakları, rıza kanıtı, örnekleme kuralları, reddedilen kayıtlar ve data lineage tanımdan yayına kadar görünür kalıyor.
Önce datasetin kimi ve hangi koşulları temsil etmesi gerektiğini tanımlıyoruz. Kayıtlar geldikçe kaynak, önerilen kullanım dayanağı, rıza kanıtı, toplama kuralı ve ret geçmişi veriden ayrılmıyor.
Bu sürümde hangi evren boşluklarının kabul edildiği kesit tablosunda görünüyor. Örnekleme tanımı, kaynak hakları kaydı ve data lineage'ı koruyan toplama protokolü veri sorumlunuza geçiyor.


Birlikte çalıştığımız 500'den fazla markadan birkaçı
Tüm referansları görAdımlar, kapılar ve kararı verenler
Çalışma şeklimiz
Toplama, evren ve örnekleme tanımıyla başlıyor. Protokol hangi kaydın datasete gireceğini, hangisinin reddedileceğini ve iki karar için de hangi kanıtın saklanacağını belirliyor.
Dataseti çerçevele
Kullanım amacını, hedef evreni, önemli kesitleri, kaynak seçeneklerini, örnekleme sınırlarını, güvenlik koşullarını ve kabulde arayacağımız kanıtı birlikte tanımlıyoruz.
- Yapay zeka desteği
- Belirtilen amaç ve evrenden yola çıkarak ilk örnekleme tanımının taslağını çıkarır.
- İnsan onayı
- Tanımın gerçekten ihtiyaç duyduğunuz dataseti anlatıp anlatmadığını siz doğrularsınız. Hedef evrenin, kesitlerin ve kabul hedeflerinin doğru tanımlandığını siz onaylarsınız.


Kaynakları ve izinleri incele
Her kaynak için data lineage bilgisini, önerilen kullanım dayanağını, geçerli rıza kanıtını, erişim koşullarını ve dışarıda kalması gereken kayıtları birlikte belgeliyoruz.
- Yapay zeka desteği
- Her aday kaynak için data lineage ve kullanım dayanağı notlarını inceleme için hazırlar.
- İnsan onayı
- Toplamaya yalnızca kullanım dayanağı incelenebilen kaynaklar alınır. Hangi kaynağın incelenebilir bir hak dayanağı taşıdığına veri sorumlunuz karar verir.


Data lineage'ı koruyarak topla
Protokole göre topluyor, kaynak bağlarını koruyor, tekrarları ayırıyor, kusurları işaretliyor ve kaynak kaymasını izliyoruz. Reddedilen veya dönüştürülen kayıtları sürüm geçmişinde tutuyoruz.
- Yapay zeka desteği
- Toplama sürerken ortaya çıkan olası tekrarları ve kaynak kaymasını işaretler.
- İnsan onayı
- Örneklenen bir kayıt, kaynağına ve toplama kuralına kadar izlenebilmelidir. İşaretlenen kusurlardan hangisinin dışlanması gerektiğine veri sorumlunuz karar verir.


Kapsamı sorgula ve kabul et
Dataseti teslimata hazırlarken hedef kesitlerin ne kadar kapsandığına, kullanım hakkı ve rıza kanıtına, data lineage bilgisinin tamlığına ve reddedilen örnek oranına bakıyoruz. Sonuçları başta belirlediğimiz hedeflerle karşılaştırıyoruz.
- Yapay zeka desteği
- Toplanan kanıttan yola çıkarak kapsama ve kabul raporunu bir araya getirir.
- İnsan onayı
- Bu sürümde hangi belgelenmiş boşlukların kabul edilebilir sayılacağına siz karar verirsiniz. Bu sürümdeki hangi kapsama boşluklarının kabul edilebilir olduğuna siz karar verirsiniz.


Adı konmuş, sizde kalan çıktılar
Elinize geçenler
Dataseti toplama geçmişiyle birlikte teslim ediyoruz. Hedef evren, kaynak kararları, reddedilen kayıtlar, zayıf kesitler ve çözülemeyen kısıtlar sonradan incelenebiliyor.


Dataset
Hedef evren ve örnekleme tanım dosyası
Amacı, hedef evreni, kritik kesitleri, kaynak seçeneklerini, örnekleme kısıtlarını ve kabul hedeflerini açıklayan incelenebilir bir tanım sunar.


Politika
Aday kaynakların hak ve rıza kaydı
Kaynak bazında data lineage'ı, önerilen kullanım dayanağını, rıza kanıtını, erişim koşullarını ve çözülemeyen kısıtları gösterir.


Playbook
Toplama protokolü ve data lineage kaydı
Dataseti üretmekte kullanılan adımları, filtreleri, tekilleştirme kurallarını, data lineage olaylarını, retleri, dönüşümleri ve sürüm geçmişini kapsar.


Rapor
Kesit kapsamı ve kaynak kabul tablosu
Kapsamı, kusurları, kullanım hakkı kanıtını, data lineage tamlığını, reddedilen örnekleri ve kabul sırasında değerlendirilen açıkları kesit bazında ortaya koyar.
Kapsam ve dürüst sınırlar
Bu çalışmanın size uyduğu durumlar
Datasetin belirli bir evreni temsil etmesi ve ekibinizin her kayıt için kaynağıyla kabul gerekçesini gösterebilmesi gerekiyorsa bu çalışma uygun bir başlangıçtır.
Şu durumlarda iyi bir seçim
- Toplanan verinin hangi model, değerlendirme veya araştırma işine hizmet edeceği belli, ama bu amaç henüz hedef evren ve örnekleme tanımına dönüşmüyor.
- Kritik gruplar ve kesitler önemli, yine de kapsama üzerinde anlaşılan örnekleme kısıtları yerine en kolay açılan kaynaklara göre şekilleniyor.
- Kullanım hakkı, rıza, güvenlik kısıtları ve reddedilen örnekler toplama sırasında kaydediliyor, ancak inceleme öncesinde bu geçmiş kayboluyor.
- Kullanım amacı belirtiliyor, ama hedef evren, kritik kesitler, örnekleme kısıtları ve kabul hedefleri hâlâ birbiriyle uyuşmuyor.
- Aday kaynaklar bulunuyor, ancak kullanım hakkı, rıza, data lineage ve güvenlik koşulları henüz aynı incelemede buluşmuyor.
- Kayıtlar toplanıyor, fakat tekilleştirme, kusur kontrolleri, kapsama incelemesi, kabul örneklemesi ve data lineage tutarlı uygulanmıyor.
- Bir dataset sürümü teslime hazır görünüyor, yine de boşluklar, dışlanan ve reddedilen kayıtlar ile inceleme sorumlusu yayın dosyasında yer almıyor.
Şu durumlarda başka bir çalışma daha doğru
- Bir kaynak veya önerilen kullanım için hukuki uygunluk görüşü istiyorsunuz. Hak dosyası kanıtı koruyor, bu hükmü yetkin hukuk sorumlunuz veriyor.
- Toplanan tek sürümün her grubu, koşulu ve sonraki kullanımı temsil etmesini istiyorsunuz. Kabul yalnızca belirtilen amaç ve örnekleme tasarımı için geçerli oluyor.
- Toplama içinde veri satın alınmasını veya üçüncü taraf erişimi açılmasını istiyorsunuz. Aday kaynakları kaydediyoruz, edinim ayrı anlaşma gerektiriyor.
Bunlardan biri sizin durumunuza daha yakınsa, buradan başlayın: AI veri hizmetlerini inceleyin
AI'ı production'a taşıyan mühendisler
Zeo'nun kod yazıp teslim eden tarafı burası. Kıdemli mühendislerimiz agent, chatbot ve RAG sistemleri geliştiriyor, çevrelerindeki otomasyon ve veri işlerini üstleniyor, sistemler canlıya çıktıktan sonra da işletmeyi sürdürüyor. 2011'den beri 500'den fazla markayla çalıştık.
Kullandığımız araçlar
Bu işin arkasındaki araçlar
DVCBu toplama turunu önceki kabul edilmiş sürümle karşılaştırdığımız version history
Scale AIHer kaydı izin kanıtıyla birlikte tuttuğumuz yönetilen veri toplama operasyonu
Label StudioKaynak, karar ve ret nedenini tek kayıtta birleştirdiğimiz toplama günlüğü
Snorkel AIKapsam kabulünde sistematik yanlılığı sınadığımız programatik kural katmanı
TonicGerçek kaynakla erişemediğimiz nüfus boşluğunu açıkça tamamladığımız sentetik kayıtlar
Sonraki adım
Kaynakları açmadan önce hedef evreni tanımlayalım


Karar vermeden önce




























