DataKita

Enterprise datasets

Data Indonesia yang mengikuti kebutuhan model Anda.

DataKita membantu tim AI mendefinisikan, mengumpulkan, dan meninjau dataset Bahasa Indonesia berbasis consent untuk training dan evaluation.

Supported data

Audio, video, text, dan preference data.

Setiap engagement dimulai dari spesifikasi. Halaman ini menjelaskan kapabilitas, bukan inventaris dataset live.

Conversational audio

Rekaman Bahasa Indonesia dan bahasa daerah untuk speech recognition, transcription, dan conversational AI.

Video & visual context

Video, dashcam, dan rekaman visual dari konteks Indonesia sehari-hari untuk computer vision dan model multimodal.

Text data

Teks umum dan domain-spesifik untuk fine-tuning, evaluation, dan language understanding.

Preference data

Pasangan respons dan anotasi preferensi untuk RLHF, safety, dan model evaluation.

Model use cases

Dibangun untuk keputusan training dan evaluation yang nyata.

  • Speech recognition dan transcription
  • Multilingual language models
  • Model fine-tuning
  • Evaluation dan benchmarking
  • Safety dan alignment
  • Custom data collection

Quality workflow

Spesifikasi menjadi alur review yang dapat ditelusuri.

Kriteria penerimaan ditetapkan sebelum koleksi. Sampel diberikan untuk review sebelum paid pilot.

  1. 01

    Task design

    Instruksi, consent, dan kriteria penerimaan ditetapkan sebelum koleksi dimulai.

  2. 02

    Automated checks

    Format, kelengkapan, durasi, dan sinyal kualitas dasar diperiksa saat data masuk.

  3. 03

    Human review

    Kiriman yang ditandai dan sampel terpilih ditinjau untuk menjaga konsistensi.

  4. 04

    Traceable delivery

    Dataset menyertakan metadata consent dan metadata bahasa atau lokasi jika dikumpulkan.

Metadata

Konteks yang membantu tim Anda menilai provenance.

  • Consent record dan usage purpose
  • Tipe tugas dan versi instruksi
  • Bahasa atau register yang dikumpulkan
  • Wilayah jika relevan dan disetujui
  • Hasil validasi dan status review
  • Identifier pengiriman untuk traceability

Delivery formats

JSON

Structured records for application workflows

CSV

Tabular delivery for analysis and review

JSONL

Line-delimited records for ML pipelines

Custom collection

Dari requirement ke paid pilot.

Tim DataKita menyusun tugas, metadata, dan alur review berdasarkan kebutuhan yang sudah divalidasi bersama.

  1. 01

    Discovery

    Kami memetakan use case, volume, bahasa, dan ambang kualitas.

  2. 02

    Tailored sample

    Tim DataKita menyiapkan sampel yang mengikuti spesifikasi Anda.

  3. 03

    Quality review

    Tim Anda menilai kualitas dan memberi umpan balik terstruktur.

  4. 04

    Paid pilot

    Spesifikasi yang disetujui diterapkan pada koleksi berbayar.

Consent dan withdrawal menjadi bagian dari spesifikasi data.

DataKita mencatat consent per submission dan mendukung penarikan dari penggunaan lisensi di masa depan. Detail operasional tersedia di Trust Center.

Enterprise inquiry

Ceritakan dataset yang dibutuhkan model Anda.

Kami akan meninjau use case, tipe data, volume, dan kebutuhan kualitas sebelum menghubungi Anda melalui email kerja.

Jenis dataset (pilih minimal satu)