Ne işe yarar (iş diliyle)

Bir video veya ses kaydındaki Türkçe konuşmayı otomatik olarak yazıya döker — hangi cümlenin kaçıncı saniyede söylendiği bilgisiyle birlikte. Böylece saatlerce kayıt izlemek yerine metni okuyup arayabilir, istenen ana tıklayıp gidebilirsiniz. Dışarıya ücret ödenmez, ses kaydı dışarı çıkmaz (gizlilik), kendi sunucunuzda çalışır.

Hangi müşteri/projelerde işe yarar

Konuşma içeren her üründe: mülakat/toplantı kaydı, çağrı merkezi görüşmeleri, röportaj/podcast, eğitim videosu, mahkeme/danışma görüşmeleri, video altyazısı. Türkçe ağırlıklı içeriği olan her müşteride doğrudan kullanılır.

Nasıl çalışır (kısa, sade)

Videodan ses ayıklanır → konuşma tanıma modeli sesi metne çevirir → çıktı hem düz metin hem de cümle/kelime bazında zaman damgalarıyla verilir. Sessizlik filtresi ile boş kısımlar atlanır.

Olgunluk

canlida-kanitlanmis — Aday’da hem mülakat hem 141 videoluk batch’te kullanıldı. CPU’da --pool=solo ile tüm çekirdekleri kullanacak şekilde optimize edildi (~3 dk/video). medium/int8 Türkçe için yeterli; gerekirse large-v3’e çıkılır.

Teknik (geliştiriciler için)

aday · worker/asr.py (extract_audio ffmpeg ile 16kHz mono wav, transcribe faster-whisper). Env: WHISPER_MODEL_SIZE, WHISPER_DEVICE, WHISPER_COMPUTE_TYPE, WHISPER_LANGUAGE, WHISPER_CPU_THREADS, WHISPER_BEAM_SIZE. Girdi: video/ses dosyası. Çıktı: (metin, segmentler[start/end/text/words]). Sınır: GPU yok → ~1x realtime; beam_size=1 (greedy) hızlı ama doğruluk biraz düşer. Genelde async-medya-analiz-pipeline içinde, transkript-temizleme-konusmaci-ayristirma ile birlikte kullanılır.