Skip to main content
استخدم قيمة id كمعامل model في طلبات API. عدد النماذج المتوفرة حاليًا: 5.

الاستخدام

تقوم نماذج تحويل الكلام إلى نص بنسخ الصوت المنطوق إلى نص مكتوب. يتم الوصول إليها عبر واجهة Audio Transcriptions API.

صيغ الصوت المدعومة

wav, wave, flac, m4a, aac, mp4, mp3, ogg, oga, webm يُقبل الملف عندما يكون نوع MIME الخاص به أو امتداده ضمن هذه القائمة، ويجب أيضًا أن يجتاز فحص البايتات السحرية (magic-byte) على البايتات المرفوعة. إعادة تسمية ملف بامتداد مدعوم لا تكفي.

صيغ الاستجابة

الطوابع الزمنية

عيّن timestamps: true لتلقي بيانات التوقيت مع التفريغ. تضيف الاستجابة كائن timestamps تعتمد درجة تفصيله على النموذج:
nvidia/parakeet-tdt-0.6b-v3 هو النموذج الافتراضي، وهو يقبل timestamps: true دون إرجاع توقيتات. لا يوجد خطأ ولا تحذير — تحتوي الاستجابة ببساطة على text ولا شيء آخر. إذا كنت بحاجة إلى التوقيتات، اختر نموذجًا من الجدول أعلاه وتحقق من وجود المفتاح timestamps قبل قراءته.
إدخالات الكلمات على شكل { "word": "...", "start": 0.0, "end": 0.5 } وإدخالات المقاطع على شكل { "text": "...", "start": 0.0, "end": 3.2 }، وجميع الأزمنة بالثواني.
يتم احتساب التسعير لكل ثانية من الصوت المُدخَل. راجع واجهة Audio Transcriptions API للحصول على أمثلة الطلبات وتفاصيل المعاملات.