/audio/transcriptions، واختر نموذج تفريغ، وحدّد صيغة الاستجابة التي تريدها.
هل تتعامل مع تسجيل لمحادثة؟ ينطلق دليل محاضر الاجتماعات باستخدام تحويل الكلام إلى نص من ملف صوتي وصولًا إلى قرارات وبنود عمل تستشهد بالثانية التي اتُّفق عليها فيها، بما في ذلك النماذج التي تُرجع توقيتات المقاطع وكيفية التعامل مع تفريغ لا يذكر أبدًا من يتحدث.
الاستخدام الأساسي
المدخلات المدعومة
صيغ الصوت المدعومة هيwav وwave وflac وm4a وaac وmp4 وmp3 وogg وoga وwebm. يُقبل الملف عندما يكون نوع MIME الخاص به أو امتداده ضمن تلك القائمة، ويجب أيضًا أن تجتاز البايتات المرفوعة فحص البايتات السحرية (magic-byte) — إعادة تسمية ملف بامتداد مدعوم لن تُمرّره. راجع صفحة نماذج تحويل الكلام إلى نص لمعرفة دعم النماذج الحالي والأسعار.
صيغ الاستجابة
هاتان هما القيمتان الوحيدتان اللتان يقبلهما
response_format. لا يوجد خيار srt أو vtt أو verbose_json — طلب أحدها يعيد 400. لبناء ترجمات، استخدم timestamps: true مع response_format: json وقم بعرض بيانات التوقيت بنفسك.الطوابع الزمنية
مرّرtimestamps=true للحصول على بيانات التوقيت مع التفريغ. الدعم خاص بكل نموذج، وتختلف درجة التفصيل:
segment بدلًا من ذلك، حيث يكون كل إدخال على شكل { "text": "...", "start": 0.0, "end": 3.2 }. جميع الأزمنة بالثواني.
لا يقوم أي نموذج نسخ في Venice بتمييز المتحدثين (speaker diarization)، لذا لا يوجد حقل
speaker في أي استجابة. التفريغ هو تدفق نصي واحد — لا يمكن نسب الكلام إلى متحدث إلا عندما يُذكر اسم بصوت مسموع.نصائح الإنتاج
- حافظ على وضوح الصوت وتجنّب تداخل المتحدثين عند الإمكان.
- قسّم التسجيلات الطويلة جدًا إلى أجزاء أصغر إذا كان سير عملك يتطلب زمن استجابة أقل أو محاولات إعادة أسهل.
- خزّن مسار الصوت الأصلي، ومعرّف النموذج، وصيغة الاستجابة مع كل تفريغ لأغراض التدقيق.