Skip to main content
يتيح لك استنساخ الصوت إنشاء كلام بصوتٍ توفّره عينة صوتية مرجعية قصيرة. باستخدام tts-chatterbox-hd، ارفع عينة إلى /audio/voices، واحفظ معرّف الصوت vv_... المُعاد، ثم مرّر هذا المعرّف إلى /audio/speech.
معرّفات الصوت مرتبطة بنموذج محدد. يجب استخدام المعرّف الذي أُنشئ باستخدام tts-chatterbox-hd مع tts-chatterbox-hd فقط.

كيف يعمل

  1. الرفع - أرسل ملفًا صوتيًا مرجعيًا نظيفًا إلى POST /audio/voices
  2. الحفظ - خزّن معرّف الصوت id المُعاد
  3. الإنشاء - أرسل المعرّف بوصفه voice في POST /audio/speech

المتطلبات الأساسية

  • مفتاح Venice API
  • عينة مرجعية نظيفة بصيغة MP3 أو WAV أو FLAC أو MP4
  • ما لا يقل عن 5 إلى 10 ثوانٍ من كلامٍ واضح لمتحدثٍ واحد
عيّن مفتاح API الخاص بك:

الخطوة 1: رفع عينة صوت

أنشئ معرّف صوت برفع الملف الصوتي المرجعي بصيغة multipart form data:
عند استخدام curl -F، لا تعيّن Content-Type يدويًا. يضيف curl ترويسة multipart/form-data والحدّ الفاصل المطلوب. الاستجابة (200):
احفظ id لاستخدامه في إنشاء الكلام:

الخطوة 2: إنشاء الكلام

مرّر معرّف الصوت المستنسخ بوصفه voice في طلب الكلام:
يكون جسم الاستجابة صوتًا ثنائيًا بالصيغة الافتراضية للنموذج، وليس JSON. يستخدم tts-chatterbox-hd حاليًا صيغة WAV كإعداد افتراضي.

مثال كامل

يرفع هذا المثال عينةً مرجعية، ويستخرج معرّف الصوت باستخدام jq، ويكتب الصوت المُنشأ إلى chatterbox-clone.wav:

نصائح حول عينة الصوت

استخدم عينةً بمتحدثٍ واحد وضوضاء خلفية قليلة وبدون موسيقى. الكلام الطبيعي يعمل أفضل من الصوت المهموس أو المُغنّى أو المُعالَج بكثافة. قد تساعد العينات الأطول عندما يتميز الصوت بإيقاعٍ أو لكنةٍ أو نبرةٍ مميزة، لكن احرص على إبقاء العينة مُركّزة على المتحدث المستهدف.

انتهاء صلاحية المعرّف

استنساخ Chatterbox HD يعتمد على نهج zero-shot: تخزّن Venice الملف الصوتي المرجعي المرفوع مؤقتًا، ويقرأه النموذج عند توليد الكلام. لا يُنشأ أي قالب صوتي دائم. تنتهي صلاحية معرّفات الصوت تلقائيًا بعد 7 أيام. بعد انتهاء صلاحية المعرّف، ارفع العينة المرجعية مرةً أخرى لإنشاء معرّف vv_... جديد.

اكتشاف دعم الاستنساخ

تتضمن النماذج التي تدعم الاستنساخ كائن voice_cloning ضمن مواصفات النموذج. استعلم عن نماذج TTS للتحقق من الصيغ المدعومة والحد الأدنى لطول العينة ومدة الاحتفاظ:
يُعلن tts-chatterbox-hd عن:

معاملات API

إنشاء صوت

إنشاء الكلام

تكون استجابة الكلام الناجحة صوتًا ثنائيًا، ويحدد Content-Type صيغة الصوت المُعادة. يمكنك حذف response_format لاستخدام الإعداد الافتراضي للنموذج. استعلم عن model_spec.supported_formats وmodel_spec.default_format من GET /models?type=tts قبل تجاوزه؛ طلب صيغة غير مدعومة يُعيد الحالة HTTP 400.

الأخطاء الشائعة