إنشاء مقتطف صوتي من كتاب بالذكاء الاصطناعي

الفصل بصيغة PDF يُسحب إلى لوحة العمل: عقدة نصّ تنسخ بدايته حرفياً، وصوت راوٍ من ElevenLabs يقرأها، ولحن آلي يعزف تحتها، ويبقى الغلاف على الشاشة في مونتاج بنسبة 16:9: الفيديو الجاهز للنشر لإسماع الجمهور الفصل الأول. سير العمل كامل يظهر أمامكم دون حساب.

الفصل الأول من الرواية الأصلية، ملف PDF مسحوب إلى عقدة الوسائطعرض تفاعلي

سير عمل حقيقي بنتائج حقيقية. تنقّل وكبّر بحرية.

استخدام سير العمل هذا

سير العمل الحقيقي: الفصل الأول من رواية بصيغة PDF في عقدة وسائط، وClaude Sonnet 5 ينسخ البداية، وElevenLabs v3 للسرد، وElevenLabs Music للحن، وGPT Image 2.5 Flare للغلاف، وعقدة مونتاج. النصوص المعروضة هي إجابات النماذج، بلا أي تعديل.

باختصار

ما تقدّمه
1 ملف PDF · نص أو ملخص (بريف)
ما ينتجه سير العمل
1 صورة بنسبة 3:4 · 1 مسار صوتي، 60 ثانية إجمالًا · تعليق صوتي واحد
بنية لوحة العمل
8 عقدة مرتبطة بـ 6 وصلة
النماذج الموصولة
Claude Sonnet 5, ElevenLabs v3, ElevenLabs Music, GPT Image 2.5 Flare
تكلفة تشغيل كامل
نحو 97 رصيد، أي ‏1.16 US$
الحساب
يمكن رؤية العرض التجريبي دون حساب؛ أما التوليد فيتطلب حسابًا مجانيًا، بما في ذلك كريدت تجريبي

إسماع الجمهور الفصل الأول هو أفضل دعاية للكتاب. يدخل ملف PDF إلى عقدة وسائط، وتقرأه عقدة نصّ عبر منفذ "صورة أو PDF للتحليل" لتنسخ البداية حرفياً، دون إعادة كتابة أي شيء، حتى نهاية فقرة قبل 1400 حرف: أي بطول قراءة تدوم دقيقة ونصف.

تقرأ عقدة التعليق الصوتي هذا النص الموصول بواسطة ElevenLabs v3، وهو صوت راوٍ يُختار من القائمة. تُلحّن عقدة الموسيقى ستين ثانية من لحن آلي بناءً على وصف موصول، يتكرر في المونتاج بمستوى صوت منخفض. وترسم عقدة الصورة الغلاف مع العنوان بواسطة GPT Image 2.5 Flare، ويحتفظ المونتاج به كاملاً، على خلفية سوداء، طوال مدة السرد.

يقرأ العرض التوضيحي بداية "North of Silence"، رواية أصلية كُتبت لأجل المثال. استبدلوا ملف PDF بفصلكم، والصوت في العقدة، والعنوان في وصف الغلاف. يمكن قراءة فصل كامل عبر عدة عقد تعليق صوتي بسعة 3000 حرف كل واحدة، توضع متتابعة في المونتاج. يكمّل الغلاف والعرض الدعائي هذه السلسلة.

نتائج فعلية من العرض التجريبي

هذه هي ملفات مسار العمل أعلاه، كما أنتجتها النماذج تمامًا، دون أي تعديل. تتم الإشارة إلى نقطة البداية عند وجودها.

النتيجة

سرد بداية الفصل، بصوت ElevenLabs v3 مع الصوت Georgeتم إنشاؤه باستخدام ElevenLabs v3
اللحن الآلي لستين ثانية، ملحّن بواسطة ElevenLabs Music، متكرر تحت الصوتتم إنشاؤه باستخدام ElevenLabs Music
الغلاف مع العنوان، مرسوم بواسطة GPT Image 2.5 Flare، موضوع كاملاً في المونتاجتم إنشاؤه باستخدام GPT Image 2.5 Flare
المقتطف بعد المونتاج: الغلاف على الشاشة، والسرد واللحن، جاهز للنشر

لمن هذا مخصص

المؤلفون والناشرون الراغبون في إسماع الجمهور فصلاً أولاً دون استوديو أو ممثل، أو في تجربة صوت قبل إنشاء كتاب صوتي كامل.

أي ملفات يجب تقديمها

فصل بصيغة PDF نصّي، لا مسحوباً ضوئياً: تنسخ عقدة النصّ النثر كما هو، ويقرأه الصوت جملة بجملة.

طريقة العمل

  1. 1

    اسحبوا الفصل بصيغة PDF

    تستقبله عقدة وسائط. تنسخ عقدة النصّ البداية، وليس ملخصاً: نصّكم بالذات يُقرأ، جملة بجملة، حتى نهاية فقرة.

  2. 2

    اختاروا الصوت واقرؤوا

    تستقبل عقدة التعليق الصوتي النص عبر الكابل. حوالي عشرين صوتاً من ElevenLabs v3، أو صوت مستنسَخ: يستخدم العرض التوضيحي George، راوياً هادئاً. توجيه علامة [pause] أو [whispers] في النص يوجّه الأداء.

  3. 3

    لحّنوا اللحن الآلي ورسموا الغلاف

    تلحّن عقدة الموسيقى ستين ثانية بناءً على الوصف الموصول، آلي بلا كلام. تكتب عقدة الصورة العنوان في الغلاف بنسبة 3:4، مع بيانَي تنويه. يمكن إعادة الاثنين دون لمس السرد.

  4. 4

    قوموا بالمونتاج والنشر

    يضع المونتاج الغلاف كاملاً على خلفية سوداء بنسبة 16:9، والسرد على مقطع صوتي، واللحن المتكرر بمستوى صوت منخفض على المقطع الآخر، مع تلاشٍ في النهاية. يُعرض في المتصفح، دون أي حقوق، ويُصدَّر بصيغة mp4.

الأنماط وحالات الاستخدام

لوحة العمل نفسها، مضبوطة لاحتياجات مختلفة: كل نمط يتطلّب تغيير سطرين أو ثلاثة في الـ prompt.

مقتطف الفصل الأول

هذا هو العرض التوضيحي: البداية منسوخة حرفياً، صوت راوٍ، لحن آلي، والغلاف على الشاشة. استبدلوا ملف PDF والعنوان، واحتفظوا بالباقي، ويُعاد إنشاء الفيديو من أجل كتابكم.

الفصل الكامل على عدة مقاطع

عقدة نصّ لكل شريحة من 3000 حرف، وعقدة تعليق صوتي لكل واحدة، جميعها في المونتاج نفسه: يُقرأ فصل من خمس عشرة دقيقة عبر حوالي عشر عقد، مع اللحن المتكرر تحته.

المقتطف بصوت المؤلف

استنسخوا صوتكم في عقدة تعليق صوتي من دقيقة واحدة من التسجيل، ثم اختاروه للسرد: يُقرأ الفصل الأول بصوتكم، دون أي استوديو.

نسخة البودكاست، بلا صورة

أزيلوا عقدة الصورة والمونتاج: يُصدَّر السرد واللحن كملف mp3 مباشرة من العقد، لمنصة بودكاست أو لصفحة الكتاب.

المقتطف بعدة لغات

اطلبوا من عقدة النصّ ترجمة الشريحة، وضبطوا لغة عقدة التعليق الصوتي، واحتفظوا بالغلاف: نفس الفيديو موجود بالإنجليزية والإسبانية والألمانية، بنفس الصوت.

أخطاء شائعة

ملخص بدلاً من النص

التعليمة تطلب نسخ النثر بدقة. إذا لخّص النموذج، فذلك يعني أنه قرأ ملف PDF ممسوحاً بلا نص: حوّلوا المخطوطة إلى PDF نصّي، لا إلى صور صفحات.

لحن يطمس الصوت

الموسيقى مضبوطة على 0.25 في المونتاج لتبقى أدنى من السرد. لحن بملودية بارزة يجذب الأذن: اطلبوا في الوصف خلفية بلا لحن مميّز، ودون ضربات إيقاعية.

الغلاف مقصوص

المونتاج مضبوط لعرض الصورة كاملة على خلفية سوداء. في نمط التغطية، يفقد غلاف بنسبة 3:4 عنوانه من الأعلى والأسفل: حافظوا على وضع الاحتواء للمقتطف.

النماذج المقترحة

أسئلة شائعة

هل يمكن قراءة فصل كامل؟

نعم، على شرائح: تقرأ عقدة تعليق صوتي واحدة حتى 3000 حرف. اطلبوا من عقدة النصّ الشريحة التالية، وكرّروا عقدة التعليق الصوتي، وضعوا الشرائح متتابعة في المونتاج. يتبع السعر عدد الحروف المقروءة.

كم يكلّف المقتطف؟

حوالي ستين رصيداً للعرض التوضيحي: سرد 1400 حرف (حوالي اثني عشر رصيداً)، واللحن لستين ثانية (حوالي خمسين)، والغلاف (اثنان)، وقراءة ملف PDF (اثنان إلى ثلاثة). يظهر السعر على كل عقدة قبل الضغط.

هل يحترم الصوت علامات الترقيم؟

نعم: يميّز ElevenLabs v3 الفواصل والنقاط والفقرات المفصولة بسطر فارغ. لوقفة أطول، علامة [pause]؛ ولهمس، [whispers]. لا تُقرأ العلامات بصوت مسموع.

ما الطول المناسب للمقتطف؟

من دقيقة ونصف إلى دقيقتين، أي 1400 إلى 1800 حرف: كافٍ لتقديم صوت ومشهد، وقصير كفاية للاستماع إليه بالكامل على الهاتف.

هل يمكن تغيير الصوت لاحقاً؟

نعم، من عقدة التعليق الصوتي، دون إعادة توليد النص: اختاروا نغمة أخرى وأعيدوا القراءة، ويتحدّث المونتاج تلقائياً.

هل يلزم غلاف؟

لا، أي مقطع صورة يكفي للمونتاج: صورة للمؤلف، أو رسم للمكان. الغلاف مع العنوان يبقى الأكثر قابلية للمشاركة.

أين يُنشر الفيديو؟

على صفحة الكتاب، على الشبكات الاجتماعية، أو كحلقة صفرية لبودكاست: يخرج ملف mp4 بنسبة 16:9، بدقة 1080p، مع الصوت مُمزوجاً. مونتاج بنسبة 9:16 يعطي النسخة العمودية.

إنشاء مقتطف صوتي من كتاب بالذكاء الاصطناعي

استخدام سير العمل هذا

حساب مجاني، دون بطاقة بنكية. يُفتح سير العمل معبّأً مسبقًا في لوحة عملك.