مقتطف الفصل الأول
هذا هو العرض التوضيحي: البداية منسوخة حرفياً، صوت راوٍ، لحن آلي، والغلاف على الشاشة. استبدلوا ملف PDF والعنوان، واحتفظوا بالباقي، ويُعاد إنشاء الفيديو من أجل كتابكم.
الفصل بصيغة PDF يُسحب إلى لوحة العمل: عقدة نصّ تنسخ بدايته حرفياً، وصوت راوٍ من ElevenLabs يقرأها، ولحن آلي يعزف تحتها، ويبقى الغلاف على الشاشة في مونتاج بنسبة 16:9: الفيديو الجاهز للنشر لإسماع الجمهور الفصل الأول. سير العمل كامل يظهر أمامكم دون حساب.
سير العمل الحقيقي: الفصل الأول من رواية بصيغة PDF في عقدة وسائط، وClaude Sonnet 5 ينسخ البداية، وElevenLabs v3 للسرد، وElevenLabs Music للحن، وGPT Image 2.5 Flare للغلاف، وعقدة مونتاج. النصوص المعروضة هي إجابات النماذج، بلا أي تعديل.
باختصار
إسماع الجمهور الفصل الأول هو أفضل دعاية للكتاب. يدخل ملف PDF إلى عقدة وسائط، وتقرأه عقدة نصّ عبر منفذ "صورة أو PDF للتحليل" لتنسخ البداية حرفياً، دون إعادة كتابة أي شيء، حتى نهاية فقرة قبل 1400 حرف: أي بطول قراءة تدوم دقيقة ونصف.
تقرأ عقدة التعليق الصوتي هذا النص الموصول بواسطة ElevenLabs v3، وهو صوت راوٍ يُختار من القائمة. تُلحّن عقدة الموسيقى ستين ثانية من لحن آلي بناءً على وصف موصول، يتكرر في المونتاج بمستوى صوت منخفض. وترسم عقدة الصورة الغلاف مع العنوان بواسطة GPT Image 2.5 Flare، ويحتفظ المونتاج به كاملاً، على خلفية سوداء، طوال مدة السرد.
يقرأ العرض التوضيحي بداية "North of Silence"، رواية أصلية كُتبت لأجل المثال. استبدلوا ملف PDF بفصلكم، والصوت في العقدة، والعنوان في وصف الغلاف. يمكن قراءة فصل كامل عبر عدة عقد تعليق صوتي بسعة 3000 حرف كل واحدة، توضع متتابعة في المونتاج. يكمّل الغلاف والعرض الدعائي هذه السلسلة.
هذه هي ملفات مسار العمل أعلاه، كما أنتجتها النماذج تمامًا، دون أي تعديل. تتم الإشارة إلى نقطة البداية عند وجودها.
النتيجة
المؤلفون والناشرون الراغبون في إسماع الجمهور فصلاً أولاً دون استوديو أو ممثل، أو في تجربة صوت قبل إنشاء كتاب صوتي كامل.
فصل بصيغة PDF نصّي، لا مسحوباً ضوئياً: تنسخ عقدة النصّ النثر كما هو، ويقرأه الصوت جملة بجملة.
اسحبوا الفصل بصيغة PDF
تستقبله عقدة وسائط. تنسخ عقدة النصّ البداية، وليس ملخصاً: نصّكم بالذات يُقرأ، جملة بجملة، حتى نهاية فقرة.
اختاروا الصوت واقرؤوا
تستقبل عقدة التعليق الصوتي النص عبر الكابل. حوالي عشرين صوتاً من ElevenLabs v3، أو صوت مستنسَخ: يستخدم العرض التوضيحي George، راوياً هادئاً. توجيه علامة [pause] أو [whispers] في النص يوجّه الأداء.
لحّنوا اللحن الآلي ورسموا الغلاف
تلحّن عقدة الموسيقى ستين ثانية بناءً على الوصف الموصول، آلي بلا كلام. تكتب عقدة الصورة العنوان في الغلاف بنسبة 3:4، مع بيانَي تنويه. يمكن إعادة الاثنين دون لمس السرد.
قوموا بالمونتاج والنشر
يضع المونتاج الغلاف كاملاً على خلفية سوداء بنسبة 16:9، والسرد على مقطع صوتي، واللحن المتكرر بمستوى صوت منخفض على المقطع الآخر، مع تلاشٍ في النهاية. يُعرض في المتصفح، دون أي حقوق، ويُصدَّر بصيغة mp4.
لوحة العمل نفسها، مضبوطة لاحتياجات مختلفة: كل نمط يتطلّب تغيير سطرين أو ثلاثة في الـ prompt.
هذا هو العرض التوضيحي: البداية منسوخة حرفياً، صوت راوٍ، لحن آلي، والغلاف على الشاشة. استبدلوا ملف PDF والعنوان، واحتفظوا بالباقي، ويُعاد إنشاء الفيديو من أجل كتابكم.
عقدة نصّ لكل شريحة من 3000 حرف، وعقدة تعليق صوتي لكل واحدة، جميعها في المونتاج نفسه: يُقرأ فصل من خمس عشرة دقيقة عبر حوالي عشر عقد، مع اللحن المتكرر تحته.
استنسخوا صوتكم في عقدة تعليق صوتي من دقيقة واحدة من التسجيل، ثم اختاروه للسرد: يُقرأ الفصل الأول بصوتكم، دون أي استوديو.
أزيلوا عقدة الصورة والمونتاج: يُصدَّر السرد واللحن كملف mp3 مباشرة من العقد، لمنصة بودكاست أو لصفحة الكتاب.
اطلبوا من عقدة النصّ ترجمة الشريحة، وضبطوا لغة عقدة التعليق الصوتي، واحتفظوا بالغلاف: نفس الفيديو موجود بالإنجليزية والإسبانية والألمانية، بنفس الصوت.
التعليمة تطلب نسخ النثر بدقة. إذا لخّص النموذج، فذلك يعني أنه قرأ ملف PDF ممسوحاً بلا نص: حوّلوا المخطوطة إلى PDF نصّي، لا إلى صور صفحات.
الموسيقى مضبوطة على 0.25 في المونتاج لتبقى أدنى من السرد. لحن بملودية بارزة يجذب الأذن: اطلبوا في الوصف خلفية بلا لحن مميّز، ودون ضربات إيقاعية.
المونتاج مضبوط لعرض الصورة كاملة على خلفية سوداء. في نمط التغطية، يفقد غلاف بنسبة 3:4 عنوانه من الأعلى والأسفل: حافظوا على وضع الاحتواء للمقتطف.
نعم، على شرائح: تقرأ عقدة تعليق صوتي واحدة حتى 3000 حرف. اطلبوا من عقدة النصّ الشريحة التالية، وكرّروا عقدة التعليق الصوتي، وضعوا الشرائح متتابعة في المونتاج. يتبع السعر عدد الحروف المقروءة.
حوالي ستين رصيداً للعرض التوضيحي: سرد 1400 حرف (حوالي اثني عشر رصيداً)، واللحن لستين ثانية (حوالي خمسين)، والغلاف (اثنان)، وقراءة ملف PDF (اثنان إلى ثلاثة). يظهر السعر على كل عقدة قبل الضغط.
نعم: يميّز ElevenLabs v3 الفواصل والنقاط والفقرات المفصولة بسطر فارغ. لوقفة أطول، علامة [pause]؛ ولهمس، [whispers]. لا تُقرأ العلامات بصوت مسموع.
من دقيقة ونصف إلى دقيقتين، أي 1400 إلى 1800 حرف: كافٍ لتقديم صوت ومشهد، وقصير كفاية للاستماع إليه بالكامل على الهاتف.
نعم، من عقدة التعليق الصوتي، دون إعادة توليد النص: اختاروا نغمة أخرى وأعيدوا القراءة، ويتحدّث المونتاج تلقائياً.
لا، أي مقطع صورة يكفي للمونتاج: صورة للمؤلف، أو رسم للمكان. الغلاف مع العنوان يبقى الأكثر قابلية للمشاركة.
على صفحة الكتاب، على الشبكات الاجتماعية، أو كحلقة صفرية لبودكاست: يخرج ملف mp4 بنسبة 16:9، بدقة 1080p، مع الصوت مُمزوجاً. مونتاج بنسبة 9:16 يعطي النسخة العمودية.
إنشاء مقتطف صوتي من كتاب بالذكاء الاصطناعي
استخدام سير العمل هذاحساب مجاني، دون بطاقة بنكية. يُفتح سير العمل معبّأً مسبقًا في لوحة عملك.