ساخت یک موسیقی اختصاصی برای ویدیو، پادکست یا شبکه‌های اجتماعی معمولاً به نرم‌افزارهای تدوین صدا و تجربه آهنگ‌سازی نیاز دارد؛ اما حالا Gemini با مدل Lyria 3.5 می‌تواند تنها از روی یک توضیح متنی یا تصویر، قطعه موسیقی تولید کند.

این مدل می‌تواند قطعه‌هایی با ساختار کامل‌تر و بخش‌های مختلف آهنگ، آواز و تنظیم‌های پیچیده‌تر تولید کند و به کاربر اجازه می‌دهد سبک، حال‌وهوا و نوع خروجی را مشخص کند.

در این مقاله روش ساخت آهنگ هوش مصنوعی با Gemini، ساخت آهنگ از روی تصویر و روش‌هایی برای بهبود موزیک‌های ساخته‌شده با هوش مصنوعی جمنای را بررسی می‌کنیم.

Lyria 3.5 چیست و چه کاری انجام می‌دهد؟

Lyria 3.5 مدل تولید موسیقی گوگل دیپ‌مایند است که برای ساخت قطعه‌های موسیقی از دستورهای متنی و تصویری طراحی شده است. این مدل می‌تواند آهنگ‌هایی با ساختار کامل‌تر، شامل بخش‌هایی مانند ورس، کُر، تنظیم سازها و آواز تولید کند.

در نسخه جدید، گوگل روی طبیعی‌تر شدن آوازها، کیفیت بهتر ترانه‌ها و کنترل بیشتر کاربر روی نتیجه نهایی تمرکز کرده است. Lyria 3.5 می‌تواند قطعه‌هایی تا حدود سه دقیقه تولید کند و خروجی را به‌صورت فایل صوتی MP3 ارائه دهد.

این مدل فقط برای ساخت آهنگ از متن نیست. کاربر می‌تواند یک تصویر را هم وارد Gemini کند تا هوش مصنوعی بر اساس فضای آن موسیقی بسازد؛ برای مثال ساخت یک قطعه آرام از روی تصویر طبیعت یا یک موسیقی سینمایی از روی تصویر یک صحنه شهری.

مهم‌ترین قابلیت‌های Lyria 3.5:

  • ساخت موسیقی با آواز یا به‌صورت بی‌کلام
  • تولید آهنگ از روی متن یا تصویر
  • انتخاب سبک، ژانر و فضای موسیقی
  • کنترل مدت و حال‌وهوای قطعه
  • ساخت موسیقی مناسب برای ویدیو، ریلز، پادکست و پروژه‌های شخصی

رابط کاربری ساخت موزیک در هوش مصنوعی جمنای

ساخت موسیقی با Gemini به دانش تخصصی نیاز ندارد و بیشتر شبیه نوشتن یک درخواست معمولی برای هوش مصنوعی است. برای دسترسی به این بخش:

  • نسخه وب یا اپلیکیشن Gemini را باز کنید و یک گفت‌وگوی جدید ایجاد کنید.
  • از بخش ابزارها یا منوی مربوط به قابلیت‌ها، گزینه Create music را انتخاب کنید.

بعد از انتخاب گزینه ساخت موسیقی، Gemini می‌تواند با توضیح و فایل‌های اختصاصی شما آهنگ بسازد یا از قالب‌های آماده (template) استفاده کند.

اجزای کادر پرامپت ساخت موسیقی

در این کادر، می‌توانید جزئیات آهنگ را مشخص کنید؛ از سبک و حس موسیقی گرفته تا نوع خواننده، سازها، موضوع ترانه و ساختار آهنگ. یکی از تفاوت‌های مهم Lyria 3.5 با نسل‌های قبلی نیز همین است که کاربر فقط به نوشتن پرامپت محدود نیست. جمنای چند کنترل مستقیم برای شخصی‌سازی آهنگ ارائه می‌کند. در ادامه این تنظیمات را مرور می‌کنیم:

تعیین طول آهنگ (Length)

جمنای امکان انتخاب مدت قطعه را هم فراهم می‌کند. این گزینه برای کاربردهای مختلف مهم است؛ چون موسیقی مناسب یک ریلز کوتاه با قطعه‌ای که برای پس‌زمینه یک ویدیو یا پادکست ساخته می‌شود، زمان متفاوتی نیاز دارد.

انتخاب آهنگ باکلام یا بی‌کلام (Vocals)

در بخش Vocals می‌توانید بین ساخت موسیقی بدون آواز (Instrumental) و ساخت آهنگ با خواننده (Vocal) انتخاب کنید یا آن را روی حالت Custom قرار دهید تا مدل براساس پرامپت شما عمل کند. برای مثال:

Create a cinematic soundtrack for a technology video with deep synths and no vocals.

انتخاب سبک موسیقی (Genre)

در بخش Genre می‌توانید سبک موردنظر را انتخاب کنید یا آن را در پرامپت توضیح دهید. برای مثال: پاپ، راک، هیپ-هاپ و... همچنین می‌توانید در پرامپتتان ترکیبی از سبک‌ها را درخواست کنید؛ مثلاً موسیقی الکترونیک سینمایی با عناصر راک. گوگل در راهنمای پرامپت Lyria هم پیشنهاد می‌کند ژانر، دوره زمانی یا ترکیب سبک‌ها را در پرامپتتان مشخص کنید.

قالب‌های آماده جمنای برای ساخت موزیک

در بالای بخش ساخت موسیقی می‌توانید قالب‌هایی که خود Gemini پیشنهاد می‌دهد را ببینید و استفاده کنید. این قالب‌ها برای موقعیت‌هایی مانند موسیقی پس‌زمینه، رینگتون، آهنگ مناسب مناسبت‌ها و قطعه‌های شخصی طراحی شده‌اند.

یا قالب Memorise something برای ساخت موسیقی بر اساس یک موضوع یا چیزی که باید به خاطر بسپارید طراحی شده است. مثلا می‌توانید مفاهیم درسی خود را با این قالب به‌شکل یک موزیک به یاد‌ماندنی تبدیل کنید.

در انتهای مقاله، تجربه زومیت از همین قالب و همچنین ساخت آهنگ هوش مصنوعی فارسی با ترانه اختصاصی را بررسی می‌کنیم.

ساخت آهنگ با قالب‌های آماده Gemini

ساده‌ترین راه برای شروع ساخت آهنگ هوش مصنوعی، انتخاب یکی از قالب‌های آماده جمنای است. جمنای بر اساس سناریویی که انتخاب می‌کنید، تنظیمات اولیه آهنگ را مشخص می‌کند و سپس می‌توانید جزئیات بیشتری به آن اضافه کنید.

برای مثال، قالب رینگتون را انتخاب کنید و چیزی مثل این بنویسید: «یک رینگتون با حال و هوای جادویی». می‌توانید جزئیات بیشتری هم اضافه کنید.

در بررسی من با قالب Memorise something پس از انتخاب این قالب و وارد کردن یک یادآوری فارسی، جمنای ابتدا موضوع درخواست را تشخیص داد و آن را به یک رویداد در Google Calendar تبدیل کرد. سپس بر اساس همان موضوع، یک قطعه موسیقی ساخت.

این تجربه نشان می‌دهد قابلیت ساخت موسیقی جمنای فقط به تولید یک فایل صوتی محدود نیست و در بعضی سناریوها می‌تواند با دیگر سرویس‌های گوگل ترکیب شود.

ساخت آهنگ در Gemini با پرامپت

اگر قالب آماده نتیجه‌ای که می‌خواهید را ارائه نمی‌دهد، می‌توانید مستقیماً ایده خود را برای جمنای توضیح دهید.

برای گرفتن خروجی بهتر، بهتر است پرامپت موسیقی را مانند یک توضیح کوتاه برای یک آهنگ‌ساز بنویسید، نه یک دستور ساده. مثلاً به جای این که فقط بگویید یک آهنگ بساز، بنویسید:

یک موسیقی سینمایی الکترونیک برای ویدیوی بررسی گوشی بساز، با سینتی‌سایزرهای مدرن، ریتم آرام، فضای کمی مرموز و بدون آواز.

می‌توانید تنظیمات ژانر و آواز و طول موسیقی را نیز طبق خواسته‌تان تغییر دهید یا اجازه دهید جمنای خودش براساس پرامپت شما موزیک را آماده کند. یک پرامپت موسیقی خوب معمولاً چند بخش دارد:

موضوع و کاربرد آهنگ

اول مشخص کنید موسیقی برای چه چیزی ساخته می‌شود. مثلاً:

  • موسیقی پس‌زمینه ویدیوی یوتیوب
  • ریلز فناوری
  • پادکست
  • تیزر معرفی محصول
  • رینگتون
Create a cinematic soundtrack for a smartphone review video
یک موسیقی سینمایی برای ویدیوی بررسی گوشی بساز

سبک و ژانر

برای انتخاب سبک موسیقی باید با آن ها آشنا باشید، اگر با ژانرهای موسیقی آشنا نیستید می‌توانید کمی تحقیق کنید یا حداقل ژانر موزیک‌های موردعلاقه خود را جستجو کنید.

Modern electronic music with cinematic elements. موسیقی مدرن الکترونیک با المان‌های سینمایی
Emotional Persian pop song with acoustic guitar. آهنگ پاپ فارسی احساسی با گیتار آکوستیک

سازها و فضای صوتی

مشخص کنید چه صداهایی در آهنگ شنیده شوند.

With piano, soft drums and warm strings. با پیانو، درام‌های ملایم و سازهای زهی با رنگ صوتی گرم و دلنشین

یا

Deep synths, electronic drums and atmospheric sounds. با سینتی‌سایزرهای عمیق، درام‌های الکترونیک و صداهای اتمسفریک/فضاساز

حس و نحوه اجرا

فقط گفتن سبک کافی نیست. حس موردنظر را هم توضیح دهید. مثلاً:

  • آرام
  • حماسی
  • تاریک
  • نوستالژیک
  • هیجان‌انگیز
  • احساسی
A powerful and emotional build-up with a dramatic chorus. اوج‌گیری قدرتمند و احساسی با بخش اوج دراماتیک

مشخص کردن نوع خروجی

اگر موسیقی پس‌زمینه می‌خواهید، آن را مشخص کنید.

No vocals, instrumental background music. بدون خواننده، موسیقی پس‌زمینه بی‌کلام

اگر آهنگ باکلام می‌خواهید، باید درباره جنس اجرا و متن توضیح دهید.

ساخت موسیقی با Gemini از روی عکس یا فایل متنی

یکی از قابلیت‌های جالب جمنای این است که برای ساخت موسیقی فقط به متن محدود نیست. می‌توانید تصویر را به آن بدهید و از مدل بخواهید موسیقی متناسب با فضای تصویر بسازد. همچنین جمنای می‌تواند فایل‌های متنی را برای درک موضوع یا استخراج ایده بررسی کند و سپس بر اساس آن، درخواست ساخت موسیقی را اجرا کند.

در این حالت، به‌جای اینکه همه جزئیات را خودتان توضیح دهید، جمنای تلاش می‌کند از فضای کلی ورودی الهام بگیرد؛ مثلاً حال‌وهوای یک تصویر، موضوع یک فایل یا محتوای یک پروژه را در نظر بگیرد.

ساخت آهنگ با Gemini از روی تصویر

برای ساخت موسیقی از روی عکس، کافی است تصویر موردنظر را در جمنای آپلود کنید و توضیح دهید چه نوع موسیقی‌ای می‌خواهید. مثلاً برای تصویر یک خیابان بارانی شبانه:

یک موسیقی متن سینمایی و تاریک با الهام از این تصویر شهر بارانی بساز؛ با پیانو، صداهای محیطی و فضایی مرموز

یا برای یک تصویر از طبیعت:

با الهام از این تصویر منظره، یک موسیقی آکوستیک آرام با گیتاری گرم و ملودی‌های آرامش‌بخش بساز

در این حالت بهتر است فقط به خود تصویر اکتفا نکنید و احساسی که می‌خواهید منتقل شود را هم توضیح دهید. یک عکس از کوهستان می‌تواند موسیقی آرام، حماسی یا حتی مرموز داشته باشد؛ انتخاب نهایی به توضیح شما بستگی دارد.

ساخت آهنگ با Gemini از فایل‌های متنی

جمنای می‌تواند از فایل‌های ورودی هم به‌عنوان نقطه شروع استفاده کند. برای مثال می‌توانید یک فایل متنی شامل توضیحات پروژه، یک متن ترانه یا اطلاعات مربوط به یک مناسبت را وارد کنید و از مدل بخواهید بر اساس آن موسیقی بسازد. این قابلیت برای تولیدکنندگان محتوا کاربردی است؛ مثلاً:

  • ساخت موسیقی متناسب با سناریوی یک ویدیو
  • تبدیل ایده یک داستان کوتاه به قطعه موسیقی
  • ساخت آهنگ برای یک مراسم یا مناسبت خاص
  • ایجاد موسیقی پس‌زمینه برای یک پروژه

برای آزمایش من فایل ورد یکی از سناریو‌های آموزش هوش مصنوعی را برای جمنای فرستادم و خواستم که یک موسیقی متنی ایجاد کند. نتیجه نسبتا خوب بود. در حالت دوم نیز خواستم متن را به ترانه تبدیل کند، نتیجه جالب شد اما تلفظ‌ها ایراد جدی داشت.

ورودی تصویر یا فایل به این معنی نیست که Gemini دقیقاً همه جزئیات را به موسیقی تبدیل می‌کند. مدل بیشتر از آن‌ها برای درک موضوع، فضا و حس کلی استفاده می‌کند. برای مثال، اگر تصویری از یک شهر شبانه بدهید، انتظار نداشته باشید صدای خیابان یا جزئیات دقیق تصویر را بازسازی کند؛ بلکه احتمالاً یک موسیقی با حال‌وهوای شهری، تاریک یا سینمایی تولید می‌کند.

چگونه در Gemini آهنگ با ترانه اختصاصی بسازیم؟

برای ساخت آهنگی که متن آن را خودتان نوشته‌اید، بهتر است متن ترانه را از توضیحات موسیقی جدا کنید. به جای اینکه همه چیز را در یک پاراگراف بنویسید، ساختار مشخصی ایجاد کنید.

نکته‌ای که در تجربه شخصی من هم دیده شد این است که بهتر است توضیحات اجرا را انگلیسی و جدا از متن ترانه بنویسیم و خود متن ترانه را جدا کنیم. این کار احتمال دارد باعث شود مدل کمتر دستورهای اجرایی را با بخشی از شعر قاطی کند.

Create a Persian emotional rock song. Music style: Modern Persian rock with electric guitar, powerful drums and cinematic atmosphere. Vocal style: A deep male vocal. Start the first verse with a tired and emotional voice. Make the chorus powerful, energetic and full of emotion. Song structure: Verse 1: soft and melancholic. Chorus: strong vocal performance with louder instruments. Outro: gradually fade out. Lyrics: [Verse 1] اینجا متن ترانه شما [Chorus] اینجا بخش اوج ترانه شما [Outro] اینجا بخش بخش پایانی آهنگ

استفاده از برچسب‌هایی مانند Verse، Chorus و Outro کمک می‌کند مدل ساختار کلی آهنگ را بهتر درک کند.

با شکل نوشتاری بالا، مدل اول می‌فهمد قرار است چه نوع آهنگی بسازد و بعد متن ترانه را داخل همان چارچوب اجرا می‌کند.

برای فارسی بهتر است توضیحات را با متن شعر قاطی نکنیم. مثلاً ننویسم:

[Chorus - با صدای قدرتمند بخوان] زدم بیرون از اون جعبه...

چون در این حالت ممکن است مدل بخشی از دستور «با صدای قدرتمند بخوان» را هم به‌عنوان بخشی از اجرای ترانه برداشت کند.

به‌جای این می‌توانیم بنویسیم:

Chorus style: Powerful and emotional vocal performance. Lyrics: زدم بیرون از اون جعبه...

برای زبان‌هایی مانند فارسی، بهتر است متن ترانه را با دقت بیشتری آماده کنید. اعراب‌گذاری ممکن است در بعضی واژه‌ها کمک کند، اما تضمینی برای تلفظ کاملاً درست نیست و ممکن است مجبور شوید بارها خروجی بگیرید.

نتیجه تست زومیت از ساخت آهنگ فارسی با جمنای

برای بررسی عملکرد واقعی لیریا ۳٫۵، چند سناریوی مختلف را آزمایش کردم؛ نه فقط ساخت یک آهنگ ساده، بلکه تجربه‌هایی که یک کاربر واقعی ممکن است سراغ آن‌ها برود.

در آزمایش اول، از قالب آماده Memorise something استفاده کردم. درخواست من یک جمله فارسی با اعراب‌گذاری بود: «فردا ساعت ۱۲ باید سالن طاها باشم، ورودی دوم از سمت آبنما در تالار شمس.»

جمنای توانست مفهوم کلی درخواست را متوجه شود و ابتدا یک رویداد در Google Calendar ایجاد کرد. سپس بر اساس همان موضوع، موسیقی ساخت.

اما در بخش اجرای آواز فارسی، نتیجه چندان رضایت‌بخش نبود. ازآنجا که بخش عمده‌ی ترانه را مدل خودش ساخته بود و فقط از دستور من برای نوشتن ترانه ایده گرفته بود، حتی با اینکه متن اعراب‌گذاری شده بود، خوانش بیشتر واژه‌ها طبیعی نبود و مدل نتوانست تلفظ فارسی را مانند یک خواننده واقعی اجرا کند. این تجربه در حالت انگلیسی دیده نشد.

در آزمایش دوم، تلاش کردم ببینیم آیا جمنای می‌تواند یک آهنگ موجود را از نظر سبک و اجرا حفظ کند و فقط ترانه را تغییر دهد. از مدل خواستیم با همان ژانر و همان صدای خواننده قطعه قبلی، آهنگ جدیدی با ترانه اختصاصی ما بسازد.

برای افزایش دقت:

  • متن فارسی را اعراب‌گذاری کردم.
  • نسخه فینگلیش تلفظ‌ها را هم اضافه کردم.
  • بخش‌های مختلف آهنگ را با Verse، Chorus و Outro مشخص کردیم.
  • درباره نحوه اجرای هر بخش توضیح دادم.

نتیجه این بار بهتر بود. جمنای توانست فضای کلی آهنگ، ژانر و جنس صدای خواننده را تا حد زیادی حفظ کند و ترانه جدید را در همان قالب اجرا کند. بااین‌حال، مشکل تلفظ فارسی کاملاً برطرف نشد. در چند واژه، مدل همچنان خوانش متفاوتی از متن داشت و به نظر می‌رسید بیشتر به الگوی داخلی خود برای تولید آواز تکیه می‌کند تا آوانویسی فینگلیش واردشده.

نکته جالب در این آزمایش این بود که متوجه شدم که بهتر است توضیحات را با متن شعر قاطی نکنیم مثلا ننویسم:

[Intro - فضای آرام و وهم‌آلود زیر آب](صدای محو و آروم سینتی‌سایزر و گیتار)

در این حالت مدل گاها ممکن است متن نوشته‌شده را به‌عنوان بخشی از ترانه بخواند.

بخش دیگری از تجربه‌ی من نشان داد که اعراب‌گذاری کافی نیست؛ پس در کنار افزودن سکون به کلمات، آن‌ها را به ساده‌ترین شکل نوشتم، به همان شکلی که تلفظ می‌شوند. مثلاً به‌جای عالم رویا نوشتم آلَمِ رُیا یا به جای یِه عُمْرْی نوشتم یِ عُمْرْی. حتی می‌توانستم نوشته‌ها را از این هم ساده‌تر بکنم؛ اما نتیجه تست آخر نسبتاً رضایت‌بخش بود و ساده‌سازی را ادامه ندادم.

پرامپت نهایی من:

Create a Persian emotional rock song with the same female vocal style as the previous track. Music Style: Modern Persian rock with cinematic elements. Use electric guitar, powerful drums, emotional strings and a dramatic build-up. The song should start dark and melancholic, then gradually become powerful, hopeful and liberating. Vocal Style: Female vocal with the same tone, texture and character as the previous song. Start the first verse with a tired, vulnerable and emotional performance. In the chorus, make the vocal stronger, confident and full of energy. Clear Persian pronunciation with natural emotional expression. Song Structure: [Verse 1] Soft and melancholic. The singer feels trapped, exhausted and lost. [Chorus] Big emotional climax. Powerful female vocal with electric guitar and strong drums. The feeling should be freedom, breaking limits and discovering a new self. [Outro] Slowly reduce the instruments and fade out with an emotional ending. Lyrics: [Verse 1] تَهِ این دَریایِ تاریکْ، یِه عُمْرْی تو خاب بودَم می‌خاستَم بِپَرَم، وَلی گِرِفتارِ آب بودَم هَمَش فِکْرْ می‌کَردَمْ، حَدِ مَن هَمین جاس نِمی‌دونِستَم بیرونْ، یِ آلَمِ رُیاس [Chorus] ْزَدَم بیرون اَز اون جَعْبِهْ، پا گُذاشتَمْ رو زَمین! ْدیدَم میتونَم راه بِرَمْ، دُنیایِ تازَمُ و بِبین! ْقَفَسِ ذِهنَمُ اون‌روزْ، شِکوندَمُ و رَها شُدَم ْتویِ این وُسعَتِ خُشکیْ، تازه مَن پِیدا شُدَم! [Outro] ْتازه مَن، پِیدا شُدَم...

خروجی پرامپت نهایی:

آیا ساخت آهنگ با هوش مصنوعی Gemini ارزش امتحان کردن دارد؟

Gemini با مدل Lyria 3.5 ساخت موسیقی را برای کسانی که تجربه آهنگ‌سازی ندارند ساده‌تر کرده است. کاربر می‌تواند از قالب‌های آماده شروع کند، سبک و نوع اجرای آهنگ را تغییر دهد یا با نوشتن یک پرامپت دقیق، قطعه‌ای متناسب با نیاز خود بسازد. Lyria 3.5 از متن و تصویر برای تولید موسیقی استفاده می‌کند و می‌تواند آهنگ‌هایی با ساختارهایی مانند ورس و کُر تولید کند.

Gemini بیشتر یک ابزار خلاقانه برای ساخت نمونه اولیه، موسیقی پس‌زمینه، ایده‌پردازی و تولید محتوای سریع است. اگر تا امروز ساخت آهنگ با هوش مصنوعی رایگان را امتحان نکرده‌اید، جمنای یکی از ساده‌ترین راه‌ها برای شروع است. یک ایده، تصویر یا حتی یک موضوع ساده را وارد کنید و ببینید Lyria 3.5 چه قطعه‌ای برایتان می‌سازد.

تجربه شما از ساخت آهنگ با هوش مصنوعی چیست؟ در بخش دیدگاه‌ها برای ما بنویسید.