ساخت یک موسیقی اختصاصی برای ویدیو، پادکست یا شبکههای اجتماعی معمولاً به نرمافزارهای تدوین صدا و تجربه آهنگسازی نیاز دارد؛ اما حالا Gemini با مدل Lyria 3.5 میتواند تنها از روی یک توضیح متنی یا تصویر، قطعه موسیقی تولید کند.
این مدل میتواند قطعههایی با ساختار کاملتر و بخشهای مختلف آهنگ، آواز و تنظیمهای پیچیدهتر تولید کند و به کاربر اجازه میدهد سبک، حالوهوا و نوع خروجی را مشخص کند.
در این مقاله روش ساخت آهنگ هوش مصنوعی با Gemini، ساخت آهنگ از روی تصویر و روشهایی برای بهبود موزیکهای ساختهشده با هوش مصنوعی جمنای را بررسی میکنیم.
Lyria 3.5 چیست و چه کاری انجام میدهد؟
Lyria 3.5 مدل تولید موسیقی گوگل دیپمایند است که برای ساخت قطعههای موسیقی از دستورهای متنی و تصویری طراحی شده است. این مدل میتواند آهنگهایی با ساختار کاملتر، شامل بخشهایی مانند ورس، کُر، تنظیم سازها و آواز تولید کند.
در نسخه جدید، گوگل روی طبیعیتر شدن آوازها، کیفیت بهتر ترانهها و کنترل بیشتر کاربر روی نتیجه نهایی تمرکز کرده است. Lyria 3.5 میتواند قطعههایی تا حدود سه دقیقه تولید کند و خروجی را بهصورت فایل صوتی MP3 ارائه دهد.
این مدل فقط برای ساخت آهنگ از متن نیست. کاربر میتواند یک تصویر را هم وارد Gemini کند تا هوش مصنوعی بر اساس فضای آن موسیقی بسازد؛ برای مثال ساخت یک قطعه آرام از روی تصویر طبیعت یا یک موسیقی سینمایی از روی تصویر یک صحنه شهری.
مهمترین قابلیتهای Lyria 3.5:
- ساخت موسیقی با آواز یا بهصورت بیکلام
- تولید آهنگ از روی متن یا تصویر
- انتخاب سبک، ژانر و فضای موسیقی
- کنترل مدت و حالوهوای قطعه
- ساخت موسیقی مناسب برای ویدیو، ریلز، پادکست و پروژههای شخصی
رابط کاربری ساخت موزیک در هوش مصنوعی جمنای
ساخت موسیقی با Gemini به دانش تخصصی نیاز ندارد و بیشتر شبیه نوشتن یک درخواست معمولی برای هوش مصنوعی است. برای دسترسی به این بخش:
- نسخه وب یا اپلیکیشن Gemini را باز کنید و یک گفتوگوی جدید ایجاد کنید.
- از بخش ابزارها یا منوی مربوط به قابلیتها، گزینه Create music را انتخاب کنید.
بعد از انتخاب گزینه ساخت موسیقی، Gemini میتواند با توضیح و فایلهای اختصاصی شما آهنگ بسازد یا از قالبهای آماده (template) استفاده کند.
اجزای کادر پرامپت ساخت موسیقی
در این کادر، میتوانید جزئیات آهنگ را مشخص کنید؛ از سبک و حس موسیقی گرفته تا نوع خواننده، سازها، موضوع ترانه و ساختار آهنگ. یکی از تفاوتهای مهم Lyria 3.5 با نسلهای قبلی نیز همین است که کاربر فقط به نوشتن پرامپت محدود نیست. جمنای چند کنترل مستقیم برای شخصیسازی آهنگ ارائه میکند. در ادامه این تنظیمات را مرور میکنیم:
تعیین طول آهنگ (Length)
جمنای امکان انتخاب مدت قطعه را هم فراهم میکند. این گزینه برای کاربردهای مختلف مهم است؛ چون موسیقی مناسب یک ریلز کوتاه با قطعهای که برای پسزمینه یک ویدیو یا پادکست ساخته میشود، زمان متفاوتی نیاز دارد.
انتخاب آهنگ باکلام یا بیکلام (Vocals)
در بخش Vocals میتوانید بین ساخت موسیقی بدون آواز (Instrumental) و ساخت آهنگ با خواننده (Vocal) انتخاب کنید یا آن را روی حالت Custom قرار دهید تا مدل براساس پرامپت شما عمل کند. برای مثال:
انتخاب سبک موسیقی (Genre)
در بخش Genre میتوانید سبک موردنظر را انتخاب کنید یا آن را در پرامپت توضیح دهید. برای مثال: پاپ، راک، هیپ-هاپ و... همچنین میتوانید در پرامپتتان ترکیبی از سبکها را درخواست کنید؛ مثلاً موسیقی الکترونیک سینمایی با عناصر راک. گوگل در راهنمای پرامپت Lyria هم پیشنهاد میکند ژانر، دوره زمانی یا ترکیب سبکها را در پرامپتتان مشخص کنید.
قالبهای آماده جمنای برای ساخت موزیک
در بالای بخش ساخت موسیقی میتوانید قالبهایی که خود Gemini پیشنهاد میدهد را ببینید و استفاده کنید. این قالبها برای موقعیتهایی مانند موسیقی پسزمینه، رینگتون، آهنگ مناسب مناسبتها و قطعههای شخصی طراحی شدهاند.
یا قالب Memorise something برای ساخت موسیقی بر اساس یک موضوع یا چیزی که باید به خاطر بسپارید طراحی شده است. مثلا میتوانید مفاهیم درسی خود را با این قالب بهشکل یک موزیک به یادماندنی تبدیل کنید.
در انتهای مقاله، تجربه زومیت از همین قالب و همچنین ساخت آهنگ هوش مصنوعی فارسی با ترانه اختصاصی را بررسی میکنیم.
ساخت آهنگ با قالبهای آماده Gemini
سادهترین راه برای شروع ساخت آهنگ هوش مصنوعی، انتخاب یکی از قالبهای آماده جمنای است. جمنای بر اساس سناریویی که انتخاب میکنید، تنظیمات اولیه آهنگ را مشخص میکند و سپس میتوانید جزئیات بیشتری به آن اضافه کنید.
برای مثال، قالب رینگتون را انتخاب کنید و چیزی مثل این بنویسید: «یک رینگتون با حال و هوای جادویی». میتوانید جزئیات بیشتری هم اضافه کنید.
در بررسی من با قالب Memorise something پس از انتخاب این قالب و وارد کردن یک یادآوری فارسی، جمنای ابتدا موضوع درخواست را تشخیص داد و آن را به یک رویداد در Google Calendar تبدیل کرد. سپس بر اساس همان موضوع، یک قطعه موسیقی ساخت.
این تجربه نشان میدهد قابلیت ساخت موسیقی جمنای فقط به تولید یک فایل صوتی محدود نیست و در بعضی سناریوها میتواند با دیگر سرویسهای گوگل ترکیب شود.
ساخت آهنگ در Gemini با پرامپت
اگر قالب آماده نتیجهای که میخواهید را ارائه نمیدهد، میتوانید مستقیماً ایده خود را برای جمنای توضیح دهید.
برای گرفتن خروجی بهتر، بهتر است پرامپت موسیقی را مانند یک توضیح کوتاه برای یک آهنگساز بنویسید، نه یک دستور ساده. مثلاً به جای این که فقط بگویید یک آهنگ بساز، بنویسید:
میتوانید تنظیمات ژانر و آواز و طول موسیقی را نیز طبق خواستهتان تغییر دهید یا اجازه دهید جمنای خودش براساس پرامپت شما موزیک را آماده کند. یک پرامپت موسیقی خوب معمولاً چند بخش دارد:
موضوع و کاربرد آهنگ
اول مشخص کنید موسیقی برای چه چیزی ساخته میشود. مثلاً:
- موسیقی پسزمینه ویدیوی یوتیوب
- ریلز فناوری
- پادکست
- تیزر معرفی محصول
- رینگتون
سبک و ژانر
برای انتخاب سبک موسیقی باید با آن ها آشنا باشید، اگر با ژانرهای موسیقی آشنا نیستید میتوانید کمی تحقیق کنید یا حداقل ژانر موزیکهای موردعلاقه خود را جستجو کنید.
سازها و فضای صوتی
مشخص کنید چه صداهایی در آهنگ شنیده شوند.
یا
حس و نحوه اجرا
فقط گفتن سبک کافی نیست. حس موردنظر را هم توضیح دهید. مثلاً:
- آرام
- حماسی
- تاریک
- نوستالژیک
- هیجانانگیز
- احساسی
مشخص کردن نوع خروجی
اگر موسیقی پسزمینه میخواهید، آن را مشخص کنید.
اگر آهنگ باکلام میخواهید، باید درباره جنس اجرا و متن توضیح دهید.
ساخت موسیقی با Gemini از روی عکس یا فایل متنی
یکی از قابلیتهای جالب جمنای این است که برای ساخت موسیقی فقط به متن محدود نیست. میتوانید تصویر را به آن بدهید و از مدل بخواهید موسیقی متناسب با فضای تصویر بسازد. همچنین جمنای میتواند فایلهای متنی را برای درک موضوع یا استخراج ایده بررسی کند و سپس بر اساس آن، درخواست ساخت موسیقی را اجرا کند.
در این حالت، بهجای اینکه همه جزئیات را خودتان توضیح دهید، جمنای تلاش میکند از فضای کلی ورودی الهام بگیرد؛ مثلاً حالوهوای یک تصویر، موضوع یک فایل یا محتوای یک پروژه را در نظر بگیرد.
ساخت آهنگ با Gemini از روی تصویر
برای ساخت موسیقی از روی عکس، کافی است تصویر موردنظر را در جمنای آپلود کنید و توضیح دهید چه نوع موسیقیای میخواهید. مثلاً برای تصویر یک خیابان بارانی شبانه:
یا برای یک تصویر از طبیعت:
در این حالت بهتر است فقط به خود تصویر اکتفا نکنید و احساسی که میخواهید منتقل شود را هم توضیح دهید. یک عکس از کوهستان میتواند موسیقی آرام، حماسی یا حتی مرموز داشته باشد؛ انتخاب نهایی به توضیح شما بستگی دارد.
ساخت آهنگ با Gemini از فایلهای متنی
جمنای میتواند از فایلهای ورودی هم بهعنوان نقطه شروع استفاده کند. برای مثال میتوانید یک فایل متنی شامل توضیحات پروژه، یک متن ترانه یا اطلاعات مربوط به یک مناسبت را وارد کنید و از مدل بخواهید بر اساس آن موسیقی بسازد. این قابلیت برای تولیدکنندگان محتوا کاربردی است؛ مثلاً:
- ساخت موسیقی متناسب با سناریوی یک ویدیو
- تبدیل ایده یک داستان کوتاه به قطعه موسیقی
- ساخت آهنگ برای یک مراسم یا مناسبت خاص
- ایجاد موسیقی پسزمینه برای یک پروژه
برای آزمایش من فایل ورد یکی از سناریوهای آموزش هوش مصنوعی را برای جمنای فرستادم و خواستم که یک موسیقی متنی ایجاد کند. نتیجه نسبتا خوب بود. در حالت دوم نیز خواستم متن را به ترانه تبدیل کند، نتیجه جالب شد اما تلفظها ایراد جدی داشت.
ورودی تصویر یا فایل به این معنی نیست که Gemini دقیقاً همه جزئیات را به موسیقی تبدیل میکند. مدل بیشتر از آنها برای درک موضوع، فضا و حس کلی استفاده میکند. برای مثال، اگر تصویری از یک شهر شبانه بدهید، انتظار نداشته باشید صدای خیابان یا جزئیات دقیق تصویر را بازسازی کند؛ بلکه احتمالاً یک موسیقی با حالوهوای شهری، تاریک یا سینمایی تولید میکند.
چگونه در Gemini آهنگ با ترانه اختصاصی بسازیم؟
برای ساخت آهنگی که متن آن را خودتان نوشتهاید، بهتر است متن ترانه را از توضیحات موسیقی جدا کنید. به جای اینکه همه چیز را در یک پاراگراف بنویسید، ساختار مشخصی ایجاد کنید.
نکتهای که در تجربه شخصی من هم دیده شد این است که بهتر است توضیحات اجرا را انگلیسی و جدا از متن ترانه بنویسیم و خود متن ترانه را جدا کنیم. این کار احتمال دارد باعث شود مدل کمتر دستورهای اجرایی را با بخشی از شعر قاطی کند.
استفاده از برچسبهایی مانند Verse، Chorus و Outro کمک میکند مدل ساختار کلی آهنگ را بهتر درک کند.
با شکل نوشتاری بالا، مدل اول میفهمد قرار است چه نوع آهنگی بسازد و بعد متن ترانه را داخل همان چارچوب اجرا میکند.
برای فارسی بهتر است توضیحات را با متن شعر قاطی نکنیم. مثلاً ننویسم:
چون در این حالت ممکن است مدل بخشی از دستور «با صدای قدرتمند بخوان» را هم بهعنوان بخشی از اجرای ترانه برداشت کند.
بهجای این میتوانیم بنویسیم:
برای زبانهایی مانند فارسی، بهتر است متن ترانه را با دقت بیشتری آماده کنید. اعرابگذاری ممکن است در بعضی واژهها کمک کند، اما تضمینی برای تلفظ کاملاً درست نیست و ممکن است مجبور شوید بارها خروجی بگیرید.
نتیجه تست زومیت از ساخت آهنگ فارسی با جمنای
برای بررسی عملکرد واقعی لیریا ۳٫۵، چند سناریوی مختلف را آزمایش کردم؛ نه فقط ساخت یک آهنگ ساده، بلکه تجربههایی که یک کاربر واقعی ممکن است سراغ آنها برود.
در آزمایش اول، از قالب آماده Memorise something استفاده کردم. درخواست من یک جمله فارسی با اعرابگذاری بود: «فردا ساعت ۱۲ باید سالن طاها باشم، ورودی دوم از سمت آبنما در تالار شمس.»
جمنای توانست مفهوم کلی درخواست را متوجه شود و ابتدا یک رویداد در Google Calendar ایجاد کرد. سپس بر اساس همان موضوع، موسیقی ساخت.
اما در بخش اجرای آواز فارسی، نتیجه چندان رضایتبخش نبود. ازآنجا که بخش عمدهی ترانه را مدل خودش ساخته بود و فقط از دستور من برای نوشتن ترانه ایده گرفته بود، حتی با اینکه متن اعرابگذاری شده بود، خوانش بیشتر واژهها طبیعی نبود و مدل نتوانست تلفظ فارسی را مانند یک خواننده واقعی اجرا کند. این تجربه در حالت انگلیسی دیده نشد.
در آزمایش دوم، تلاش کردم ببینیم آیا جمنای میتواند یک آهنگ موجود را از نظر سبک و اجرا حفظ کند و فقط ترانه را تغییر دهد. از مدل خواستیم با همان ژانر و همان صدای خواننده قطعه قبلی، آهنگ جدیدی با ترانه اختصاصی ما بسازد.
برای افزایش دقت:
- متن فارسی را اعرابگذاری کردم.
- نسخه فینگلیش تلفظها را هم اضافه کردم.
- بخشهای مختلف آهنگ را با Verse، Chorus و Outro مشخص کردیم.
- درباره نحوه اجرای هر بخش توضیح دادم.
نتیجه این بار بهتر بود. جمنای توانست فضای کلی آهنگ، ژانر و جنس صدای خواننده را تا حد زیادی حفظ کند و ترانه جدید را در همان قالب اجرا کند. بااینحال، مشکل تلفظ فارسی کاملاً برطرف نشد. در چند واژه، مدل همچنان خوانش متفاوتی از متن داشت و به نظر میرسید بیشتر به الگوی داخلی خود برای تولید آواز تکیه میکند تا آوانویسی فینگلیش واردشده.
نکته جالب در این آزمایش این بود که متوجه شدم که بهتر است توضیحات را با متن شعر قاطی نکنیم مثلا ننویسم:
در این حالت مدل گاها ممکن است متن نوشتهشده را بهعنوان بخشی از ترانه بخواند.
بخش دیگری از تجربهی من نشان داد که اعرابگذاری کافی نیست؛ پس در کنار افزودن سکون به کلمات، آنها را به سادهترین شکل نوشتم، به همان شکلی که تلفظ میشوند. مثلاً بهجای عالم رویا نوشتم آلَمِ رُیا یا به جای یِه عُمْرْی نوشتم یِ عُمْرْی. حتی میتوانستم نوشتهها را از این هم سادهتر بکنم؛ اما نتیجه تست آخر نسبتاً رضایتبخش بود و سادهسازی را ادامه ندادم.
پرامپت نهایی من:
خروجی پرامپت نهایی:
آیا ساخت آهنگ با هوش مصنوعی Gemini ارزش امتحان کردن دارد؟
Gemini با مدل Lyria 3.5 ساخت موسیقی را برای کسانی که تجربه آهنگسازی ندارند سادهتر کرده است. کاربر میتواند از قالبهای آماده شروع کند، سبک و نوع اجرای آهنگ را تغییر دهد یا با نوشتن یک پرامپت دقیق، قطعهای متناسب با نیاز خود بسازد. Lyria 3.5 از متن و تصویر برای تولید موسیقی استفاده میکند و میتواند آهنگهایی با ساختارهایی مانند ورس و کُر تولید کند.
Gemini بیشتر یک ابزار خلاقانه برای ساخت نمونه اولیه، موسیقی پسزمینه، ایدهپردازی و تولید محتوای سریع است. اگر تا امروز ساخت آهنگ با هوش مصنوعی رایگان را امتحان نکردهاید، جمنای یکی از سادهترین راهها برای شروع است. یک ایده، تصویر یا حتی یک موضوع ساده را وارد کنید و ببینید Lyria 3.5 چه قطعهای برایتان میسازد.
تجربه شما از ساخت آهنگ با هوش مصنوعی چیست؟ در بخش دیدگاهها برای ما بنویسید.