AI 音樂提示詞怎麼寫?6 大要素公式,讓 Suno、Udio 一次生成你要的曲子

2026-08-07 Author by Even
AI 音樂提示詞怎麼寫?6 大要素公式,讓 Suno、Udio 一次生成你要的曲子
01 前言

AI 生成音樂

老實說,我第一次用 AI 生成音樂的時候,打的提示詞是「一首放鬆的音樂」。出來的東西,聽起來就像電梯裡循環播放的那種背景音樂,毫無記憶點。後來翻了幾份專業教學才發現,問題不在工具,而是我把提示詞寫得太像「許願」,不夠像「創作簡報」。

如果你也卡在這一關 —— 生出來的曲子永遠都差那麼一點,那這篇文章就可以幫助你。

02 罐頭配樂

為什麼提示詞太模糊會生出罐頭配樂

太簡短或太抽象的指令,AI 只能靠猜測補上細節,結果就是那種俗稱「罐頭配樂」的平淡背景音。專業的提示詞其實更像是交給一位作曲家的創作簡報,需要具體的音樂術語,加上明確的情感方向,AI 才知道往哪個方向走。

到了 2026 年,這件事變得更明顯。像 Suno v5.5Udio v2 這類高階模型,會把提示詞當成「製作藍圖」在解讀,而不是單純的文字指令,模糊的描述反而會拉低生成品質。

03 核心公式

核心公式:六大要素一次寫齊

三份資料不約而同都提到同一套邏輯,可以整理成這個公式:

〔曲風〕+〔情緒〕+〔節奏/BPM〕+〔樂器〕+〔人聲風格〕+〔使用場景〕

把這六個元素一次寫齊,出來的結果會比只寫兩三個字精準非常多。以下逐項拆解。

04 Genre

曲風(Genre):別停在模糊大範圍,要指定到特定的類別與細節

只寫「電子音樂」太籠統,範圍從 Lo-fi 到 Dark Techno 什麼都算。建議直接指定子類型,甚至加上年代或地區修飾詞,例如把「Hip-hop」寫成「1990 年代紐約電影感 Boom-Bap」或「2024 倫敦 Drill」,指定的年代與地域越窄,生成結果越準。

常見曲風:

  • Lo-Fi /輕鬆系:Lo-fi hip hop、臥室流行(bedroom pop)、爵士感器樂
  • 電子舞曲:Progressive house、Dark techno、Future bass、Melodic dubstep
  • 嘻哈/Trap:Boom bap、Modern trap、Drill
  • 電影配樂:Epic orchestral、Dark ambient underscore
  • 流行/獨立:Synth-pop、Indie folk、Dream pop

05 Mood

情緒(Mood):把「快樂」換成具體的畫面

「快樂」「悲傷」這種詞太籠統,容易讓 AI 各自表述。試著把情緒延伸成具體情境,例如把「憂鬱」寫成「一首關於距離與思念的歌」,會讓旋律更有渲染力。

高能量可以用「振奮、強勢、凱旋」;內省情緒可以用「懷舊、惆悵、若有所思」;緊張感可以用「懸疑、不安、令人窒息的張力」。記得避免互相矛盾的形容詞,例如「放鬆的重金屬」這種組合,只會讓模型無所適從。

06 BPM

節奏與 BPM:給數字,不要給感覺

比起單純寫「快」或「慢」,直接標出 BPM 數字準確非常多,這也是提升生成品質最重要的單一變數。

曲風 建議 BPM 節奏特徵
Lo-fi 70–90 慵懶鼓組律動、黑膠雜訊
House 120–130 Four-on-the-floor 大鼓
Trap 140–150 三連音 Hi-hat、808 滑音

07 Instrumentation

樂器(Instrumentation):用「二到三種」建立音色識別度

只寫一種樂器,AI 很難建立明確的音色印象,指名二到三種效果最好,例如「刷奏軍鼓+低音提琴」,比單寫「爵士」更有畫面。可以參考這些「參考錨點」:Rhodes 電鋼琴、supersaw 主音、808 滑音貝斯、悶音小號、獨奏大提琴。

08 Vocal Direction

人聲風格(Vocal Direction):連「不要人聲」都要講清楚

如果啟用人聲,記得指定音色,例如「沙啞獨立男聲」「氣音女聲」;如果不需要人聲,務必明確寫出「無人聲」或「[Instrumental]」,否則 AI 有時會自己加進不必要的人聲或哼唱。

09 Use Case

使用場景(Use Case):讓 AI 知道這首歌要放在哪裡

註明用途能幫助 AI 理解結構與情緒走向,例如「適合旅遊 Vlog」「紀錄片旁白背景音樂」「深夜 Lo-fi K 書用」。不同平台也有各自的眉角:短影音前三秒要有強烈的鉤子、節奏抓耳且適合循環播放;YouTube 片頭要在十秒內建立品牌調性,片尾則採漸弱收尾;廣告與 Podcast 則要強調傳遞信任感,維持情緒穩定不落俗套。

10 範例

範例提示詞,直接套用

Lo-fi 讀書系:「放鬆的 Lo-fi hip hop 器樂曲,85 BPM,A 小調,悶音黑膠採樣,帶灰塵感的鼓組循環,Rhodes 電鋼琴的柔和爵士和弦,輕柔雨聲環境音,溫暖懷舊氛圍,適合深夜讀書。」

Progressive House:「Progressive house,128 BPM,強力的 Four-on-the-floor 大鼓,厚重的 Sidechain 壓縮,層疊合成器音牆逐漸堆疊至高潮,氣音女聲人聲切片,夏日音樂節能量,寬闊的立體聲場。」

電影感預告片配樂:「史詩級管弦樂預告配樂,從大提琴獨奏緩緩擴展至完整弦樂與銅管,戲劇性定音鼓敲擊,C 小調堆疊的張力,六十秒內漸強至恢弘的英雄式高潮,最後收束。」

11 地雷

常見的提示詞地雷,先避開再說

  • 過於模糊:缺乏曲風與情境說明,AI 只能亂猜。
  • 前後矛盾:像「放鬆的重金屬樂」這種互斥描述,模型會不知道該聽誰的。
  • 風格堆疊(Prompt Soup):一口氣塞進太多曲風,例如「雷鬼搖滾福音饒舌電影感民謠電音」,生成結果只會一團混亂。正確做法是抓出主從關係,例如「雷鬼搖滾為基底,福音合唱點綴,厚重真鼓,深沉貝斯」。
  • 故事性過強:寫了一整段劇情,卻沒有任何音樂專業術語,AI 很難把文字轉譯成聲音元素。
  • 字數失衡:字數是有甜蜜點的,太短資訊不夠,AI 只能靠預設值補;太長又容易「訊號稀釋」,模型會忽略重要的樂器或結構線索。有教學建議器樂曲落在 80 到 200 字之間效果最穩定,人聲曲則建議控制在 30 到 80 字左右。

12 進階技巧

進階技巧:負面提示詞與迭代優化

除了正面描述,負面提示詞(告訴 AI「不要什麼」)同樣關鍵,甚至能左右一半以上的成品品質。可以分三層使用:直接在排除欄位列出相鄰但不想要的曲風;在風格欄位內嵌入「no」語句做軟性引導,例如「no auto-tune、no English vocals」;最後加上通用的「不要過度殘響、不要套路化的鼓點漂移」,防止模型跑出常見的失敗模式。

另外,把第一次生成當成「方向指標」就好,不用一次到位。先產生幾個版本挑出最順耳的一版,接著每次只調整一個變數(BPM、調性,或單一樂器),才能清楚知道是哪個改動讓結果變好或變差。也有創作者發現,模型比較擅長解讀「描述句」而非「命令句」 —— 用「一首……的曲子」開頭,會比「請生成一首……」更容易對到 AI 的機率分布。

一份 2026 年的整理也提到,Suno 目前活躍用戶已破千萬,每天生成的曲子數量相當驚人;但同一份分析也指出,多數初版曲子之所以需要重新生成三次以上,關鍵原因往往就是曲風沒有「咬住」 —— 這正好呼應了前面提到的:曲風要寫具體、要放在提示詞最前面。技術分析也發現,AI 音樂模型會特別重視提示詞開頭的前五到十個字,所以把最重要的曲風放在最前面,能有效鎖定整首曲子的和聲與節奏基調。

最後

AI 音樂生成工具已經很強了,差的往往不是模型,而是我們給的指令。下次打開 Suno 或 Udio 之前,不妨先把這六個要素 —— 曲風、情緒、節奏、樂器、人聲、場景 —— 在腦中過一遍,再動手打字。你會發現,同一個工具,生出來的東西完全是兩個等級。

#生成式AI #AI音樂 #AI配樂 #提示詞教學 #提示詞公式 #AI創作 #Suno #Udio