手把手從零製作「日文 AI 動畫 MV」完整攻略
- 小步

- 8月24日
- 讀畢需時 14 分鐘
合作揭露:本文與 OiiOii.ai 合作製作,內容包含實際操作心得與製作過程中遇到的問題。
只有一張角色圖,也能製作完整動畫 MV 嗎?
本文以小步主題曲《一歩ずつ、光へ》為例,完整示範如何規劃主題、生成音樂、建立角色與場景、調整 AI 分鏡,最後完成中日文字幕與影片後製。
前言
我替小步製作了第一支個人主題 MV——《一歩ずつ、光へ》。
這支 MV 沒有真人拍攝,也沒有傳統動畫團隊。最初準備的素材,只有小步的角色圖、歌曲概念,以及一個很簡單的故事方向。
這次我想測試的不只是「AI 能不能讓圖片動起來」,而是能不能完成一支具備角色一致性、音樂節奏與故事變化,而且最後真的能進入剪輯軟體完成後製的動畫 MV。
整個流程大致分成以下幾個階段:
這篇文章會把每一個階段的操作方式、提示詞重點,以及我實際踩過的雷全部整理下來。

第一步:先找到角色真正的核心,而不是急著寫分鏡
在製作角色主題 MV 之前,我認為最重要的問題不是畫面要多華麗,而是:
這個角色為什麼存在?
小步這個角色並不是先有造型,才替她尋找故事。
最早出現的,是「每天進步一小步」的概念,也是小步學習頻道一直想傳達的概念。
如果每天都比昨天進步 1%,經過一年持續累積:
1.01³⁶⁵ ≈ 37.8也就是接近原本的 37 倍。
我希望透過頻道提醒自己,也陪著大家每天學習一點點,因此先有了「小步學習」這個名字,後來才從這個理念發展出小步這個角色 IP。
所以,這次替小步製作第一支主題 MV 時,我沒有另外創造一套不相干的世界觀,而是回到她最初誕生的原因:
即使現在還看不到明顯改變,只要依照自己的步伐,每天向前走一小步,時間最後會帶我們走到不同的地方。
這也成為歌曲《一歩ずつ、光へ》的核心:一步一步,走向光。
如果還沒有角色 IP,該怎麼開始?
如果你已經有自己的角色,可以先回答三個問題:
這個角色為什麼存在?
她代表什麼價值或信念?
希望觀眾看完後產生什麼感受?
如果現在還沒有角色,也不必先硬做一個 IP。
可以先替音樂定調,決定歌曲想表達的主題、情緒與曲風,再從歌詞和旋律反過來發展人物與故事。

第二步:準備音樂——先規劃,再生成
音樂是 MV 的時間軸。
歌曲的長度、段落與情緒變化,會直接決定後面的分鏡數量和畫面節奏。
1. 規劃歌曲方向
一開始可以先找幾首自己喜歡的歌曲,整理想參考的是哪些「抽象特徵」。
例如:
整體是溫暖、熱血、療癒,還是帶一點迷惘?
希望是日系動畫片尾曲、流行搖滾,還是輕柔鋼琴?
主歌要克制,副歌要不要明顯拉高情緒?
歌曲預計多長?
MV 要橫式還是直式?
這個階段可以和熟悉的 AI 討論,例如 ChatGPT 或 Gemini。
不過提示詞要清楚說明,目前需要的是「規劃歌曲」,還是「直接生成歌曲」。
我自己測試時,原本只是想和 Gemini 討論方向,但因為沒有說清楚,結果它直接生成了一首歌。
這不一定是壞事,但如果目標只是整理曲風、結構與歌詞,最好一開始就寫明白。
另外,參考歌曲適合用來描述情緒、速度與配器,不建議要求 AI 複製特定歌手、旋律或作品。
Gemini | ![]() |
提示詞:我想製作一首約1分半的日文歌,曲風類似剛剛這首曲子,歌曲的主題是「小步小步向前走」,你依照一首完整歌曲的段落,設計這個歌的歌詞,要中日對照。 ![]() | |
ChatGPT | ![]() |
![]() |
2. 寫出適合 MV 的音樂提示詞
這次我設定的音樂方向是:
語言:自然清楚的日文演唱
長度:約 1 分 30 秒
曲風:溫暖、有希望感的日系動畫/J-Pop 片尾曲
情緒:從夜晚的迷惘,慢慢走向清晨與希望
人聲:清晰、溫柔但有力量的女聲
結構:短前奏、主歌、預副歌、副歌、最終副歌與短尾奏
限制:不要第二段主歌、不要重複副歌、不要英文口白或 Rap
提示詞裡最容易漏掉的是「歌曲結構」。
只寫「請生成一首 90 秒的歌」,AI 仍可能做出兩三分鐘的完整歌曲。
如果片長有明確限制,就要連前奏、重複次數與尾奏長度一起約束。
透過 OiiOii 的音訊生成功能製作歌曲
OiiOii 的工作區也整合了 Suno 音樂生成模型。
因此從零開始製作時,可以直接把語言、曲風、歌曲結構與歌詞交給 Agent,讓它在同一個創作流程裡生成音樂。
提示詞 | 請使用 OiiOii 的音訊生成功能,調用 Suno 模型,製作一首完整的日文歌曲。 歌曲名稱: 《一歩ずつ、光へ》 歌曲用途: 作為「小步」角色 IP 的個人主題曲與動畫 MV 配樂。 歌曲長度: 請控制在約 85~95 秒,最長不要超過 1 分 35 秒。 前奏不超過 4 秒,歌曲只演唱一輪,不重複主歌與副歌,不加入第二段主歌,不安排長篇間奏,最後保留約 5~8 秒純音樂收尾。 曲風: 清新、溫暖、帶有希望感的日系動畫 J-pop,接近動畫片尾曲或角色主題曲的氛圍。 中速,約 105~112 BPM,4/4 拍。 開頭以清澈鋼琴、柔和合成器與輕微環境音營造夜晚感;進入副歌後逐漸加入鼓組、貝斯、明亮電吉他與弦樂,讓情緒從安靜迷惘慢慢走向明亮、堅定與希望。 副歌要有清楚、容易記住的旋律,但不要過度激昂、不要搖滾嘶吼,也不要太幼兒或過度可愛。 演唱設定: 日系年輕女聲,聲音清澈、溫柔、有情感,帶有一點動畫女主角感,但整體自然成熟。 日文發音必須清楚,歌詞密度適中,不要使用過多轉音或拖長音。 歌曲結構: 3~4 秒純音樂前奏 → 主歌 → 短預副歌 → 副歌 → 最終副歌 → 5~8 秒純音樂尾奏 請完整使用以下日文歌詞,不要翻譯、不要改成英文、不要新增英文口白或英文和聲,也不要自行重複任何段落。 [Intro] (3~4秒純音樂,無人聲) [Verse] まだ暗い空の下 小さなくつ音が響く うまくいかない日も 立ち止まりそうな夜も 胸の奥の願いは 消えずにそっと光ってる 遠回りでもいい [Pre-Chorus] きのうより少し前へ [Chorus] 一歩ずつ 光へ 私の歩幅で進んでゆく 涙の跡も 迷った道も あしたの私をつくるから [Final Chorus] 一歩ずつ 夢へ 小さな勇気を抱きしめて 夜が明ける この街で 私は私を信じてゆく ほら 朝焼けが 未来を染めてゆく [Outro] (5~8秒純音樂收尾,無人聲) 生成要求: 1. 全曲只能演唱日文,不得出現英文歌詞、英文口白或無意義英文音節。 2. 不得重複副歌,不得新增第二段主歌。 3. 不要加入 Rap、唸白、長篇哼唱或長間奏。 4. 必須在 95 秒內自然結束,不要直接截斷尾音。 5. 情緒必須從夜晚的迷惘,逐漸走向晨光與希望。 6. 請直接執行音訊生成,不要只提供歌曲規劃或改寫歌詞。 |

歌曲生成後,不要立刻進入動畫階段。
建議先完整聽過並確認:
日文發音是否自然?
實際秒數是否適合預計的 MV 長度?
主歌、副歌和結尾是否有清楚的情緒變化?
結尾是否自然收束,而不是突然被截斷?
如果一次產生兩個版本,可以優先比較:
主歌第一句
副歌高潮
最後 10 秒
通常很快就能判斷哪一版比較適合畫面。
其它音樂生成平台
除了透過 OiiOii 的工作區調用 Suno 模型,目前也有不少 AI 音樂生成平台可以選擇:
Suno:可依照提示詞與自訂歌詞,生成包含主唱、編曲與完整歌曲結構的作品,適合角色主題曲及 MV。
MiniMax Music:可輸入曲風與歌詞生成完整歌曲,也支援自動撰寫歌詞、純音樂及 Cover 等功能。官方說明
Eleven Music:可生成完整歌曲或純音樂,支援多語言歌詞與人聲,包括日文,並能針對部分段落修改提示詞及歌詞。官方說明
Stable Audio:比較適合製作背景配樂、環境音、音效與純音樂,也支援文字生成音訊及 Audio-to-Audio。官方說明
不同平台對免費方案、商業使用、串流發行及 Content ID 的規定並不相同。若音樂會用在營利影片、品牌合作或正式發行,生成前應先確認當時方案的授權條款,並保留訂閱證明、歌曲生成日期及原始下載檔案。
第三步:把平面角色轉成適合 MV 的 2.5D 角色
原本的小步比較偏平面插畫。
為了讓她進入帶有電影光影的城市場景,我先在 OiiOii 裡將角色轉成較有立體感的 2.5D 動畫風格。

生成角色圖後,不要只把圖片留在工作區。
請在圖片上按滑鼠右鍵,選擇:
存為資產 → 角色把角色正式存進資產庫,後續每一個分鏡才能持續關聯同一個角色,減少髮型、眼鏡、服裝或臉型突然改變的情況。
![]() |
![]() |
角色資產的實用提醒
主圖盡量使用清楚的全身正面照。
背景單純,避免其他人物或複雜道具。
把「必須保留」與「可以變化」的細節分開描述。
生成後先確認手腳、服裝和角色年齡,再存入資產庫。
第四步:建立夜晚與清晨兩個核心場景
這支 MV 的故事是從迷惘走向希望,因此我只建立兩個主要場景:
雨後的夜晚城市街道
日出時的晨光天橋
夜晚街道使用深藍夜空、暖黃色路燈、濕潤路面與玻璃店面。
晨光天橋則使用金橙色日出、高樓城市與逐漸明亮的天空。
我沒有建立大量不同背景,因為場景愈多,不一定代表故事愈完整。
這次更重要的是讓光線和色彩本身參與敘事:
夜晚:代表迷惘
星光:代表方向
晨光:代表找到希望
場景圖完成後,同樣按右鍵選擇:
存為資產 → 場景我曾測試過平台的多視角場景生成,但產生的另一個角度和原圖差異較大。
因此這次沒有勉強使用,而是保留單一場景主圖,讓 MV 創作流程自行處理鏡位變化。
![]() | |
請生成一張16:9橫向的動畫MV場景主圖,作為後續可重複使用的場景資產。整體畫風請與角色資產「小步 Xiaobu|OiiOii 2.5D MV 定裝角色」一致,但畫面中不要出現小步或任何人物。採用日系2.5D半立體動畫電影質感,具有柔和體積光、細膩材質、自然景深與乾淨輪廓;不要平面插畫,也不要寫實照片。場景是一座現代亞洲城市的安靜夜晚街道。深藍色夜空、暖黃色路燈,搭配藍綠色與少量橘色的城市燈光;微微濕潤的路面呈現柔和倒影。畫面包含寬敞人行道、斑馬線、玻璃店面與遠方城市高樓。構圖需適合角色在畫面中從左向右行走,前景及畫面中央保留充足的角色表演空間。整體氣氛安靜、略孤帶孤,但仍透露溫暖與希望。不要出現人物、文字、可讀招牌、商標、車牌或擁擠車流;不要做成強烈賽博龐克或過度霓虹風格。 | 請生成一張16:9橫向的動畫MV場景主圖,只生成單一畫面,不需要多視角。這是場景資產「小步的城市|夜晚街道」所屬的同一座城市,請延續原場景的建築語言、城市天際線、玻璃與金屬材質、道路設計、燈光質感及整體渲染程度,讓觀眾能感覺這兩個場景位於同一個世界。場景是一座位於城市高處的寬敞行人天橋與觀景步道。前景有乾淨的步道路面與簡潔金屬欄杆,遠方可以看到與夜晚街道相呼應的現代城市天際線。畫面中央及右側保留足夠空間,方便後續放入角色並進行行走、停下、回頭與眺望城市等動作。時間是夜晚即將結束的清晨。天空由深藍色逐漸轉為淡紫、粉橘與柔和金色,太陽剛從城市建築後方升起;溫暖晨光照亮欄杆、步道與建築邊緣,呈現從迷惘走向希望、重新出發的情緒。維持與夜晚街道相同的日系2.5D半立體動畫電影質感、自然景深、細膩材質與柔和體積光。不要變成寫實照片,也不要變成平面卡通。畫面中不要出現人物、文字、可讀招牌、商標、車牌或擁擠車流。不要夕陽、正午天空、強烈賽博龐克、過度霓虹、奇幻建築或多格畫面。 |
![]() | ![]() |
第五步:切換到「MV 創作」,上傳完整歌曲
角色和場景準備完成後,將 OiiOii 工作模式切換成「MV 創作」。
這裡有一個很容易踩到的問題:
在一般自由創作模式裡,音訊上傳長度可能受到較短的秒數限制。
如果要使用一分多鐘的完整歌曲,要先切換到 MV 創作流程再上傳。

接著依序完成:
上傳完整歌曲
關聯小步角色資產
關聯夜晚街道與晨光天橋場景
輸入整體故事方向
MV 類型選擇「劇情故事」
畫面比例選擇 16:9
我一開始曾考慮選擇「動感表演」。
但這首歌的重點不是跳舞或對嘴,而是角色從迷惘走向希望的情緒變化,因此最後選擇「劇情故事」。
如果作品本身是舞曲、偶像表演,或以舞台演出為主,再考慮「動感表演」會更合適。
故事提示詞不要只寫畫風
我提供給系統的故事核心大致是:
小步獨自在雨後的夜晚城市裡感到迷惘。她在停下腳步後發現胸前徽章亮起,金色光點逐漸形成道路,引導她穿過黑夜。最後她抵達晨光天橋,在日出中重新找回前進的勇氣。
畫風、服裝和場景固然重要,但提示詞更需要說清楚:
角色遇到什麼事件?前後產生什麼改變?
否則即使每一鏡都很漂亮,整支影片仍可能只是角色在不同背景裡重複同一個動作。

第六步:讓 AI 分析音樂並規劃 13 個分鏡
歌曲與故事設定完成後,OiiOii 會分析:
前奏
主歌
預副歌
副歌
尾奏
接著依照音樂段落拆出分鏡。
這首約 1 分 24 秒的歌曲,最後被拆成 13 鏡。
系統會替每一鏡準備:
分鏡描述
圖片提示詞
影片提示詞
角色與場景資產關聯
音效或環境聲設定
正式生成前,建議先快速檢查所有分鏡,尤其注意:
是否連續太多鏡都使用相同動作?
副歌有沒有出現明顯的視覺變化?
場景由夜晚切換到清晨的時間是否合理?
角色是否突然換裝或改變外貌?
特寫、中景、全景是否有交替?

第七步:檢查第一版成品,最大的問題——小步一直走路
第一版完整生成後,角色一致性與整體畫風其實已經不錯,夜晚走向晨光的方向也成立。
但我很快發現:
小步幾乎整支影片都在走路。
夜街馬靴走路、晨光馬靴走路、全身走路、側面走路……
看到後來,馬靴的戲份差點超過女主角。
(只有小步學伴才看到完整一直走路版的小步MV)
不過這不完全是模型的問題。
回頭檢查原本的故事提示詞,我一直強調「一步一步往前走」,卻沒有替中間安排足夠的事件。
AI 便非常忠實地把「往前走」變成主要動作。
這次經驗讓我確認:
抽象情緒要轉換成具體事件,故事才會真正動起來。
例如「她慢慢找到希望」仍然太抽象。
可以進一步拆成:
她停在斑馬線前,不知道該往哪裡走。
胸前的星形徽章第一次發光。
金色光點沿著道路延伸。
她在掌心接住一顆星光。
她停下腳步,閉眼深呼吸,再望向日出。
這些事件才會讓角色有「發現、選擇與改變」,而不是只有移動。
第八步:局部修改問題分鏡,不必整支 MV 重做
OiiOii 這套流程對我最實用的地方,是可以直接指定問題分鏡,修改動作與鏡位,再單獨重新生成。
我最後重做了第 3、6、7、8、10、11 鏡。
第 3 鏡原本問題:繼續走路 調整後:停在斑馬線前,左右張望並流露猶豫。 | 第 6 鏡原本問題:情緒變化不足 調整後:胸前星形徽章亮起,角色第一次察覺希望。 |
第 7 鏡原本問題:連續走了約 7 秒 調整後:停在原地,光路展開,表情由驚訝轉為微笑。 | 第 8 鏡原本問題:副歌畫面不夠突出 調整後:伸手在掌心接住金色星光。 |
第 10 鏡原本問題:晨光裡繼續走路 調整後:馬靴停下、手撫徽章、閉眼深呼吸後望向日出。 | 第 11 鏡原本問題:與前後動作過於相似 調整後:張開雙臂,迎接逐漸照亮城市的晨光。 |
修改提示詞時,我會同時寫清楚:
開頭角色的位置與姿勢
這一鏡只能發生的主要事件
鏡頭如何移動
角色表情如何變化
結尾要停在哪個狀態,以便銜接下一鏡
明確的負面限制
例如:
不走路
不奔跑
不跳舞
不對嘴重新生成後,故事便從單純走路,變成:
迷惘 → 發現 → 確認 → 抵達
整個情緒曲線也會完整很多。

第九步:關閉自動字幕,改用剪輯軟體製作中日文字幕
OiiOii 可以依照歌曲產生字幕。
但我在預覽時發現,部分直式排列的字幕會壓在小步的臉上。
因為這支 MV 最後要同時呈現日文歌詞與繁體中文字幕,我選擇先關閉平台字幕,再到剪輯軟體完成:
日文原文字幕
繁體中文翻譯
歌曲名稱與片頭設計
片尾文案
字幕安全區與角色避讓
個別鏡頭的銜接與節奏微調
AI 生成的影片,不是下載後就一定要原封不動使用。
只要角色、場景與主要敘事已經成立,字幕、音量、轉場和資訊設計,仍然很適合交由傳統剪輯工具完成。

最後成果:AI 可以做出完整 MV,但創作者仍然要當導演
完成這次測試後,我會從三個方向評估結果。
1. 角色一致性
使用同一個角色資產後,小步的臉型、眼鏡、髮型和服裝,在不同場景與景別中大致能夠維持一致。
複雜手部動作和近距離特寫仍然需要逐鏡檢查,但發現問題時可以局部修正。
2. 音樂與故事的配合
系統能依照歌曲段落安排畫面節奏,但提示詞不能只有畫風與氛圍。
加入具體事件後,夜晚、星光與晨光的視覺變化,才真正和歌曲的情緒一起前進。
3. 成品是否能實際使用
答案是可以。
但我會把它理解成一套:
能快速建立完整雛形,並允許創作者繼續導演與修改的工作流程。
而不是按一次,就必須完美的魔法按鈕。
第一次生成,讓我快速看見整支 MV。
資產關聯,維持了角色與場景。
逐鏡重新生成,修正了故事節奏。
最後再透過剪輯軟體加入雙語字幕與片頭片尾,才完成現在的版本。
哪些人適合使用這套 AI MV 工作流程?
這套做法不只適合音樂創作者,也適合:
已經有固定角色或吉祥物的自媒體創作者
想替原創歌曲製作動畫 MV 的音樂人
想建立角色世界觀或系列短劇的創作者
需要製作品牌主題曲、活動短片或動畫廣告的團隊
沒有傳統動畫製作經驗,但願意規劃故事與逐鏡調整的人
如果還沒有角色,也可以使用 OiiOii 的演員庫選擇角色,再搭配平台整合的不同生成模型,延伸成 MV、短劇、廣告或其他動畫內容。
我從這次製作中整理出的 8 個重點
先確定角色或歌曲的核心,再開始設計畫面。
音樂提示詞要限制結構,不要只限制總秒數。
參考歌曲應描述情緒、速度與配器,不要要求複製作品。
角色與場景生成後,要正式存成資產。
上傳完整歌曲前,先切換到 MV 創作模式。
抽象情緒要轉換成具體事件,避免角色重複走路。
發現少數鏡頭有問題時,優先局部重生,不必整支推翻。
字幕與片頭片尾可以留到剪輯軟體處理,畫面會更可控。
想把自己的角色或歌曲做成動畫嗎?
如果你也想試著把一張角色圖、一首歌,或一個故事概念做成動畫,可以透過下方連結體驗 OiiOii.ai。
透過我的專屬邀請連結註冊,可獲得額外創作額度,讓你有更多空間測試角色、場景與不同分鏡。
最後也想問問你:
如果可以替自己的角色製作一支動畫 MV,你最想讓她經歷什麼故事?
如果你想下載小步MV音樂或客製化專屬MV,歡迎私訊小步 https://lin.ee/53hhx6G













留言