YuE2をMacで使いたくて、CodexにYuE Studioを構築してもらった。

音楽生成AI「YuE2(ユエ ツー)」の評判が良いので、Macで使えるYuE StudioをCodexに構築してもらった。
アプリそのものをダウンロードして使うこともできるのだが、どうせなら日本語UIにしたり、文字を大きくしたり、自分が使いやすいようにカスタマイズしたい。

そこでCodexには、これだけ頼んだ。

YuE Studioを構築してください。
https://github.com/tonywestonuk/YuE-Studio

すると、これまでCodexにアプリを作ってもらったときと同じように、日本語UI、大きめの文字、コピー可能なログ欄まで追加してくれた。
作成時間は11分30秒。

さらに日本語ガイドまで作ってくれた。

YuE Studio 日本語版

起動
このフォルダの run_app.command をダブルクリックしてください。アプリをビルドして起動します。
生成済みのアプリは dist/YuE Studio.app にあります。普段はこちらからも起動できます。
このローカル版はプロジェクト内の専用環境を使うため、フォルダ全体をそのまま保管してください。移動した場合は再セットアップが必要です。
曲を作る
「曲調・楽器・歌声」に作りたい曲の説明を入力します。日本語の歌には Japanese を加えると意図を伝えやすくなります。
歌詞を入力します。[Verse] や [Chorus] などの区切りはそのまま使えます。
最初は曲数1、試聴用(GPU)、最大の長さ30秒程度で「音楽を生成」を押してください。
曲一覧の再生ボタンで試聴できます。気に入った曲は「高音質に仕上げる」で再合成できます。
「最大の長さ」は上限で、指定した秒数ぴったりに仕上げる機能ではありません。上限到達で曲が途中で切れる場合があります。
初回生成はモデルの読み込みが入ります。高音質・長い曲は時間がかかります。
「楽曲構成」は旋律と和音/旋律のみ/なしを直接選べます。ABC楽譜欄は下へスクロールすると表示されます。
鼻歌・音声の採譜は、初めて利用する時に追加モデルをインストールします。iPhone連携には別途YuE Remoteが必要です。
保存場所とエラー
曲:outputs/app(アプリ内の「保存フォルダを開く」から開けます)
動作確認の短い曲:outputs/check
Pythonとモデル:.runtime(他アプリのPython環境とは分離)
ビルドログ:logs/build.log
モデルのダウンロード記録:logs/model-download.log
生成確認の記録:logs/generation-check.log
問題が出たら画面下の「処理・エラーログ」→「ログをすべてコピー」で内容をコピーしてください。
このアプリはローカル利用用の署名です。App Sandboxは使用していません。マイクは録音時のみ許可が必要です。
モデルのライセンスは MODEL_LICENSE(CC BY-NC 4.0)です。商用利用には対応していません。
原作・第三者の著作権表示は元のLICENSEとTHIRD_PARTY_NOTICES.mdに保持しています。
日本語版構築・カスタマイズ:Nishi Toyokazu
元リポジトリ:https://github.com/tonywestonuk/YuE-Studio

GitHubには「YuE Studio」がいくつもあった

後から分かったのだが、GitHubで検索してみると「YuE Studio」「YuE2 Studio」という名前のプロジェクトが複数ある。

今回構築したのは、tonywestonuk氏が公開しているYuE Studioだった。
このYuE Studioは、YuE2をApple Silicon搭載Macで動かすためのネイティブMacアプリ。GPUとNeural Engineを組み合わせて処理するように作られている。
公式の必要環境はApple Silicon Mac+macOS 14以降。メモリは32GBが快適とされているが、16GBでも動作する。初回にはモデルなどをダウンロードするため、それなりに容量も必要になる。

面白いのは、MacのNeural Engineだけではなく、同じネットワークにあるiPhoneを2台目のNeural Engineとして使う仕組みまで用意されていること。ただし、これはiPhone側に専用アプリを入れる必要があり、Apple DeveloperアカウントとXcodeを使った設定が必要になる。

そもそもYuE2は何が面白いのか

YuE2は、歌詞と曲調の指示を渡して音声を直接生成するだけの音楽AIじゃない。
いったんメロディとコードの設計図を作り、それを元に歌声と伴奏を含む曲を生成する。この設計図を人間側で確認したり、編集したり、もう一度使ったりできるのが大きな特徴だ。公式ではこれを「symbolic planning」と呼んでいる。
つまり、
「さっきの曲、メロディは良かったのに……」というときに、そのメロディを捨てずに済む。

ABC形式の楽譜を指定して生成することもでき、音源からメロディを採譜して別のスタイルで作り直す「zero-shot cover」や、楽譜、アレンジ、歌詞を変更しながら曲を作り直す仕組みも用意されている。生成音声は48kHzステレオ。出力ファイルはflac。

この「曲を生成して終わり」ではなく、途中の楽譜に触れるところがYuE2の面白いところだと思う。

YuE Studioの画面

これはインストール時の初期設定画面。

これがアプリ画面。左側には曲の設定があり、曲名、曲調・楽器・歌声、歌詞などを入力する。
その下には生成設定があり、曲数、楽曲構成、音質と処理方法、iPhoneのNeural Engine利用、インストゥルメンタル(歌声なし)、最大の長さ、シード値などを設定できる。
さらに、
ABC形式の楽譜
楽譜の使い方
音声ファイルを採譜
鼻歌を録音
といった機能もある。右側には生成した曲が並ぶ。
(カスタマイズしているので、オリジナル画面とは違っていると思います。多分)

曲調の指示は英語のほうが良かった

何曲か作ってみたところ、俺の環境では日本語のスタイルプロンプトはうまく通じなかった。
「ボサノバ」と書いて生成してみたら、なぜか少し中華風になった。
曲調、楽器、歌声などの指示は英語で書いたほうが良さそうだ。
一方、歌詞の自動生成では日本語が通った。
ただ、最初は英語の歌詞を生成してきたので、プロンプトの冒頭に「日本語歌詞」と加えたところ、日本語で生成してくれた。

自動生成された歌詞

[Verse]
風が鳴る、枯れ葉の音
街の影を追う雨
秋の匂いが胸を貫く
君の笑顔が遠ざかる

[Chorus]
忘れたつもりでも
心は叫ぶ季節の悲しみ
言葉の隙間で消えない
君の面影が光る

[Verse]
駅のホームの白い霧
時計の針が凍る瞬間
古びた歌が胸を打つ
手を振る君のシルエット

[Chorus]
忘れたつもりでも
心は叫ぶ季節の悲しみ
言葉の隙間で消えない
君の面影が光る

[Bridge]
季節の波に揺れる心
なぜかまた君を想う
時間が逆らうように
記憶が叫ぶ

[Outro]
空に浮かぶよ、にじの夢
君の声が風に乗る
秋の終わりでまた始まる

一度曲を生成してみて、気になるところは自分で直した。
例えば最初は、「古びた歌が耳を打つ」となっていた。意味は分かるのだが、どうも引っかかったので、「古びた歌が胸を打つ」に変更した。

AIが歌詞を作ってくれても、そのまま使うより、一度歌わせてみて違和感のある部分を直したほうがいい。

「さっきのメロディが良かったのに」がなくなる

YuE2で一番いいと思ったのが、この機能。
生成した曲のメロディが気に入ったら、その曲から生成されたABC楽譜をコピーして、次の生成に使うことができる。
楽器や歌声、音の雰囲気などは多少変わるが、楽譜を元に生成するので、狙ったメロディを引き継ぎやすい。YuE2自体も、生成した設計図を再利用したり、ABC楽譜を指定して生成したりする仕組みを正式に備えている。
これはかなり良い。
音楽生成AIを使っていると、「さっきのはいいメロディだったのに、歌詞を間違えていた」ということがある。ヤキモキしながら試聴していて最後に間違われるとガックリする。
仕方なくもう一度生成すると、今度はまったく違うメロディになってしまう。
あのガチャ問題から救われる。
楽譜そのものを修正することもできるので、音楽に詳しい人ならさらに追い込めると思う。
俺はできない。

ABC楽譜

X:1
T:
M:4/4
L:1/16
Q:1/4=76
V: Vocal clef=treble name=”Vocal Melody” snm=”Vocal”
V: Ins clef=treble name=”Ins Melody” snm=”Inst.”
K:Dm
% intro
V: Vocal
Z|”Dm7″z16|”Bbmaj7″z16|”Dm7″z16|
V: Ins
z8z2A2d2e2|f8z2efg2fe|e2fd8z2dga|b2aa2g2g3f2e2f2|
V: Vocal
“Bbmaj7″z16|
V: Ins
e3d8z4z|
% verse
V: Vocal
“Dm7″e2de2d2A3z4Ac|”Gm7″c3B2A2B3z6|”C7″e2de2d2c2d3c2G2|”Fmaj7″GA3z12|
V: Ins
Z4|
V: Vocal
“Gm7″d2cd2d2e-“A7″ed2e3ef|”Dm7″g2ff2e2f-“Dm7/C”f2z4de|”Bbmaj7″f4f2ed”A7″e2z2e2fe|”Dm7″e2d4z6defg|
V: Ins
Z4|
% chorus
V: Vocal
“Gm7″a4a2ga-“C”ag3efef|”Fmaj7″gfgfg2fg-“Dm7″gfgaf2z2|”Em7b5″defdfgag-“A7″g2z2e2fg-|”Dm7″gff6″Dm7/C”z4defg|
V: Ins
Z4|
V: Vocal
“Bbmaj7″a4d’4″A7″c’2a2g2f2|”Dm7″d8z8|
V: Ins
Z|z12zad’e’|
% interlude
V: Vocal
“Gm7″z8″A7″z8|”Dm7″z16|”Bbmaj7″z8″A7″z8|”Dm7″z16|
V: Ins
f’4ze’2d’^c’4z2a2|g2fg2a2f6Ade|f6efg4e4|d16|
% verse
V: Vocal
“Dm7″e2de2d2e3dA3c2|”Gm7″c3B2A2B3z4zG|”C7″e2de2d2e2d3cG2G|”Fmaj7″G3A4z8z|
V: Ins
Z4|
V: Vocal
“Bbmaj7″d2cd2d2e-“A7″ed2e4z|”Dm7″g2ff2e2f-“Dm7/C”f2z4de|”Bbmaj7″ff3z2df”A7″e4ef2e|”Dm7″d2d6″Dm”z4defg|
V: Ins
Z4|
% chorus
V: Vocal
“Gm7″a4a2ga-“C”ag3efef|”Fmaj7″gfgfg2fg-“Dm7″gfgaf2z2|”Em7b5″defdfgag-“A7″g2z2e2fg-|”Dm7″gff6″Dm7/C”z4defg|
V: Ins
Z4|
V: Vocal
“Bbmaj7″a4d’4″A7″c’2a2g2fd-|”Dm7″d6-dz8z|”Bbmaj7″a2gg2f2g-“C”ga2g3gf|”Am7″g3g2a2f-“Dm7″f3z4z|
V: Ins
Z|z8z2defgac’|Z2|
V: Vocal
“Gm7″a2gg2f2g-“A7″g2gfgf2a-|”Dm7″aga6-“Fmaj7/C”a2z6|”Bbmaj7″a4d’4″A7″c’3a3gf|”Dm7″g2fg-“C6″ga2f-“Bm7b5″f3z3de|
V: Ins
Z4|
V: Vocal
“Bbmaj7″ff4z3″A7″z4ef2d-|”Dm7″d8-d3zdefg|”Gm7″a2ga2a2a-“C”agfg3ef|”Fmaj7″g2gfg2fg-“Dm7″gfgf3z2|
V: Ins
Z4|
V: Vocal
“Gm7″defdfgag-“A7″g2z2e2f2|”Dm7″e3d2cd8-d2-|
V: Ins
Z2|
% outro
V: Vocal
“Bbmaj7″d8-“A7″d6z2|”Dm7″z16|”Bbmaj7″z8″A7″z8|”Dm7″z16|
V: Ins
Z|z4efgag2fg2f3-|f4-fzefg4e4|d16|
V: Vocal
“Dm7″z16|”Dm7″z16|
V: Ins
Z2|

ABC楽譜は、一般的な五線譜とは違い、音符や拍子、コードなどを文字で記述する楽譜形式だ。
最初は暗号のように見えるが、テキストなのでコピーや編集がしやすく、コンピュータで扱うには都合がいいらしい。
せっかくなので、ABC楽譜をChatGPTに渡して五線譜にも変換してもらった。正確かどうかは分からんが。。。

こちらのほうが見慣れているので分かりやすい。読めるわけではないが……。

実際に1曲作ってみた

ほんで、できたのがこれ。曲のプロンプトは、たったこれだけ。

jazz fusion, female vocals, melodious, electric guitar, slow tempo

「jazz fusionか?」と言われると、ちょっと違う気も、いや全然違う気がする。まあ、気に入れば結果オーライで。
次は動画を作るために歌詞をChatGPTに見せて、曲に合わせた画像も生成してもらった。
当初は「30枚作成して」と頼んだのだが、そのときは一度に10枚までと言われた。
最初の10枚は問題なく出力。
ところが次の10枚を頼むと、なぜか複数の場面を1枚にまとめたストーリーボードのような画像が出てきた。
どうやら複数カットをまとめて要求すると、1枚のストーリーボードやコラージュとして解釈されることがあるようだ。
結局、一枚ずつ生成してもらったよ。はあAIだろ。しっかりしろよ。
そのあと、これもCodexで作った動画編集アプリに楽曲と静止画を読み込み、一本の動画にした。

MovieStudio FJ
楽曲生成:YuE2 by M-A-P #YuE2

YuE2は結構いける。ただし、まだ癖はある

実際に使ってみると、YuE2は結構いける。
特に、曲を生成したあとに楽譜を取り出し、それを元にもう一度生成できるのは気に入った。
一方、まだ気になるところもある。
日本語歌詞では漢字の読みを間違えることがあった。
例えば「九月」を「キュウガツ」と歌ったり、「きらめいて。」の最後を落として「きらめい」のように歌ったりする。
これは他の音楽生成AIでもありがちだけど。

曲の長さによっては、最後が唐突に切れてしまうこともあった。
このあたりは、まだ生成したら完成というわけにはいかない。
何度か聴いて、歌詞を直したり、再生成したりする必要はありそうだ。
それでも、メロディやコードを楽譜として残し、そこから作り直せる仕組みはかなり面白い。

YuE2のライセンスについて

ここは少しややこしいので注意。
YuE2のモデル重みは、現在も基本的にCC BY-NC 4.0で公開されている。
ただし、2026年9月16日に「Individual creator permission」が追加され、個人クリエイターについては大きく条件が変わった。
現在の規約では、個人として活動するユーザー、コンテンツクリエイター、ミュージシャンはYuE2を無料で利用し、生成した作品を
公開・配布・販売・ライセンス・収益化することが認められている。

YouTubeなどの商用プラットフォームで収益化したり、クライアントに生成した楽曲を納品したりする場合も、YuE2の権利者に別途商用ライセンス料やロイヤリティを支払う必要はない、と明記されている。
ここで重要なのは、生成した楽曲そのものにCC BY-NC 4.0の「非営利」制限がそのままかかるわけではないという点。
公式ライセンスにも、YuE2で生成したという理由だけで、生成物にモデル重みのNonCommercial制限が適用されるわけではないと記載されている。

また、生成した作品へのYuE2のクレジット表示についても、現在は必須ではなく推奨となっている。
公式は「YuE2」あるいは「#YuE2」を付けることを強く推奨しているが、個人クリエイターが生成物を収益化するための条件ではない。
俺なら分かりやすいので、公開するときは例えば、
Music generated with YuE2 by M-A-P #YuE2
あるいは日本語なら、
楽曲生成:YuE2 by M-A-P #YuE2
くらいは入れておこうと思う。AIで作ったことを隠すのは嫌なので。。。

GitHub – multimodal-art-projection/YuE(MODEL_LICENSE)

ただし、この特例は個人クリエイター向け。
企業がYuE2のモデル重みを商用利用する場合は、別途商用ライセンスについて開発元へ問い合わせる必要がある。モデル重み自体を商用で再配布・販売できるという意味でもない。

また、入力した素材や生成物に第三者の権利が含まれる場合までYuE2のライセンスが保証してくれるわけではない。この点は別の話になる。

使ってみた感想

Sunoのようにプロンプトを書いて曲を出して終わり、という音楽生成AIとは少し方向が違う。(いやSunoは使ったことないのだが…)
YuE2は、生成した途中に楽譜という触れるものが残る。
そこが面白い。
「このメロディは残したい」
「歌詞だけ直したい」
「雰囲気を変えてもう一度作りたい」

そんなときに、全部ガチャを引き直さなくてもいい。
日本語の発音など、まだ気になるところはある。
それでも、自分で生成した曲を後からもう少しいじってみたい人には、かなり遊べる音楽生成AIだと思う。

構成:ChatGPT

よかったらシェアしてね!
  • URLをコピーしました!
  • URLをコピーしました!

コメント

コメントする

CAPTCHA


このサイトはスパムを低減するために Akismet を使っています。コメントデータの処理方法の詳細はこちらをご覧ください。

目次