モデルの選び方
Nodaro で、用途に合った画像、動画、オーディオ、テキストのモデルを選べます。低価格の試作向けモデルからプレミアムな最終レンダリング向けモデルまで、最新のクレジット料金とともに紹介します。
Nodaro では、100 を超える画像、動画、オーディオ、テキストのモデルを実行できます。どのモデルが適しているかは、何を作るか、どれだけ費用をかけたいかによって変わります。このガイドでは、モデルを用途と価格で分類しているので、すべてのモデルページを読まなくても選べます。まず用途別のおすすめから始め、低価格のモデルで試作し、最終レンダリングではプレミアムモデルに切り替えます。このページの表は Nodaro のモデルカタログから読み込まれるので、料金は常に最新です。
用途別のおすすめ
左の列で目的を探し、モデルをクリックすると、その設定、料金、プロンプトのコツを確認できます。
| タイポグラフィ、ロゴ、文字の多い画像に最適 | Nano Banana Pro、GPT Image 2図解や複雑な文字には Nano Banana Pro、ロゴや短いコピーには GPT Image 2 が向いています。 |
| 最安のリアルな画像 | Z-Image、Qwen、Imagen 4 Fast最も安いのは Z-Image です。もう少し品質を上げたいときは Qwen か Imagen4 Fast を使います。 |
| 忠実度が最も高い画像 | Nano Banana Pro、Imagen 4 Ultra、Flux 2 Flex好みのシリーズで選んでください。3 つともプレミアムなティアです。 |
| 画像の編集、スタイル変更 | Flux Kontext Pro、Ideogram Remix、Seedream 5 Pro (I2I)Flux Kontext は人物の同一性を保ちます。Ideogram Remix はキャラクターを認識して変換します。指示に基づく編集には Seedream 5 Pro を使います(低価格な選択肢は 5 Lite です)。 |
| 最高解像度の画像 | Topaz Image Upscale、Nano Banana Pro、GPT Image 2モデルの最上位ティアで生成してから、Topaz で 4x にアップスケールします(Topaz で調整できるのは 1x/2x/4x の倍率だけです)。 |
| 背景の削除、切り抜き | Recraft Remove BG安価で、プロンプトは不要です。 |
| 最もシネマティックな動画 | VEO 3.1 Quality、Kling 3.0、Seedance 2プレミアムなストーリー表現には VEO 3.1 Quality、音楽に合わせた動きには Kling 3.0、リファレンスによる一貫性には Seedance 2 が向いています。 |
| 安価な動画クリップの一括生成 | VEO 3.1 Fast、Wan 2.2 Turbo、Bytedance Lite I2VVEO 3.1 Fast は、ネイティブオーディオ付きで価格と品質のバランスが最も優れています。 |
| 開始フレームと終了フレームを使う動画 | VEO 3.1 Quality、VEO 3.1 Fast、Kling 2.5 Turbo Pro、Hailuo 02 I2V Pro、Hailuo 02 Standard、Seedance 2挙げたモデルはすべて終了フレームに対応しています。VEO では imageUrls[start, end] を使います。 |
| 音楽、歌の生成 | Suno V6、Suno V6 Wild、Suno V6 Mini、Suno v5.5V6 はデフォルトのフラッグシップです。より大胆で予測しにくい結果には V6 Wild、速さを重視するときは V6 Mini を使います。v5.5 / v5 / v4 はそれぞれ独自の持ち味を保っています。料金はすべて同じです。 |
| ボイスオーバー、ナレーション | ElevenLabs v3、ElevenLabs Turbo v2.5v3 は感情を表す [audio tags] に対応しています。シンプルなナレーションには、より安価な Turbo が向いています。 |
| ポートレートをオーディオにリップシンク | Kling Avatar Pro、Kling Avatar Standard、InfiniTalk口の形を最も正確にするなら Pro、解像度を調整するなら InfiniTalk を選びます。 |
| 文字起こし、字幕 | ElevenLabs STT、Incredibly Fast Whisper、Whisper字幕には単語単位のタイムスタンプが必要です。ElevenLabs STT(常に出力)か Incredibly Fast Whisper を使ってください。通常の Whisper はフレーズ単位のセグメントしか返しません。 |
| モーション転送(別の動画の動きで被写体を動かす) | Kling 2.6 Motion Transfer、Kling 3.0 Motion TransferKling 2.6 ベースは安価で、Kling 3.0 はプレミアムです。 |
普段使い、スタンダード、プレミアム
モデルは 3 つの価格帯に分かれます。価格帯は、同じ種類のメディアの中での相対的なものです。画像、動画、オーディオのモデルをそれぞれデフォルト設定での料金で分け、各価格帯にその約 3 分の 1 が入ります。料金が同じモデルは、同じ価格帯に入ります。
| 価格帯 | 用途 |
|---|---|
| 普段使い | 低価格で高速です。試作、試行錯誤、ほとんどの作業に適したデフォルトです。 |
| スタンダード | 手ごろな価格で、品質が一段上がります。 |
| プレミアム | 最高の品質で、価格も最も高くなります。メインのショットや最終レンダリングに使います。 |
メディアの種類をまたいで比べるときは、価格帯の名前ではなくクレジットで比べます。プレミアムの画像モデルでも、プレミアムの動画モデルよりはるかに安価です。
料金はデフォルト設定のものです。以下の各表のクレジットは、モデルのデフォルト設定での料金です。解像度を上げる、クリップを長くする、ネイティブオーディオを付けるなどすると、料金が上がります。料金が請求されるしくみについては、クレジットを参照してください。
画像モデル
| 用途 | モデル | 理由 |
|---|---|---|
| 細部まで描き込んだ画像、画像内の文字、図表 | Nano Banana Pro | 画像生成(Generate Image)ノードのデフォルトです。文字の描画、図表、複雑な構図に最適です。 |
| すばやい試行錯誤と大量の作業 | GPT Image 2.5 Flare | GPT Image 2 より高品質で、所要時間は約半分です。SNS の投稿、キャンペーンのバリエーション、サムネイルに向いています。 |
| ブランドに関わる最終レンダリング | GPT Image 2.5 Sunburst | 時間はかかりますが、より細かく制御でき、細部まで表現できます。パッケージ、図表、製品のレタッチに向いています。 |
| 最も安い試作と絵コンテ | Z-Image、Nano Banana 2 Lite | Z-Image はカタログで最も安いモデルで、使えるアスペクト比は限られています。 |
| 詳細な指示に従わせる | Seedream 5 Pro | Seedream ファミリーの中で、指示への追従性と視覚的な推論が最も優れています。 |
| 被写体を保ったままの編集 | Flux Kontext Pro | 編集やスタイルの変更をしても、被写体のアイデンティティを保ちます。 |
| ロゴ、短いコピー、様式化したイラスト | GPT Image 2、Ideogram V3 | タイポグラフィに優れています。 |
| 最高の解像度 | Topaz Image Upscale | モデルの最高解像度で生成してから、画像を 2 倍または 4 倍にアップスケールします。 |
| 背景の削除 | Recraft Remove BG | 低価格で、プロンプトも不要です。 |
2 つの GPT Image 2.5 モデルで迷ったら、Flare で試作して Sunburst で仕上げます。どちらも料金は同じです。
| モデル | 開発元 | モード | クレジット | 詳細 |
|---|---|---|---|---|
| Z-Image | Tongyi-MAI | テキストから画像 | 2 | カタログで最も安価なモデルです。高速で、スタイライズされた出力になります。選べるアスペクト比は限られています。 |
| Nano Banana 2 Lite | テキストから画像、画像から画像 | 10 | 軽量版の Nano Banana 2(Gemini 3.1 Flash-Lite)で、1K の画像を高速かつ低コストで生成、編集できます。 | |
| GPT Image 2.5 Flare | OpenAI | テキストから画像 | 15 から | 日常使い向けの高速な GPT Image 2.5 で、GPT Image 2 より高品質なうえ、待ち時間は約半分です。2 つある GPT Image 2.5 のうちのデフォルトで、SNS やクリエイター向けのコンテンツ、キャンペーンのバリエーション、サムネイル、すばやい試行錯誤、大量の制作に向いています。 |
| GPT Image 2.5 Sunburst | OpenAI | テキストから画像 | 15 から | 精度重視の GPT Image 2.5 で、生成時間と引き換えに、より細かな制御とディテールの忠実度が得られます。パッケージ、図解、EC 向けのレタッチ、完成度の高いキャンペーン素材など、ブランドに関わる制作や本番の制作に選んでください。 |
| Nano Banana 2 | テキストから画像、画像から画像 | 20 から | 解像度(1K/2K/4K)をネイティブに制御でき、Google 検索の情報も参照できる新しい Nano Banana です。 | |
| Nano Banana Pro | テキストから画像、画像から画像 | 45 から | Nano Banana の最上位モデルで、文字の描画、図解、複雑な構図に最適です。 | |
| Seedream 5 Pro | Bytedance | テキストから画像 | 18 から | フラッグシップの Seedream 5 Pro で、指示への追従性と視覚的な推論が最も優れています。品質は basic が 1K、high が 2K です。 |
| Flux Kontext Pro | Black Forest Labs | テキストから画像、画像編集 | 13 | コンテキストを認識した編集とスタイル転送を行います。編集を重ねても、被写体の同一性をしっかり保ちます。 |
| Ideogram V3 | Ideogram | テキストから画像 | 18 | タイポグラフィとスタイライズされたイラストに優れています。速度と品質に応じたティア(TURBO/BALANCED/QUALITY)があります。 |
| Topaz Image Upscale | Topaz | 画像のアップスケール | 25 から | 1x(画質の向上のみ)、2x、4x で画像を高品質にアップスケールします。本番でそのまま使える出力に最適です。 |
| Recraft Remove BG | Recraft | 背景の削除 | 3 | 画像の背景を削除します。安価なユーティリティです。 |
すべての画像モデルは、画像モデルに掲載しています。
動画モデル
選ぶ前に、モデルのページで 3 つの点を確認します。モデルはネイティブオーディオを生成しますか?どの長さに対応していますか?開始フレームに加えて、終了フレームも受け付けますか?多くの動画モデルは、1 つの名前でテキストから動画と画像から動画の両方に対応しています。動画生成(Generate Video)ノードは、接続したものからモードを選びます。開始フレームがあればその画像をアニメーション化し、なければプロンプトをもとに生成します。
| 用途 | モデル | 理由 |
|---|---|---|
| ほとんどのクリップ | VEO 3.1 Fast | 価格と品質のバランスが最も優れています。ネイティブオーディオ付きで、長さは 4、6、8 秒です。 |
| 大量のクリップを最低価格で | VEO 3.1 Lite、Wan 2.2 Turbo、Bytedance Lite I2V | B ロールのような大量生成向けです。 |
| プレミアムで映画的なショット | VEO 3.1 Quality | ネイティブオーディオと、任意の終了フレームに対応した、プレミアムな物語向けの動画です。 |
| 音楽に合わせた動き | Kling 3.0 | プレミアムな動きで、長さは 3〜15 秒、ネイティブオーディオ付きです。 |
| リファレンス画像による一貫性 | Seedance 2 | リファレンスをもとにした、ネイティブオーディオ付きの動画です。Seedance 2 Mini は低価格版です。 |
| 1 つの長いショット | Seedance 2.5、Wan 3.0 | 1 ショットで最大 30 秒です。 |
| 開始フレームと終了フレーム | VEO 3.1 Quality、VEO 3.1 Fast、Kling 2.5 Turbo Pro、Hailuo 02 I2V Pro、Seedance 2 | いずれも終了フレームに対応しています。 |
| 話すポートレート | Kling Avatar Pro、Kling Avatar Standard、InfiniTalk | Kling Avatar Pro は、口の形を最も正確に再現します。InfiniTalk は解像度を選べます。 |
| 別の動画からの動き | Kling 2.6 Motion Transfer、Kling 3.0 Motion Transfer | Kling 2.6 は低価格な選択肢です。Kling 3.0 はプレミアムです。 |
| よりシャープな最終動画 | Topaz Video Upscale | 高品質なアップスケールと画質の向上です。 |
| モデル | 開発元 | モード | クレジット | 詳細 |
|---|---|---|---|---|
| VEO 3.1 Lite | 画像から動画、テキストから動画 | 75 から | VEO 3.1 Lite は、大量生成に向く、最もコスト効率の良い VEO のティアです。オーディオ付きの 4/6/8 秒のクリップを作り、最初と最後のフレームに対応しています。 | |
| VEO 3.1 Fast | 画像から動画、テキストから動画 | 150 から | VEO 3.1 Fast は VEO 3.1 の安価なティアで、オーディオ付きの 4/6/8 秒のクリップを作ります。ほとんどの用途でバランスの良い選択です。料金は長さに関係なく、1 回の生成ごとに一律です。 | |
| VEO 3.1 Quality | 画像から動画、テキストから動画 | 930 から | Google の VEO 3.1 Quality で、プレミアムなシネマティック動画を作ります。クリップは 4/6/8 秒で、終了フレームを任意で指定でき、ネイティブオーディオに対応しています。リファレンスから動画を作るモードはありません(Fast と Lite のみにあります)。料金は長さに関係なく、1 回の生成ごとに一律です。 | |
| Kling 3.0 | Kuaishou | 画像から動画、テキストから動画 | 270 から | プレミアムな Kling 3.0 で、長さは 3〜15 秒の間で変えられ、ネイティブオーディオに対応し、720P/1080P で出力します。 |
| Seedance 2 Mini | Bytedance | 画像から動画、テキストから動画 | 120 から | Seedance 2 の低価格なティアで、480p/720p のみに対応し、料金は解像度ごとの秒単位です。 |
| Seedance 2 | Bytedance | 画像から動画、テキストから動画 | 230 から | Seedance 2 は、ネイティブオーディオ付きのプレミアムなティアです。料金は解像度ごとの秒単位です。 |
| Seedance 2.5 | Bytedance | 画像から動画、テキストから動画 | 340 から | Seedance 2.5 は、1 ショットで最大 30 秒を生成でき、ネイティブオーディオと幅広いマルチモーダルのリファレンスに対応しています。解像度は 480p/720p/1080p です。 |
| Wan 2.2 Turbo | Alibaba | 画像から動画、テキストから動画 | 100 から | 安価で高速な Wan turbo で、長さは 5 秒です。1 つの ID で、画像から動画とテキストから動画の両方に対応します。 |
| Bytedance Lite I2V | Bytedance | 画像から動画、テキストから動画 | 57 | 終了フレームに対応した、Bytedance の最も安価な動画ティアです。 |
| Kling 2.5 Turbo Pro | Kuaishou | 画像から動画、テキストから動画 | 110 から | より高速な Kling で、低コストで良好な品質が得られます。終了フレームに対応しています。 |
すべての動画モデルは、動画モデルに掲載しています。そのうち Seedance 2.5 と Seedance 2 Fast の 2 つが、カメラの指示にどう従うかについては、Camera Motion Lab を参照してください。
オーディオ、ボイス、音楽のモデル
| 用途 | モデル | 理由 |
|---|---|---|
| 感情のこもったナレーション | ElevenLabs v3 | 感情や間の取り方を指定する、角かっこで囲んだオーディオタグに対応しています。 |
| 低価格でシンプルなナレーション | ElevenLabs Turbo v2.5 | 高速で、より安価です。 |
| 多言語の音声 | ElevenLabs Multilingual v2 | 複数の言語向けに作られています。 |
| 複数の声による会話 | ElevenLabs Dialogue v3 | 台本の各役に声を当てます。 |
| 効果音 | ElevenLabs Sound Effects | テキストのプロンプトから短い効果音を作ります。料金はとても安価です。 |
| 歌と音楽 | Suno V6 | デフォルトです。Suno V6 Wild はより大胆で予測しにくく、Suno V6 Mini はより高速です。Suno のモデルはすべて同じ料金です。 |
| 字幕用の文字起こし | ElevenLabs STT、Incredibly Fast Whisper | 字幕には単語ごとのタイミングが必要で、これらのモデルはそれを返します。Whisper が返すのは、フレーズ単位のタイミングだけです。 |
| モデル | 開発元 | モード | クレジット | 詳細 |
|---|---|---|---|---|
| ElevenLabs v3 | ElevenLabs | テキストから音声 | 30 | テキストから音声を生成する最新の ElevenLabs のモデルで、感情や話すテンポを指定する [audio tags] に対応しています。ElevenLabs の API を直接使います。 |
| ElevenLabs Turbo v2.5 | ElevenLabs | テキストから音声 | 15 | ElevenLabs の API を直接使って、高速かつ安価にテキストから音声を生成します。ナレーションに向いています。 |
| ElevenLabs Multilingual v2 | ElevenLabs | テキストから音声 | 30 | ElevenLabs の API を直接使って、多言語でテキストから音声を生成します。 |
| ElevenLabs Dialogue v3 | ElevenLabs | 複数話者の会話 | 25 | ElevenLabs の API を直接使って複数話者の会話を作るモデルで、台本を渡すと役ごとに声を当てます(既製のボイス、ライブラリのボイス、クローンしたボイスのどれでも使えます)。 |
| ElevenLabs Sound Effects | ElevenLabs | 効果音 | 3 | テキストのプロンプトから短い効果音を生成します。 |
| ElevenLabs STT | ElevenLabs | 文字起こし | 22 | 単語単位のタイムスタンプ(常にオン)、話者の識別、効果音イベントのタグ付きで文字起こしをします。文字起こしを字幕に使うときは、このエンジンを選んでください。 |
| Incredibly Fast Whisper | OpenAI | 文字起こし | 40 | Whisper による高速な文字起こしです。指定すると単語単位のタイムスタンプを返すため、その文字起こしを字幕に使えます。 |
| Whisper | OpenAI | 文字起こし | 40 | Whisper による文字起こしで、返すのはフレーズ単位のセグメントのみ、単語のタイムスタンプはありません。文字起こしや静的な字幕には十分ですが、単語ごとにタイミングを合わせる(キネティックな)字幕には向きません。 |
| Suno V6 | Suno | 音楽 | 30 | Suno V6 は、より自然なボーカルと豊かなディテールで、音楽表現がさらに向上しています。フラッグシップで、デフォルトのモデルです。 |
| Suno V6 Wild | Suno | 音楽 | 30 | Suno V6 Wild は創造性の限界を押し広げ、より大胆で個性的な音楽表現を目指すモデルで、結果のばらつきが大きく、予測しにくくなります。 |
| Suno V6 Mini | Suno | 音楽 | 30 | Suno V6 Mini は、軽量かつ高速で、品質と速度のバランスが取れており、手軽に制作できます。 |
すべてのオーディオモデルは、オーディオモデルに掲載しています。
テキストモデル
プロンプト(Prompt)、脚本生成(Generate Script)、品質チェック(QA Check)など、テキストを書くノードでは、3 つの価格帯の言語モデルを選べます。
| 価格帯 | 用途 | 相対的な価格 |
|---|---|---|
| エコノミー | 大量で単純なテキスト:すばやい下書き、短いプロンプト、チェック。 | 最も安い |
| スタンダード | ほとんどの文章作成と構造化された出力。品質と価格のバランスがとれています。 | 中程度 |
| プレミアム | 最も難しい推論:長い脚本、詳細なシーン計画、丁寧な書き直し。 | 最も高い |
選べるモデルは、ノードによって異なります。ノードの設定パネルに、各選択肢とそのクレジット料金が表示されます。
安く試作し、プレミアムで仕上げる
普段使いのモデルで試作する
低価格のモデルで、低い解像度か短い長さを使ってワークフローを組み立てます。構図、プロンプト、ピッカーが決まるまで、実行を繰り返します。
モデルを 1 つのノードにまとめる
ショットごとにノードをコピーする代わりに、似たショットをリスト(List)から 1 つの生成ノードに渡します。ノードはリストの項目ごとに 1 回ずつ実行されるので、試作用のモデルから最終用のモデルへの切り替えは、1 回の変更で済みます。
1 つのプロバイダー(Provider)ノードを、すべての画像生成ノード、またはすべての動画生成ノードや動画生成 Pro(Generate Video Pro)ノードの設定入力に接続することもできます。そうすると、プロバイダーノードがそれらすべてのモデルを設定します。
最終版をレンダリングする
プレミアムモデルか高い解像度に切り替えて、もう一度実行します。ワークフローの残りにクレジットを使う前に、結果を試作と比べます。
ヒント
- 画像内の文字には、適したモデルを使います。看板、ラベル、文字入りのポスターには、Nano Banana Pro か GPT Image 2 を使ってください。
- 先に動画の機能を確認します。ネイティブオーディオのないモデルでは、別途ボイスや音楽のトラックが必要です。終了フレームに対応していないモデルでは、あらかじめ決めた最後のフレームで終えることはできません。
- やり直しの費用を抑えます。普段使いのモデルでの試作は、プレミアムでの実行の数分の一の料金なので、試行錯誤はそちらで行ってください。
よくある質問
関連ページ
Nodaro の AI モデル
クレジット
画像生成
動画生成
リストとバッチ処理
最終更新