Nodaro ドキュメント
ドキュメントノードリファレンスモデルAI エージェント(MCP)開発者向けセルフホスティングリサーチ
ガイド

モデルの選び方

Nodaro で、用途に合った画像、動画、オーディオ、テキストのモデルを選べます。低価格の試作向けモデルからプレミアムな最終レンダリング向けモデルまで、最新のクレジット料金とともに紹介します。

Nodaro では、100 を超える画像、動画、オーディオ、テキストのモデルを実行できます。どのモデルが適しているかは、何を作るか、どれだけ費用をかけたいかによって変わります。このガイドでは、モデルを用途と価格で分類しているので、すべてのモデルページを読まなくても選べます。まず用途別のおすすめから始め、低価格のモデルで試作し、最終レンダリングではプレミアムモデルに切り替えます。このページの表は Nodaro のモデルカタログから読み込まれるので、料金は常に最新です。

用途別のおすすめ

左の列で目的を探し、モデルをクリックすると、その設定、料金、プロンプトのコツを確認できます。

タイポグラフィ、ロゴ、文字の多い画像に最適Nano Banana Pro、GPT Image 2図解や複雑な文字には Nano Banana Pro、ロゴや短いコピーには GPT Image 2 が向いています。
最安のリアルな画像Z-Image、Qwen、Imagen 4 Fast最も安いのは Z-Image です。もう少し品質を上げたいときは Qwen か Imagen4 Fast を使います。
忠実度が最も高い画像Nano Banana Pro、Imagen 4 Ultra、Flux 2 Flex好みのシリーズで選んでください。3 つともプレミアムなティアです。
画像の編集、スタイル変更Flux Kontext Pro、Ideogram Remix、Seedream 5 Pro (I2I)Flux Kontext は人物の同一性を保ちます。Ideogram Remix はキャラクターを認識して変換します。指示に基づく編集には Seedream 5 Pro を使います(低価格な選択肢は 5 Lite です)。
最高解像度の画像Topaz Image Upscale、Nano Banana Pro、GPT Image 2モデルの最上位ティアで生成してから、Topaz で 4x にアップスケールします(Topaz で調整できるのは 1x/2x/4x の倍率だけです)。
背景の削除、切り抜きRecraft Remove BG安価で、プロンプトは不要です。
最もシネマティックな動画VEO 3.1 Quality、Kling 3.0、Seedance 2プレミアムなストーリー表現には VEO 3.1 Quality、音楽に合わせた動きには Kling 3.0、リファレンスによる一貫性には Seedance 2 が向いています。
安価な動画クリップの一括生成VEO 3.1 Fast、Wan 2.2 Turbo、Bytedance Lite I2VVEO 3.1 Fast は、ネイティブオーディオ付きで価格と品質のバランスが最も優れています。
開始フレームと終了フレームを使う動画VEO 3.1 Quality、VEO 3.1 Fast、Kling 2.5 Turbo Pro、Hailuo 02 I2V Pro、Hailuo 02 Standard、Seedance 2挙げたモデルはすべて終了フレームに対応しています。VEO では imageUrls[start, end] を使います。
音楽、歌の生成Suno V6、Suno V6 Wild、Suno V6 Mini、Suno v5.5V6 はデフォルトのフラッグシップです。より大胆で予測しにくい結果には V6 Wild、速さを重視するときは V6 Mini を使います。v5.5 / v5 / v4 はそれぞれ独自の持ち味を保っています。料金はすべて同じです。
ボイスオーバー、ナレーションElevenLabs v3、ElevenLabs Turbo v2.5v3 は感情を表す [audio tags] に対応しています。シンプルなナレーションには、より安価な Turbo が向いています。
ポートレートをオーディオにリップシンクKling Avatar Pro、Kling Avatar Standard、InfiniTalk口の形を最も正確にするなら Pro、解像度を調整するなら InfiniTalk を選びます。
文字起こし、字幕ElevenLabs STT、Incredibly Fast Whisper、Whisper字幕には単語単位のタイムスタンプが必要です。ElevenLabs STT(常に出力)か Incredibly Fast Whisper を使ってください。通常の Whisper はフレーズ単位のセグメントしか返しません。
モーション転送(別の動画の動きで被写体を動かす)Kling 2.6 Motion Transfer、Kling 3.0 Motion TransferKling 2.6 ベースは安価で、Kling 3.0 はプレミアムです。

普段使い、スタンダード、プレミアム

モデルは 3 つの価格帯に分かれます。価格帯は、同じ種類のメディアの中での相対的なものです。画像、動画、オーディオのモデルをそれぞれデフォルト設定での料金で分け、各価格帯にその約 3 分の 1 が入ります。料金が同じモデルは、同じ価格帯に入ります。

価格帯用途
普段使い低価格で高速です。試作、試行錯誤、ほとんどの作業に適したデフォルトです。
スタンダード手ごろな価格で、品質が一段上がります。
プレミアム最高の品質で、価格も最も高くなります。メインのショットや最終レンダリングに使います。

メディアの種類をまたいで比べるときは、価格帯の名前ではなくクレジットで比べます。プレミアムの画像モデルでも、プレミアムの動画モデルよりはるかに安価です。

料金はデフォルト設定のものです。以下の各表のクレジットは、モデルのデフォルト設定での料金です。解像度を上げる、クリップを長くする、ネイティブオーディオを付けるなどすると、料金が上がります。料金が請求されるしくみについては、クレジットを参照してください。

画像モデル

用途モデル理由
細部まで描き込んだ画像、画像内の文字、図表Nano Banana Pro画像生成(Generate Image)ノードのデフォルトです。文字の描画、図表、複雑な構図に最適です。
すばやい試行錯誤と大量の作業GPT Image 2.5 FlareGPT Image 2 より高品質で、所要時間は約半分です。SNS の投稿、キャンペーンのバリエーション、サムネイルに向いています。
ブランドに関わる最終レンダリングGPT Image 2.5 Sunburst時間はかかりますが、より細かく制御でき、細部まで表現できます。パッケージ、図表、製品のレタッチに向いています。
最も安い試作と絵コンテZ-Image、Nano Banana 2 LiteZ-Image はカタログで最も安いモデルで、使えるアスペクト比は限られています。
詳細な指示に従わせるSeedream 5 ProSeedream ファミリーの中で、指示への追従性と視覚的な推論が最も優れています。
被写体を保ったままの編集Flux Kontext Pro編集やスタイルの変更をしても、被写体のアイデンティティを保ちます。
ロゴ、短いコピー、様式化したイラストGPT Image 2、Ideogram V3タイポグラフィに優れています。
最高の解像度Topaz Image Upscaleモデルの最高解像度で生成してから、画像を 2 倍または 4 倍にアップスケールします。
背景の削除Recraft Remove BG低価格で、プロンプトも不要です。

2 つの GPT Image 2.5 モデルで迷ったら、Flare で試作して Sunburst で仕上げます。どちらも料金は同じです。

モデル開発元モードクレジット詳細
Z-ImageTongyi-MAIテキストから画像2カタログで最も安価なモデルです。高速で、スタイライズされた出力になります。選べるアスペクト比は限られています。
Nano Banana 2 LiteGoogleテキストから画像、画像から画像10軽量版の Nano Banana 2(Gemini 3.1 Flash-Lite)で、1K の画像を高速かつ低コストで生成、編集できます。
GPT Image 2.5 FlareOpenAIテキストから画像15 から日常使い向けの高速な GPT Image 2.5 で、GPT Image 2 より高品質なうえ、待ち時間は約半分です。2 つある GPT Image 2.5 のうちのデフォルトで、SNS やクリエイター向けのコンテンツ、キャンペーンのバリエーション、サムネイル、すばやい試行錯誤、大量の制作に向いています。
GPT Image 2.5 SunburstOpenAIテキストから画像15 から精度重視の GPT Image 2.5 で、生成時間と引き換えに、より細かな制御とディテールの忠実度が得られます。パッケージ、図解、EC 向けのレタッチ、完成度の高いキャンペーン素材など、ブランドに関わる制作や本番の制作に選んでください。
Nano Banana 2Googleテキストから画像、画像から画像20 から解像度(1K/2K/4K)をネイティブに制御でき、Google 検索の情報も参照できる新しい Nano Banana です。
Nano Banana ProGoogleテキストから画像、画像から画像45 からNano Banana の最上位モデルで、文字の描画、図解、複雑な構図に最適です。
Seedream 5 ProBytedanceテキストから画像18 からフラッグシップの Seedream 5 Pro で、指示への追従性と視覚的な推論が最も優れています。品質は basic が 1K、high が 2K です。
Flux Kontext ProBlack Forest Labsテキストから画像、画像編集13コンテキストを認識した編集とスタイル転送を行います。編集を重ねても、被写体の同一性をしっかり保ちます。
Ideogram V3Ideogramテキストから画像18タイポグラフィとスタイライズされたイラストに優れています。速度と品質に応じたティア(TURBO/BALANCED/QUALITY)があります。
Topaz Image UpscaleTopaz画像のアップスケール25 から1x(画質の向上のみ)、2x、4x で画像を高品質にアップスケールします。本番でそのまま使える出力に最適です。
Recraft Remove BGRecraft背景の削除3画像の背景を削除します。安価なユーティリティです。

すべての画像モデルは、画像モデルに掲載しています。

動画モデル

選ぶ前に、モデルのページで 3 つの点を確認します。モデルはネイティブオーディオを生成しますか?どの長さに対応していますか?開始フレームに加えて、終了フレームも受け付けますか?多くの動画モデルは、1 つの名前でテキストから動画と画像から動画の両方に対応しています。動画生成(Generate Video)ノードは、接続したものからモードを選びます。開始フレームがあればその画像をアニメーション化し、なければプロンプトをもとに生成します。

用途モデル理由
ほとんどのクリップVEO 3.1 Fast価格と品質のバランスが最も優れています。ネイティブオーディオ付きで、長さは 4、6、8 秒です。
大量のクリップを最低価格でVEO 3.1 Lite、Wan 2.2 Turbo、Bytedance Lite I2VB ロールのような大量生成向けです。
プレミアムで映画的なショットVEO 3.1 Qualityネイティブオーディオと、任意の終了フレームに対応した、プレミアムな物語向けの動画です。
音楽に合わせた動きKling 3.0プレミアムな動きで、長さは 3〜15 秒、ネイティブオーディオ付きです。
リファレンス画像による一貫性Seedance 2リファレンスをもとにした、ネイティブオーディオ付きの動画です。Seedance 2 Mini は低価格版です。
1 つの長いショットSeedance 2.5、Wan 3.01 ショットで最大 30 秒です。
開始フレームと終了フレームVEO 3.1 Quality、VEO 3.1 Fast、Kling 2.5 Turbo Pro、Hailuo 02 I2V Pro、Seedance 2いずれも終了フレームに対応しています。
話すポートレートKling Avatar Pro、Kling Avatar Standard、InfiniTalkKling Avatar Pro は、口の形を最も正確に再現します。InfiniTalk は解像度を選べます。
別の動画からの動きKling 2.6 Motion Transfer、Kling 3.0 Motion TransferKling 2.6 は低価格な選択肢です。Kling 3.0 はプレミアムです。
よりシャープな最終動画Topaz Video Upscale高品質なアップスケールと画質の向上です。
モデル開発元モードクレジット詳細
VEO 3.1 LiteGoogle画像から動画、テキストから動画75 からVEO 3.1 Lite は、大量生成に向く、最もコスト効率の良い VEO のティアです。オーディオ付きの 4/6/8 秒のクリップを作り、最初と最後のフレームに対応しています。
VEO 3.1 FastGoogle画像から動画、テキストから動画150 からVEO 3.1 Fast は VEO 3.1 の安価なティアで、オーディオ付きの 4/6/8 秒のクリップを作ります。ほとんどの用途でバランスの良い選択です。料金は長さに関係なく、1 回の生成ごとに一律です。
VEO 3.1 QualityGoogle画像から動画、テキストから動画930 からGoogle の VEO 3.1 Quality で、プレミアムなシネマティック動画を作ります。クリップは 4/6/8 秒で、終了フレームを任意で指定でき、ネイティブオーディオに対応しています。リファレンスから動画を作るモードはありません(Fast と Lite のみにあります)。料金は長さに関係なく、1 回の生成ごとに一律です。
Kling 3.0Kuaishou画像から動画、テキストから動画270 からプレミアムな Kling 3.0 で、長さは 3〜15 秒の間で変えられ、ネイティブオーディオに対応し、720P/1080P で出力します。
Seedance 2 MiniBytedance画像から動画、テキストから動画120 からSeedance 2 の低価格なティアで、480p/720p のみに対応し、料金は解像度ごとの秒単位です。
Seedance 2Bytedance画像から動画、テキストから動画230 からSeedance 2 は、ネイティブオーディオ付きのプレミアムなティアです。料金は解像度ごとの秒単位です。
Seedance 2.5Bytedance画像から動画、テキストから動画340 からSeedance 2.5 は、1 ショットで最大 30 秒を生成でき、ネイティブオーディオと幅広いマルチモーダルのリファレンスに対応しています。解像度は 480p/720p/1080p です。
Wan 2.2 TurboAlibaba画像から動画、テキストから動画100 から安価で高速な Wan turbo で、長さは 5 秒です。1 つの ID で、画像から動画とテキストから動画の両方に対応します。
Bytedance Lite I2VBytedance画像から動画、テキストから動画57終了フレームに対応した、Bytedance の最も安価な動画ティアです。
Kling 2.5 Turbo ProKuaishou画像から動画、テキストから動画110 からより高速な Kling で、低コストで良好な品質が得られます。終了フレームに対応しています。

すべての動画モデルは、動画モデルに掲載しています。そのうち Seedance 2.5 と Seedance 2 Fast の 2 つが、カメラの指示にどう従うかについては、Camera Motion Lab を参照してください。

オーディオ、ボイス、音楽のモデル

用途モデル理由
感情のこもったナレーションElevenLabs v3感情や間の取り方を指定する、角かっこで囲んだオーディオタグに対応しています。
低価格でシンプルなナレーションElevenLabs Turbo v2.5高速で、より安価です。
多言語の音声ElevenLabs Multilingual v2複数の言語向けに作られています。
複数の声による会話ElevenLabs Dialogue v3台本の各役に声を当てます。
効果音ElevenLabs Sound Effectsテキストのプロンプトから短い効果音を作ります。料金はとても安価です。
歌と音楽Suno V6デフォルトです。Suno V6 Wild はより大胆で予測しにくく、Suno V6 Mini はより高速です。Suno のモデルはすべて同じ料金です。
字幕用の文字起こしElevenLabs STT、Incredibly Fast Whisper字幕には単語ごとのタイミングが必要で、これらのモデルはそれを返します。Whisper が返すのは、フレーズ単位のタイミングだけです。
モデル開発元モードクレジット詳細
ElevenLabs v3ElevenLabsテキストから音声30テキストから音声を生成する最新の ElevenLabs のモデルで、感情や話すテンポを指定する [audio tags] に対応しています。ElevenLabs の API を直接使います。
ElevenLabs Turbo v2.5ElevenLabsテキストから音声15ElevenLabs の API を直接使って、高速かつ安価にテキストから音声を生成します。ナレーションに向いています。
ElevenLabs Multilingual v2ElevenLabsテキストから音声30ElevenLabs の API を直接使って、多言語でテキストから音声を生成します。
ElevenLabs Dialogue v3ElevenLabs複数話者の会話25ElevenLabs の API を直接使って複数話者の会話を作るモデルで、台本を渡すと役ごとに声を当てます(既製のボイス、ライブラリのボイス、クローンしたボイスのどれでも使えます)。
ElevenLabs Sound EffectsElevenLabs効果音3テキストのプロンプトから短い効果音を生成します。
ElevenLabs STTElevenLabs文字起こし22単語単位のタイムスタンプ(常にオン)、話者の識別、効果音イベントのタグ付きで文字起こしをします。文字起こしを字幕に使うときは、このエンジンを選んでください。
Incredibly Fast WhisperOpenAI文字起こし40Whisper による高速な文字起こしです。指定すると単語単位のタイムスタンプを返すため、その文字起こしを字幕に使えます。
WhisperOpenAI文字起こし40Whisper による文字起こしで、返すのはフレーズ単位のセグメントのみ、単語のタイムスタンプはありません。文字起こしや静的な字幕には十分ですが、単語ごとにタイミングを合わせる(キネティックな)字幕には向きません。
Suno V6Suno音楽30Suno V6 は、より自然なボーカルと豊かなディテールで、音楽表現がさらに向上しています。フラッグシップで、デフォルトのモデルです。
Suno V6 WildSuno音楽30Suno V6 Wild は創造性の限界を押し広げ、より大胆で個性的な音楽表現を目指すモデルで、結果のばらつきが大きく、予測しにくくなります。
Suno V6 MiniSuno音楽30Suno V6 Mini は、軽量かつ高速で、品質と速度のバランスが取れており、手軽に制作できます。

すべてのオーディオモデルは、オーディオモデルに掲載しています。

テキストモデル

プロンプト(Prompt)、脚本生成(Generate Script)、品質チェック(QA Check)など、テキストを書くノードでは、3 つの価格帯の言語モデルを選べます。

価格帯用途相対的な価格
エコノミー大量で単純なテキスト:すばやい下書き、短いプロンプト、チェック。最も安い
スタンダードほとんどの文章作成と構造化された出力。品質と価格のバランスがとれています。中程度
プレミアム最も難しい推論:長い脚本、詳細なシーン計画、丁寧な書き直し。最も高い

選べるモデルは、ノードによって異なります。ノードの設定パネルに、各選択肢とそのクレジット料金が表示されます。

安く試作し、プレミアムで仕上げる

普段使いのモデルで試作する

低価格のモデルで、低い解像度か短い長さを使ってワークフローを組み立てます。構図、プロンプト、ピッカーが決まるまで、実行を繰り返します。

モデルを 1 つのノードにまとめる

ショットごとにノードをコピーする代わりに、似たショットをリスト(List)から 1 つの生成ノードに渡します。ノードはリストの項目ごとに 1 回ずつ実行されるので、試作用のモデルから最終用のモデルへの切り替えは、1 回の変更で済みます。

1 つのプロバイダー(Provider)ノードを、すべての画像生成ノード、またはすべての動画生成ノードや動画生成 Pro(Generate Video Pro)ノードの設定入力に接続することもできます。そうすると、プロバイダーノードがそれらすべてのモデルを設定します。

最終版をレンダリングする

プレミアムモデルか高い解像度に切り替えて、もう一度実行します。ワークフローの残りにクレジットを使う前に、結果を試作と比べます。

promptリスト3 つのシーンのプロンプト画像生成3 回実行
3 つのシーンのプロンプトを持つリストが、1 つの画像生成ノードを動かします。そのため、試作の実行と最終の実行の違いは、モデルの変更 1 回だけです。

ヒント

  • 画像内の文字には、適したモデルを使います。看板、ラベル、文字入りのポスターには、Nano Banana Pro か GPT Image 2 を使ってください。
  • 先に動画の機能を確認します。ネイティブオーディオのないモデルでは、別途ボイスや音楽のトラックが必要です。終了フレームに対応していないモデルでは、あらかじめ決めた最後のフレームで終えることはできません。
  • やり直しの費用を抑えます。普段使いのモデルでの試作は、プレミアムでの実行の数分の一の料金なので、試行錯誤はそちらで行ってください。

よくある質問

最終更新

目次