トランジション・ラボ:250 本の動画が教えてくれた AI 動画のトランジション
250 本以上の AI 動画クリップで、82 種類のトランジションをテストしました。モデルは何も指示しなければ画像を混ぜ、指定した長さを無視し、開始フレームと終了フレームに従います。
Tal Asa ·
82 種類のトランジションをテストした結果、トランジションで難しいのはエフェクトではないことがわかりました。難しいのは入れ替わり、つまり、ある画像が次の画像に変わる瞬間です。
- 研究期間
- 13 日間
- テストクリップ
- 250+
- トランジション
- 82
- 承認したプレビュー
- 81 / 81
- クレジット
- 48,000+
- 主なモデル
- Seedance 2.5
Nodaro のトランジションピッカーは、動画のプロンプトにトランジションを追加します。ホイップパン、マッチカット、液体モーフ、日中→夜の早送りなどです。動画ノードには開始フレームと終了フレームが渡され、そのあいだのすべてをモデルが描きます。
この研究は、単純な確認から始まりました。選んだトランジションは、意図したとおりに本当にモデルへ届いているのか、という確認です。いつもそうだったわけではありません。約 20 種類のトランジションをまとめた最初のリールから、カットに長さを表すフレーズが付いていることがわかったので、そのフレーズを取り除きました。本番環境での次の確認でも、マッチカットではまだ画像が混ざっていました。モデルに届いたプロンプトは、次のとおりです。
プロンプトの翻訳です。モデルには英語の原文を送りました。原文は下にあります。
英語の原文プロンプト
ペースを表すフレーズが、カットにまで紛れ込んでいたのです。モデルは、2 つの画像を互いに溶け合わせました。画像が混ざるカットは、カットではありません。
その 1 つのバグを直す作業が、82 種類すべてのトランジションの研究になりました。最後には、そのすべてについて、生成と評価、そして必要に応じて書き直しを終えていました。
研究を方向づけた 3 つの発見
何も指示しなければ、モデルは 2 つの画像を混ぜます。
プロンプトがそうしない理由を与えない限り、モデルは開始フレームと終了フレームのあいだを、約 1〜1.5 秒のクロスフェードでつなぐ動作に戻ります。カットはディゾルブになり、長さを指定しても、クロスフェードはほとんど変わりません。
入れ替わりに隠れ場所があれば、トランジションはうまくいきます。
スタティックノイズ、黒一色の画面、写真のネガ、液体の波紋など、フレーム全体を覆い隠す 1 つの出来事が、ショットの切り替わりを運びます。エフェクトを描写するだけの表現では、多くの場合、モデルはそのエフェクトの下でクロスフェードしてしまいます。
開始フレームと終了フレームは、言葉と同じくらい結果を左右します。
同じ表現が、ある静止画のペアではきれいなカットになり、別のペアではモーフになりました。多重露光が現れたのは、言葉ではなく静止画を変えたときだけでした。
実際にテストした内容
研究期間は、2026 年 9 月 23 日から 10 月 5 日までの 13 日間でした。250 本以上のテストクリップを生成し、48,000 クレジット以上を使いました。どちらの数字も下限値です。数値を記録したラウンドだけを数えているためです。
すべてのクリップで、同じ設定を使いました。
- Seedance 2.5、画像から動画、480p、4 秒、16:9。
- 開始フレームと終了フレーム、そしてすべてのテイクで共通のフィルムルック。
- 2 つのビート:0〜2 秒の最初のショットと、それに続く、2 つ目のショットを開くトランジション。
82 種類のトランジションを、仕組みによって 9 つのカテゴリに分けました。カテゴリによって、失敗の仕方が異なるためです。
| カテゴリ | 何が起こるか | 例 | トランジション数 |
|---|---|---|---|
| 被写体が物質に変わる | 被写体が霧、砂、水、破片に変わり、再び形を取り戻す | 霧に溶ける、ガラス粉砕、渦巻き変形 | 15 |
| エレメントがフレームを覆う | インク、砂、花びら、煙がフレームを満たす | インクスプラッシュ、砂嵐、煙幕消滅 | 8 |
| 光やレンズの出来事 | 閃光、フレア、レンズのひび | ホワイトフラッシュ、雷光、レンズクラック | 8 |
| 力と衝撃 | 何かがカメラやシーンにぶつかる | 衝撃波、カメラへのパンチ、爆発 | 7 |
| ポータルを抜けるズーム | カメラが瞳、鏡、スクリーンの中へ進む | 瞳へのズーム、鏡へのズーム、扉をくぐる | 11 |
| 定番のフェードとワイプ | 編集室の基本 | クロスディゾルブ、暗転、ワイプ、ホイップパン | 9 |
| アナログと画面のグリッチ | スタティックノイズ、ネガ、乱れた信号 | チャンネル切替、色反転フラッシュ、データモッシュ | 7 |
| カット | 2 つのフレームのあいだで変化が起こる | ハードカット、マッチカット、ジャンプカット、瞬間暗転 | 8 |
| 時間 | 1 つのショットの中で時間が経過する | 日中→夜の早送り、エイジング、巻き戻し | 8 |
82 番目のオプションである自動は、プロンプトに何も追加しないため、クリップはありません。
変えるのは、一度に 1 つだけにしました。比較テストでは、2 つのプロンプトの違いをトランジション自体のテキストだけにし、送信したすべてのプロンプトを、想定したテキストと 1 文字ずつ照合しました。すべてのテイクを、チームのメンバー 1 人が 1〜5 で評価しました。目では見落としがちな点は、自動測定で確認しました。カットが入るフレーム、ブレンドが続く長さ、ワイプが進む向きです。クロスチェックとして、自動の第 2 レビュアーもクリップを採点しました。両者の評価が食い違ったときは、人による評価で決めました。
範囲:統計的なベンチマークではなく、製品開発のための研究
成功率を推定するために、すべてのプロンプトを何度も実行したわけではありません。ほとんどの比較テストは片側 1 テイクずつだったため、2 つのテイクの評価に 1 点の差があっても、それはノイズです。目的は、ピッカーのすべてのトランジションについて、製品に採用できるだけ安定して機能する表現を見つけることでした。テストには、Seedance 2.5、画像から動画、480p、4 秒のクリップ、英語のプロンプトを使いました。この記事で何かが「うまくいった」「失敗した」と書く場合、それはこの一連の実験で起きたことを指します。ほかのモデルでは、振る舞いが異なる場合があります。
名前を書いてから、説明する
以前のピッカーは、「マッチカット」のようなトランジションの名前だけを送り、その意味はモデルが知っているはずだと信頼していました。私たちはこの方法を、名前の後に、トランジションがどう展開するかを 1 行で説明したものを続けて送る方法と比べました。
この方法でテストした 4 つのトランジション、ロール、ガラス粉砕、フリーズフレームジャンプ、マッチカットでは、説明付きの名前が 4 回中 4 回勝ちました。名前だけでは、ガラス粉砕の破片は一度も元の形に戻りませんでした。
そのため現在は、すべてのトランジションが、名前の後にかっこ書きで説明を続けた形になっています。たとえば、ホイップパンは次のとおりです。
プロンプトの翻訳です。モデルには英語の原文を送りました。原文は下にあります。
英語の原文プロンプト
名前は、どのトランジションを指しているかをモデルに伝えます。説明は、フレームが何をすべきかをモデルに伝えます。
ディゾルブし続けたカット
ディゾルブしてしまったマッチカットの話に戻ります。このマッチカットは、3 つのステップで修正しました。
1 つ目に、カットには、タイミングやペースを表すフレーズを一切付けないようにしました。長さや「自然なタイミング」といった言葉は、時間をかけた変化を表すため、カットに付けると、画像が混ざる原因になります。
2 つ目に、現在はすべてのカットが、次の明示的な 1 文で終わります。
プロンプトの翻訳です。モデルには英語の原文を送りました。原文は下にあります。
英語の原文プロンプト
3 つ目に、この文の中の 1 つの単語が重要だとわかりました。気づかれないことを狙ったカットであるシームレスカットで、「abrupt」(急な)という単語を除いた文をテストしました。「abrupt」がないと、カットはディゾルブしました。「abrupt」ありのテイクは 5 点、なしのテイクは 2 点でした。
カットのテストを通じて、この文は効果を保ちました。
カットの項目は、カットのフレームそのものを記述する表現にしたことでも改善しました。瞬間暗転なら、純粋な黒の 1 拍です。ジャンプマッチなら、跳躍の頂点での入れ替わりです。マッチカットなら、その場に保たれた 1 つの形です。このように書き直すと、カットの項目は、古い表現の 80 点中 62 点に対して、80 点中 73 点になりました。瞬間暗転では、古い表現だと黒が 1.46〜1.75 秒続きました。新しい表現では 0.67〜1.12 秒で、1 拍に近くなりました。
カットは 1 フレームです。そのことを明記し、2 つの画像は決して混ざらないと書き、カットには長さもペースも付けません。
指定した長さと、実際の長さは違う
2 つのカットには、もっと穏やかな選択肢を用意したいと考えました。ハードカットの代わりに、短いブレンドを使う方法です。そこで、約 1 秒、2 秒、3 秒のブレンドをモデルに指示し、各テイクを、ミックスの 10〜90% の区間で測定しました。
2 倍の長さを指定しても、2 倍にはなりませんでした。2 秒のブレンドは 1.04〜1.34 秒で、1 秒のブレンドの範囲内に収まりました。2 つのショットからなる 4 秒のクリップでは、文の中でどんな数値を挙げても、モデルは約 1〜1.5 秒のクロスフェードを 1 回作りました。
ブレンドは、一部のカットの性格も変えてしまいました。ジャンプカットでは、男性は、あるフレームではある場所に、次のフレームでは次の場所にいるはずでした。ブレンドの文を加えると、男性は代わりに屋上を跳んで横切りました。マッチカットでは、共通の形がクロスフェードの中で失われました。そのカットらしさを保てたのは、シームレスカットとジャンプマッチだけでした。
失敗短いブレンドを加えたジャンプカット。男性は屋上を跳んで横切ります。このカットは、まさにその動きを避けるためにあります。
承認クリップの終盤に短いブレンドを入れたシームレスカット。約 1.15 秒のきれいなブレンドです。
そのため製品では、ブレンドの長さを「短い」の 1 つだけにし、提供するのもこの 2 つのカットだけにしました。それ以外の長さ、そしてほかの 6 つのカットでのすべての長さでは、ハードカットのままです。
タイミングの頑固さは、ほかの場面でも見られました。鏡へのズームでは、表現にかかわらず、最終ラウンドのすべてのテイクが、約 2.3 秒の時点で鏡の中のシーンを入れ替えました。これは、2 つ目のショットの時間枠が始まるタイミングです。表現によって変わったのは、入れ替わりがどれだけうまく隠れるかだけでした。
タイムラプスのトランジションには、逆の問題がありました。クリップ中盤の短い時間枠に押し込むと、日中→夜の早送りは 1 フレームのジャンプで始まりました。クリップ全体を与えると、光はなめらかに移り変わりました。
トランジションのタイミングを、プロンプト内の数値に頼って決めないでください。開始フレームと終了フレーム、そしてクリップの長さで位置を決め、タイムラプスにはクリップ全体を与えます。
入れ替わりに隠れ場所を与える
隠すことについて最も多くを教えてくれたのは、グリッチのカテゴリでした。このカテゴリの古い表現は、干渉縞、色収差、ピクセルのにじみといったエフェクトを描写していました。モデルは多くの場合、エフェクトを少しだけ描き、その下でクロスフェードしました。
書き直しでは、別のことをしました。どの書き直しも、フレーム全体を覆い隠す出来事を 1 つ置き、ショットの切り替わりをその中に入れました。チャンネル切替には一瞬はじける白黒のスタティックノイズ、色反転フラッシュには写真のネガ、ディスプレイワイプには黒い画面の上で 1 本の線と 1 つの点に縮んでいく映像を与えました。グリッチの 7 項目では、書き直した表現が 35 点中 25 点を取り、古い表現の 35 点中 21 点を上回りました。
勝ち残ったテキストには、共通の形があります。まず出来事、次に「カメラはその場にとどまり、フレーミングは変わらない。」という 1 文、続いて受け渡し、ショットの終わり方、最後にフレーム全体についての 1 文です。色反転フラッシュは、次のとおりです。
プロンプトの翻訳です。モデルには英語の原文を送りました。原文は下にあります。
英語の原文プロンプト
ちらつきには、オフの状態が必要
このルールを証明したのが、ホログラムちらつきでした。最初の 2 つのバージョンは、どちらもちらつかず、クロスフェードしました。「干渉縞」のような質感を表す言葉が生んだのは、ちらつきではなく質感でした。
新しい 2 つのバージョンは、どちらも映像にオフの状態、つまり黒を与えました。1 つ目は、強いフラッシュのあいだに真っ黒な画面へ切れるもので、完全に黒いフレームを 14 枚含む、本物のストロボになりました。2 つ目は、最初のショットをちらつかせながら黒へ消し、明るい走査線で新しいショットを描くものです。走査線はそれ自体が上から下へのワイプになり、ホログラムが実体化していく様子として最もよく伝わりました。製品に採用したのは、2 つ目です。
強いフラッシュのあいだに、映像が黒へ切れます。本当にちらついた唯一のテイクです。
承認走査線が、黒い画面に新しいショットを描きます。製品に採用。
運び役が、主導権を奪ってしまうこともあります。あるとき、光漏れに運ばせる多重露光を書きました。モデルが描いたのは、多重露光ではなく、光漏れのワイプでした。運び役が、トランジションそのものになったのです。
ショットの切り替わりは、フレーム全体を覆い隠す 1 つの出来事の中に隠し、切り替わりがその中で起こることを、最後の文で明記します。
多重露光:決め手は画像だった
多重露光は、この研究で最も難しいトランジションでした。4 ラウンドかかりました。
麦畑の小さな暗い人物と夜の港という最初の静止画のペアで、透けて見えることを表す 4 種類の表現を試しました。フレームごとに測定すると、4 つの表現は実質的に同じ動画を描き、それはただのクロスディゾルブとも同じでした。光漏れを加えると結果は変わりましたが、光漏れのワイプになっただけでした。
突破口が開けたのは、書き直すのをやめて、静止画を見直したときでした。古典的な多重露光には、明るい背景に対する大きなシルエットが必要です。私たちの人物はフレームの高さの約 29% しか占めておらず、夜の港はとても暗いものでした。そこで、新しいペアを作りました。白に近い地に、フレームの高さの 93% を占める真っ黒な横顔を置き、明るい山の湖で終わるペアです。




新しいペアでは、ただのクロスフェードでさえ、少し多重露光のように見えます。暗い人物の内側には湖が見え、白い地の部分は白く飛んでしまうからです。新しい表現は、その上に、確かではあるものの部分的な改善を上乗せしました。この表現は、まず人物の部分が満たされるよう求めます。
プロンプトの翻訳です。モデルには英語の原文を送りました。原文は下にあります。
英語の原文プロンプト
人物の部分が、地の部分よりどれだけ先行するかを測定しました。新しい表現では、人物の部分がミックスで最大 0.31 先行しました。同じペアに「半透明の多重露光」という古い表現を使うと、2 つは足並みをそろえて動き、先行はわずか 0.01 でした。どちらも 1 テイクずつの結果なので、法則ではなく、手がかりと呼ぶにとどめます。
失敗新しいペアに古い表現。人物と地が、クロスフェードのように一緒にフェードします。
承認同じペアにシルエットの表現。2 秒の時点で、お手本どおりの多重露光です。
教訓異なる表現から同じ動画が生まれるなら、変数は言葉ではありません。画像を見てください。
同じ言葉で、2 つの異なる結果
カットの中で最も多くのテイクを要したのは、マッチカットでした。マッチカットは、2 つのショットを韻のように響き合わせます。最初の画像にある 1 つの形が、2 つ目の画像でも同じ位置、同じ大きさに収まるのです。
4 ラウンド、12 を超えるテイクを重ねても、古い表現に勝るものはありませんでした。形に向かってカメラをプッシュインするよう求めると、カメラは毎回プッシュインしましたが、カットは良くなりませんでした。カメラのカタログから借りた表現は最もきれいなカットを生みましたが、ありもしない歯車を描き加え、しかもそれは終了フレームがない場合に限られました。
最終的に勝ったのは、カットのフレームを記述する表現でした。
プロンプトの翻訳です。モデルには英語の原文を送りました。原文は下にあります。
英語の原文プロンプト
屋上にしゃがむ男性から、砂丘を大股で歩いている途中の同じ男性へとカットするペアでは、この表現は、歩く姿が同じ位置、同じ大きさに収まった、きれいな 1 フレームのカットを生みました。古い表現に 5 対 3 で勝ちました。
次に、この表現を 2 つ目の静止画のペア、コインと観覧車で試しました。カットはまったく起きませんでした。コインは膨らんで、中に観覧車が収まったガラスの円盤になり、約 4 分の 3 秒のあいだ、2 つの画像が同じフレームに共存しました。これは、画像を混ぜないという私たち自身のルールを破るものでしたが、見た目は素晴らしいものでした。私たちはこのテイクに 5 点を付け、プレビューに採用しました。
古い表現、コインから観覧車へ。ほぼハードカットですが、コインが観覧車の中心から外れています。
新しい表現、同じペア。カットはなく、コインが観覧車を収めたガラスの円盤になります。
トランジションの表現は、複数の静止画のペアでテストします。表現の確かさは、それをテストした画像の範囲でしか保証されません。
ワイプは、おおむね指定した方向へ進む
現在、ワイプには「方向」の設定があります。選べるのは、「自動」のほか、左から右、右から左、上から下、下から上、そして 2 つの斜め方向です。どの方向を選んでも、変わるのはワイプの説明の中の言葉だけです。
プロンプトの翻訳です。モデルには英語の原文を送りました。原文は下にあります。
英語の原文プロンプト
それぞれの 1 テイク目では、6 つの方向のうち 5 つが、指定した方向へ進みました。左から右だけは右から左へ進みましたが、これは方向を指定しなかったときに、モデルがそのペアで選んだ方向でした。バイト単位で同一の入力で撮り直すと、4 テイク中 2 テイクが指定した方向へ進みました。
失敗左から右を指示したのに、右から左へワイプしました。
承認同じ入力の別のテイク。左から右へ進みました。
ざっと見ただけでは見逃したことを、自動チェックが捉えました。2 つの斜めのワイプは、互いに鏡像になる表現を使っていますが、鏡像のようには描かれませんでした。一方は約 45 度で進み、もう一方は、約 29 度というフレーム自体の対角線に近い角度で進みました。どちらの斜め方向でも、男性のコートが、ほんの一瞬だけワイプの境界を越えてにじみました。
指定した方向に頼る前に、同じ静止画で、方向を指定しないときにモデルが何をするかを確認します。モデル自身の選択に逆らう方向が、最も失敗しやすい方向です。
否定の文はガードレールであり、解決策ではない
ジャンプカットには、特有の失敗がありました。男性は、あるフレームではしゃがんでいて、次のフレームではすでに壁の上に座っているはずでした。3 テイク中 2 テイクで、男性はまず数フレームのあいだ、新しい場所に向かって飛び出しました。
そこで、1 文を加えました。
プロンプトの翻訳です。モデルには英語の原文を送りました。原文は下にあります。
英語の原文プロンプト
その結果、きれいなテイクは、以前の 3 テイク中 1 テイクに対して、3 テイク中 2 テイクになりました。以前の割合のままでも、3 テイク中 2 テイク以上がきれいになることは、偶然だけで約 26% の確率で起こります。そして 3 つ目のテイクは、以前の失敗とまったく同じように、相変わらずぶれて流れていました。
失敗否定の文あり。それでも男性は、壁に向かってぶれて流れます。
承認同じ表現の別のテイク。しゃがんだ姿から、次のフレームでは座った姿になります。
これは、カメラモーション・ラボでわかったことと一致します。まず、望むフレームを記述することです。除外の指示が役立つのは、その上でのわずかな上積みにとどまります。
モデルが無視する言葉
まるで存在しないかのように描かれた文もありました。
- 「同じ強さで止まり」、「はっきりとした 1 拍のあいだ変化しない」はずだった多重露光。ミックスが横ばいになる区間は、ありませんでした。
- シルエットの外側はすべて最初のショットのままにするよう求めた、5 つ目の文。それでも、フレーム全体が一様に移り変わりました。
- テキストには「その後晴れて、太陽が戻る」とあるのに、終了フレームではまだ雨が降っていた天気の変化。どちらのテイクも、最後まで雨のままでした。
- 動きのない開始フレームで、ブロックが「長くにじんだ筋を引いて、フレームを横に滑る」はずだったデータモッシュ。ブロックは、その場で別のブロックに置き換わりました。滑ったものは、何もありませんでした。
映像を紙吹雪のように砕いた草案で、データモッシュにはなっていません。
承認製品に採用した表現。ブロックはブロックとして描かれましたが、にじみを表す言葉は映像に現れませんでした。
テキストとフレームが食い違うときは、フレームが勝ちます。モデルが手元の画像から作れるものを記述します。
古い表現の大半は、すでに正しかった
すべてを書き直すのは簡単だったでしょう。ですが、それは間違いでもあったはずです。
生成する前に、81 個の説明すべてを紙の上で読みました。66 個は問題なさそうで、12 個は書き直しが必要、3 個は判断が必要でした。動画で試すと、最初の書き直しのラウンドで新しい表現が勝ったのは 3 つのトランジションで、古いテキストが持ちこたえたのは 6 つでした。定番のフェードとワイプでは、古い 1 行の説明が、9 項目中 6 項目で 5 点満点中 5 点を取りました。ロールは、変更した 3 つのうちの 1 つです。古い表現では途中まで回転してから戻ってしまいましたが、新しい表現では、「振り戻しなし」のとおり、一方向にだけ回転します。
1 つの単語が、大きな意味を持ちました。シームレスカットには「abrupt」(急な)が必要でした。溶解変形は、「standing」(立っている)を外すと弱くなりました。口へのズームは、「throat」(喉)を外すと良くなりました。
最終的に、82 種類のトランジションのうち 41 種類が新しい表現で製品に入り、残りは元の表現をそのまま使っています。
書き直す前に、既存の表現をそのままテストします。そのうえで、一度に 1 つずつ変えます。
2 つの見た目がどちらも良ければ、両方残す
煙幕消滅は引き分けでした。2 つのバージョンが、異なる見た目で同じ点数を取ったのです。一方は被写体を包み込み、もう一方はフレーム全体を覆います。どちらか 1 つを選ぶ代わりに、両方をスタイルの選択肢として残しました。
「包み込む」。デフォルトの見た目です。
「全面を覆う」。2 つ目の見た目です。
現在、7 つのトランジションにスタイルがあります。煙幕消滅、砂嵐、桜吹雪、オーロラ、庭の開花、瓦礫シャワー、ホワイトフラッシュです。
まだうまくいかないこと
いくつかのトランジションは、解決済みの問題としてではなく、私たちが見つけた最善の表現として製品に入っています。
- 多重露光は、静止画に左右されます。4 ラウンドのどのテイクも、本当の重ね合わせを 0.5 秒保つことはできませんでした。多重露光を成立させるのは、明るい地に置いた、大きく暗いシルエットです。
- 鏡へのズームは、一度も鏡のガラスを通り抜けません。シーンは鏡の中で入れ替わり、その入れ替わりを最もうまく隠すのは液体の波紋です。
- マッチカットは、コインのときのように、静止画のペアによってはモーフになることがあります。
- 砂嵐の「軽い吹き抜け」スタイルは、2 テイク中 1 テイクで一方向に吹き抜けました。もう 1 テイクは、一様な灰色の霧でした。
製品で変わったこと
- トランジションピッカーの 82 種類のトランジションはすべて、このラボでテストした表現を使っています。そのうち 41 種類が変わりました。
- すべてのトランジションが、名前の後に説明が続く形になっています。
- カットには混ざりを防ぐ文が付き、長さやペースは付きません。
- シームレスカットとジャンプマッチでは、カットの代わりに、約 1 秒の「短い」ブレンドを使えます。
- ワイプには「方向」の設定があり、7 つのトランジションにはスタイルがあります。
- Nodaro Studio では、トランジションピッカーで、81 種類のトランジションにプレビュークリップが表示されます。どのクリップも、研究で実際に生成したテイクです。
私たちが残したルール
- トランジションの名前を書き、その後に、フレームが何をするかを書きます。
- カットは 1 フレームです。そのことを明記し、2 つの画像は決して混ざらないと書きます。
- カットには、長さやペースを表すフレーズを付けません。
- トランジションのタイミングを、数値に頼って決めません。4 秒のクリップでは、約 1〜1.5 秒のブレンドが 1 回起こると考えてください。
- ショットの切り替わりは、フレーム全体を覆い隠す 1 つの出来事の中に隠します。
- ちらつきには、オフの状態が必要です。映像が黒に切れると書きます。
- 静止画は、トランジションと一緒に設計します。言葉より、ペアのほうが重要になることがあります。
- 表現は、複数の静止画のペアでテストします。
- テキストと終了フレームが食い違うときは、終了フレームが勝ちます。
- 指定した方向は、方向を指定しないときのモデルの動きと比べて確認します。
- まず、望むフレームを記述します。否定の文は、ガードレールとして扱います。
- タイムラプスのトランジションには、クリップ全体を与えます。
- 2 つの見た目がどちらも良ければ、両方を残します。
- 書き直す前に既存の表現をテストし、一度に 1 つずつ変えます。
わかったこと
当初、私たちはトランジションを、もっと正確に名付けようとしていました。最後には、フレームに何が起こるかを記述するようになっていました。
放っておくと、動画モデルは、最初の画像から最後の画像への最も楽な道、つまりクロスフェードを選びます。トランジションとは、モデルにそうさせないためのものすべてです。言葉は、黒いフレーム、一瞬のスタティックノイズ、波紋といった、切り替わりの隠れ場所を与えることができます。しかし、その隠れ場所が本物らしく見えるかどうかを決めるのは、画像です。湖を収められるシルエットや、カットを担える形です。
そのため今では、トランジションが失敗したとき、2 つの問いを立てます。入れ替わりは、どこに隠れられるのか? そして、静止画はその場所を与えているのか?
ひとことで言うとモデルに、トランジションを求めないでください。入れ替わりに、隠れ場所を与えてください。
トランジション・ラボの研究ノート、2026 年 10 月。このページのクリップはすべて、研究で実際に生成したテイクです。Seedance 2.5 の画像から動画で、480p、4 秒で生成しました。
よくある質問
関連ページ
トランジション
カメラモーション・ラボ:147 本の動画が教えてくれたカメラの動かし方
Seedance 2.5
動画生成
最終更新