Home » Blog » トレンド » Seedance 2.5を最大限に使いこなす

Seedance 2.5を最大限に使いこなす

この記事は Seedance 2.5 専用である。2.0 向けの記述とどこが違うかは「Seedance 2.5で実際に何が変わったのか」の章にまとめた。

CineVがSeedanceを語る理由

CineVは、アニメーションを最もうまく作れる生成AIプラットフォームを目指している。この一文を少しひねって読むと、別の意味がひとつ立ち上がる。

Seedanceの公式ドキュメントには次の警告がある。Dreamina Seedance 2.5 and Dreamina Seedance 2.0 series models do not support direct uploads of reference images or videos containing real human faces. 実写の人物の顔が写った画像や映像はReferenceとして投入できない、という意味である。人物を軸にした制作を考えていた者は、ここで一度つまずくことになる。

しかし、この公式の制限をひねって考えてみよう。real human facesではなく、生成されたアニメーションキャラクターを使うAI Animationの領域ならどうか。CineVが掲げるアニメーション志向のAI Creative Platformとしての立ち位置は、まさにこの地点から、Seedanceの潜在能力を余さず引き出す助けになる。

ここにCineVの3Dベースの直感的なconditioningが加わると、もうひとつの結び目がほどける。頭の中には像がはっきりあるのに、言葉ではどうしてもほどけずもどかしい、あの感覚。Seedanceというモデルの性能を引き出すには必ず通らねばならない関門だが、多くの人はここで力尽きる。

では、この記事はCineVの紹介で終わるのか。そうではない。この記事は、CineVの説明に先立って、Seedance familyそのものを正しく理解してもらうために書かれた。

この記事の根拠

開発元がバージョンを重ねる過程で学習データやアラインメント手法をどれだけ変えてきたのかは、外部から確かめる術がない。ただ我々はひとつの仮定を置いて出発した。同じチームが同じ目標に向けて改良を重ねてきたモデル系列であるならば、開発元自身が公開したプロンプトガイドの間にも、バージョンを貫く共通のパターンが残っているはずだ、という仮定である。

この記事は、その仮定を1.0から2.5までの公式ドキュメントに実際に突き合わせて得られた結果である。ByteDanceがBytePlus ModelArkで公開したプロンプトガイド4本とチュートリアル3本をすべて読み通しており、本文に引用した文はいずれもその中に存在する。ここにCineV Creative Teamが実務で蓄積した知見を重ねた。

最も少ない失敗でSeedance 2.5に到達されることを願う。

前提:頭の中に映像がなければならない

Seedance 2.0以降を理解するには、前提をひとつ確実に置いておく必要がある。このモデルの性能を極限まで使うには、モデルを使うあなたの頭の中に、まず「映像」が存在していなければならない。

鶏が先か卵が先か、という話に聞こえるだろう。実際そのとおりである。表現したいsequenceが像として結ばれていなければ、どんな映像を作れと明確に指示する術がない。指示が曖昧であれば、モデルはその空白を任意に埋める。そうして埋められた結果物は、あなたが意図したものではない。

これは好みの問題ではない。2.5の公式ガイドは、プロンプト作成原則の一行目にこう明記している。

Treat Seedance 2.5 as a visual content producer, and write structured prompts with a visual storytelling mindset.

Seedanceを「映像制作者」として扱え、という意味である。制作者には企画が要る。明確な指針と役割設定が与えられたときに最良の表現を出すモデルであるならば、その指針を作る主体は結局あなたである。

頭の中に像がないなら

CineVのストーリーボード機能は、まさにこの地点のために存在する。一行のloglineを入力すれば、sequence全体のハイライトフレームを順に生成してくれる。Contextが不在の状態でContextを組成してくれる道具だと理解すればよい。Seedanceのcapabilityをきちんと引き出したいが、像がまだ曖昧なら、CineVのストーリーボードで先にシーンを具体化してみるのもひとつの方法である。

像をモデルの言語に移す翻訳モジュール

頭の中に像が結ばれたからといって、すぐにプロンプトが出てくるわけではない。その間に翻訳モジュールがひとつ必要になる。

あなたが手にしているのは、完成した一枚か、文章に落とせるsequenceか、それとも散らばった素材か。この三つはそれぞれ別の入口から入る。

以下、各段階を順に見ていく。

Keyframe reference — そのまま再現されるべき一枚

すでに完成したシーンが一枚、手元にあるとしよう。人物もstyleもactingもlightingもcameraも、すべて申し分ない。であれば、その一枚を結果物にそのまま固定すればよい。このとき用いるのがKeyframe referenceである。

Generated visuals align with the keyframes: Input multiple independent images as keyframes, which may include first-frame or last-frame images. The generated video visuals will be relatively strictly aligned with the input images.

複数枚を順に使う場合は、プロンプトの一文目Use Images X to X in order as keyframes.と書けとガイドが明記している。一文目という条件が付いている点を見落としてはならない。

同じ目的を果たす別の経路もある。content.rolefirst_frameまたはlast_frameに指定する方式である。こちらはより強く固定される代わりに代償を伴う。アスペクト比まで固定される。 2.5のガイドは、この場合ratioパラメータはadaptiveでなければならず、他の値は受け付けないと記している。

ここで警告をひとつ添えておきたい。シーン画像は人物・style・acting・lighting・cameraがすべて結合された単位である。そのうちひとつでも気に入らない要素があるなら、その一枚を強制する選択は再考すべきである。気に入らないlightingまで一緒に固定されてしまうからだ。

Context — 文章として確保されたsequence

気に入るシーン画像はないが、頭の中のsequenceははっきりしている、という場合がある。このとき問うべきことはひとつである。そのsequenceを映像ドメインの言語で記述できるか。

記述できるならContextが確保された状態である。記述できないなら、まだそうではない。この区別が重要なのは、Contextが不在のままReferenceから積み始めると、モデルがその断片をどんな原理で組み立てるべきか判断できないからである。

翻訳モジュールがまだないなら

ドメイン言語に移す作業そのものに慣れていない場合もあるだろう。CineVのPrompt Enhance機能がその翻訳モジュールの役割を代行する。あなたが持っている文章を、モデルが理解できる形に変換してくれる。

Reference — Contextの中のすべての主体

Contextが文章であるなら、Referenceはその文章の主語と目的語にあたる。2.5は一回のリクエストで最大50個のReferenceを受け付ける。画像30枚、動画10本、音声10本である。

公式ドキュメントが定義するReferenceの種類は七つである。

公式名称何を参照するか
Subject reference人物・物体・場面・仮想キャラクターの外見的同一性および音声
Motion reference映像から取り出す動きと動的情報
Style reference画像や映像の視覚的スタイル
Audio reference音楽・セリフ・声・トーン・音色
Storyboard reference主体・構図・動作・プロット・場面の展開
Keyframe reference一枚以上の画像をkeyframeとして使用(前節を参照)
3D clay-model reference/rendering3Dクレイモデル映像をMotion referenceとして使用

この七つは機能上の分類である。企画段階で使うには粒度がやや合わない。そこで、2.0のガイドが提示した四つの企画上の役割を併せて置くことを勧める。実際にassetを準備する際にはこちらのほうが手に馴染む。

企画上の役割担うもの
Character anchoring人物の外見を固定する
Scene tone-setting環境とstyleを固定する
Camera movement reference画面言語と動きのリズムを固定する
Rhythmic atmosphere音声で感情と音色を制御する

背景と小道具を別立てにしていないのは、抜け落ちたからではない。公式の分類では、両者はいずれもSubject referenceに属する。ガイドが “a person, object, scene, or virtual character” と明記している。

では何個積むべきか

50個を受け付けるからといって、50個を充当せよという意味ではない。むしろ逆である。2.0のガイドはこう釘を刺している。

It is not recommended to use the full asset limit. Too many assets will make it difficult for the model to judge feature priorities.

同じドキュメントが推奨構成を数値で示している。合計4〜5個。 人物画像1〜2枚、場面画像1枚、カメラムーブメントの映像1本、音声1本である。

2.5の推奨値は項目別にさらに具体的である。Subject referenceを画像で与える場合、1〜8個であれば結果が安定し、9〜12個も試せるが安定性が下がり複数回の試行が必要になることがある、と記されている。音声や映像で与える場合は1〜5個、入力の長さは5〜10秒が適切だとされる。

数値を暗記する必要はない。規則はひとつである。ひとつのassetにひとつの役割。 そして、その役割が本当に必要なassetだけを積む。

最後の点検

ここまで来たら、最後にひとつだけ確認すればよい。

Contextの中のすべての主体がReferenceとして積まれており、それぞれが文章の中で自分の名前で呼ばれているか。

ひとつでも欠ければ、モデルはその空白を任意に埋める。それが失敗の正体である。

Seedance 2.5はCineVで利用できます。

Seedance 2.5で実際に何が変わったのか

ここからが本題である。ただ、本題に入る前に整理しておくことがひとつある。巷に流れている2.5のスペック情報は互いに食い違っている。

ある記事は2.5が4Kを出力すると書き、別の記事は4Kは2.0の話だと反論する。実際にAPIを運用している側は720pだと文書化している。読者の立場からは何を信じるべきか判断がつかない。

混乱の発生源は公式ドキュメントの一文である。2.5のガイドはReferenceの入力上限をこう記している。

Images: Up to 30 images, with resolution up to 4K.

この4Kは入力画像の解像度である。 出力ではない。そして2.5のチュートリアルは出力について正反対に明記している。Seedance 2.5 does not currently support 1080p and 4K resolutions. プラットフォーム全体のチュートリアルもまた、4K出力が可能なモデルはSeedance 2.0のみだと断じている。

公式ドキュメントが実際に定めている2.5の境界は次のとおりである。

項目2.5根拠
単一生成の最大長30秒2.5ガイド 概要
出力解像度720p(1080p・4Kは非対応)2.5チュートリアル
フレームレート24 fpsプラットフォームチュートリアル
Reference総数50個(画像30・動画10・音声10)2.5ガイド
アスペクト比[0.4, 2.5] の範囲で自由2.5ガイド
ネイティブ対応言語10言語以上2.5ガイド

では2.0に比べて実質的に何が改善されたのか。これもまた推測する必要はない。2.5のガイドにはDifferences from Seedance 2.0という節が丸ごとあり、項目はちょうど四つである。

  1. Seedance 2.0 does not respond to timestamps and only responds to shot numbers, while Seedance 2.5 supports integer-second timestamps.
  2. Seedance 2.0 does not recommend using multi-view images as subject references, while Seedance 2.5 supports them.
  3. Seedance 2.0 only supports six fixed output aspect ratios, while Seedance 2.5 can support any output aspect ratio between [0.4, 2.5] by controlling the input assets.
  4. Seedance 2.5 supports MOV output, which better preserves color consistency, brightness consistency, and audio-visual consistency in extension and editing tasks.
  5. Seedance 2.5 divides tasks into two categories based on whether the input reference assets lock the properties of the output video. Seedance 2.0 does not make this distinction.

五番目の項目はドキュメントの別の節に記されているが、性格が同じなのでここに並べた。入力assetが出力の属性をロックするか否かでタスクを二つに分けるというもので、2.0にはなかった区別である。

このうち1番と5番が、この記事の残り半分を占める。 どちらも実務で静かに失敗を生む項目だからである。

公式ガイド4本が共有するひとつの公式

先に立てた仮定を検証する番である。1.0から2.5まで、開発元自身が公開したプロンプトガイドから「プロンプトの公式」にあたる一文だけを抜き出し、並べてみよう。

バージョン公式ドキュメントが明記するプロンプトの公式
1.0 proBeginner: subject+action
1.5 proSubject + Movement + Environment (optional) + Camera movement (optional) + Aesthetic description (optional) + Sound (optional)
2.0 seriesprecise subject + action details + scene/environment + lighting & color tone + camera movement + visual style + image quality + constraints
2.5Subject + Location + Event + Genre/Style + Camera movement...

スロットの数は二つから六つへ、さらに八つに増えたのち五つに減っている。名称も少しずつ違う。Movementがaction detailsになり、やがてEventになる。

しかし順序は四度とも同一である。

主体が最初に来る。その主体が何をするかが二番目。どこで起きるかが三番目。cameraはその後ろである。二年をまたぐ四つのドキュメントを通じて、この配列だけは一度も動かなかった。開発元が意図的に維持したのか、それとも同じデータプールの上でモデルがそう学習されてきた結果なのかは、外部からは判断できない。ただ、四度繰り返されたものを偶然と見るのは難しい。

ここから実務上の結論が出る。どのバージョンを使っていようと、プロンプトで行き詰まったらこの順序に立ち返ればよい。

誰が → 何をするか → どこで → cameraはどう動くか

2.5はここにもう一枚を重ねる。上の公式は2.5ではOne-Sentence Summaryという名の最初のブロックにすぎず、全体は四ブロック構成である。

ブロック役割
Asset Referencing for R2V投入したassetがそれぞれ何を担うかを宣言する
One-Sentence Summary上記の公式。全体を一文で要約する
Detailed Plot DescriptionShotまたはタイムスタンプで区切った区間ごとの記述
Additional Notes全区間で一貫して保つべきもの

ガイドはこの四ブロックを自ら実演した例を載せている。公式ドキュメントの原文そのままである。

Realistic nature documentary style, natural lighting and shadows. On a warm
afternoon, on a grassy slope in the forest, a chubby panda cub rolls down the hill.

The panda has fluffy, realistic black-and-white fur, a small round body, and clumsy,
adorable movements. The scene is a green forest slope. The ground is covered with
grass, moss, clover, soil, small stones, dry branches, and a few small yellow flowers.
Tall tree trunks and dense woods are softly blurred in the background. The camera is a
low-angle medium-wide shot with a slight handheld feel. The framing remains mostly
stable, keeping the panda in frame at all times.

0s-3s: A panda cub lies on a green grassy slope, its body round and chubby. It begins
to slowly roll sideways down the slope with clumsy movements, gently bending the grass
beneath its body. A light breeze passes through, and sunlight filters through the trees
from the upper left, creating dappled light and shadow.

3s-8s: The panda rolls toward the lower right of the frame and gradually comes to a
stop, shifting from lying on its side to lying on its belly. Its round face turns toward
the camera, and its front paws press into the grass. The panda lies in the foreground
grass, adjusts into a comfortable position, slightly raises and lowers its head, and
makes a soft little humming sound.

Low camera position, slight handheld feel, subtly following the panda as it moves toward
the lower right. Natural depth of field: the foreground grass is slightly blurred, the
panda remains clear, and the background forest is softly out of focus. Natural
environmental audio only, including wind, rustling grass, and the soft plop of the panda
rolling. The overall mood is warm, realistic, and natural.

四つの段落がちょうど四ブロックに対応している。第一段落が一文要約、第二段落が固定情報、第三・第四が区間ごとの記述、最終段落が全区間で保つべき事項である。そして、この例が秒単位の区間で時間を分けている点を覚えておきたい。次章の主題である。

ガイドはこの構造を一行でこう要約している。

Treat Seedance 2.5 as a visual content producer, and write structured prompts with a visual storytelling mindset.

先に引用したのと同じ一文である。それが何を要求しているのか、いまなら具体的に見えるはずだ。

秒単位タイムスタンプ — 「Shot番号を使え」という助言はもう正しくない

Seedanceのプロンプトを検索したことがあれば、必ずこの助言に出会っているはずである。秒単位で時間を打つな。Shot 1、Shot 2と順序だけを指示して、ペーシングはモデルに委ねよ。

この助言が間違っていたことはない。2.0まではそうだった。

2.0のガイドが直接そう定めている。

Do not impose strict limits on the duration of each segment; prioritize allowing the model to naturally generate the pacing based on the plot.

同じドキュメントが理由まで明かしている。The model's support for precise timing (such as 0–3 seconds) is unstable, and forcibly limiting duration may lead to abnormal generation results. 精密な時間指定は不安定だから使うな、というわけである。合理的な指針だった。

ところが2.5のガイドは正反対を述べる。

Seedance 2.0 does not respond to timestamps and only responds to shot numbers, while Seedance 2.5 supports integer-second timestamps.

2.0はタイムスタンプに反応しなかった。2.5は整数秒単位のタイムスタンプをサポートする。開発元が自らのドキュメントで明示的にひっくり返したのである。

問題は、この転換が市場に反映されていないことにある。上位に表示されるSeedanceのプロンプトガイドの相当数は2.0の時期に書かれた記事であり、それらはいまだに「秒を使うな」と教えている。同じ発行元が2.0の記事と2.5の記事を並行して運用しながら、互いに矛盾する指針を放置している例さえある。2.5の記事ではタイムスタンプを「例外的に使う手段」に格下げしているのだが、タイムスタンプ制御こそ2.5が掲げた代表的な改善点である。

では2.5では秒をどう使うべきか。ガイドが三つの方式を明記している。

区間指定。 最も基本である。ただし条件がひとつ付く。

Clear time intervals. Pay attention to timeline continuity and avoid gaps such as “0-3s… 5-6s…”.

区間と区間の間に穴を空けるな、という意味である。0-3秒 … 3-7秒 … 7-15秒のように繋げる。

時点指定。 特定の瞬間に出来事を打ち込む。“Quick left sideways transition at the 5-second mark.”

相対時間指定。 絶対時刻ではなく出来事を基準に取る。“John stands there blankly. After 3 seconds, everyone around him shakes their head.”

基準単位は1秒である。ガイドがUse 1-second intervals as the basic unitと明記している。そして限界も併記されている。一秒に三度首を振るような高頻度の動作をタイムスタンプで制御しようとしてはならない。ひとつの区間に出来事を少なく置きすぎるとモデルが自由に作り込み、詰め込みすぎるとカットが過剰に割れるか一部が脱落する。

まとめるとこうなる。秒を使え。ただし秒を精密な編集点と取り違えるな。 タイムスタンプはフレーム単位の編集指示ではなく、出来事に時間を配分する道具である。

一行で

Shot番号はいまも有効である。2.5は両方を受け付ける。ただし「秒を使うと壊れる」という2.0の警告は2.5には当てはまらない。

Referenceの指定と役割の付与

Referenceを投入することと、Referenceが機能することは別の問題である。投入しただけで文章の中で呼ばなければ、モデルはそのassetを何に使うべきか判断できない。

2.0のガイドは主体を宣言する文型をテンプレートとして提供している。

Define [Core_Subject_Features] in <Image/Video_N> as <Subject_N>

ここに条件が付く。Use 2–3 clear and stable static features (such as clothing, hairstyle, appearance, or category) to describe the subject and ensure it can be uniquely identified. 2〜3個の安定した静的特徴で指し示せ、ということである。表情や動作のように変化する要素は識別子になり得ない。

2.5はassetが複数ある場合の対応関係をリストで書くことを勧めている。ガイドが挙げた例はこうした形である。

Images 1-2 are Character 1 and correspond to Audio 1; Images 3-4 are Character 2 and correspond to Audio 2.

Image 1 depicts the protagonist John and uses the voice timbre from Audio 1.

Refer to Image 1 for lighting and filters.

三つ目の例がとりわけ重要である。画像を丸ごと参照するのではなく、照明とフィルターだけに範囲を絞っている。

人物が複数いる場合はラベルを付け、最後までそのラベルだけを使う。ガイドの例が明快である。

Define the tall man in Video 1 as police officer, and define the other short man as thief.

以降、文章全体を通じてその人物は常にpolice officerでありthiefである。「あの男」や「背の高いほう」に呼び替えた瞬間、指示は切れる。同じドキュメントがこの原則を適用した例を併載している。

Define the tall man in Video 1 as police officer, and define the other short man as
thief. The scene is set in a crowded daytime market, with bright sunlight, many fruit
stalls, and dense pedestrian traffic, creating a lively street-market atmosphere.
Thief runs forward in panic through the crowded market, while police officer follows
closely behind at full speed. The two quickly weave through the stalls. A handheld
camera rapidly tracks forward, with slight realistic camera shake, creating a tense
chase atmosphere.

ラベルを定義した文と、そのラベルを使う文が、ひとつのプロンプトの中に続けて置かれている点に注目したい。別途の設定ブロックは作らない。

そして順序が意味を持つ。 2.0のガイドはPlace important assets first: The more an asset requires precise reference, the earlier it should be placed in the prompt.と記している。番号は投入順に従うため、投入順そのものが優先度の宣言になる。

2.5はここにさらに二つを要求する。第一に、何を参照させるのかまで明示せよ。 “Refer to the action of casting the spell in Video 1 and the wrap-around camera movement in Video 2.” 第二に、assetがすでに十分正確であれば、場面を改めて記述するな。 手を上げる、体を回す、といった描写を付け足すことがかえって干渉になる。

映像から動きを取り出す場合の公式の例はこうである。

Refer to the character movements and shot language in Video 1 to create a fight scene
with the character from Image 2 on the left and the character from Image 1 on the right.
Include intense background music.

Video 1から取り出すものをcharacter movements and shot languageに限定し、Image 1Image 2は左右の配置まで指定している。参照範囲と配置をひとつの文に収めた形である。

やってはならないことも明記されている。

It is not recommended to provide mapping information only inside the image itself.

人物画像に名前を書き込み、プロンプトではその名前だけを呼ぶ方式である。キャラクターの取り違えと重複生成の原因になる。

表記法は公式ドキュメント自身が統一できていない

ここで正直に明かしておくべきことがある。2.5のガイドが定めた表記はImage 1 / Video 1 / Audio 1である。ところが同じドキュメントの公式例の中に、四つの表記がすべて登場する。

表記登場箇所
Image 1規定そのものと大半の例
@Image 1編集・拡張の例
@image1Lockedタスクのトリガー例
[Image 1]3D clay-modelの例、asset binding行
<1pic><10pic>3D clay-modelの詳細例

どれかひとつが正解だと断ずる根拠はない。ただし実務上の原則は導き出せる。ひとつのプロンプトの中では一種類に統一すること。 表記を混ぜた瞬間、モデルが同じassetを別物として扱う余地が生まれる。

音声・セリフ・字幕の括弧文法

2.0のガイドは、情報の種類を記号で区別する規約を表として提示している。

情報の種類記号
音楽()(fast-paced rock music is playing in the background)
効果音<>< dog barking can be heard in the distance >
セリフ{}{Hello, world}
字幕【】【Chapter One: Departure】

セリフには条件がひとつ付く。中国語と英語以外の言語であれば、言語を併記しなければならない。says in Japanese {こんにちは}のように書く。

ただし注意すべき点がある。2.5のガイドにはこの表がない。 波括弧{}という表記自体がドキュメント全体に一度も現れない。代わりに2.5は別の仕組みを用意している。

Supports negative control for subtitles. … Supports negative audio control for finer dimensions, including sound effects, background music (BGM), and dialogue.

Do not add subtitles. No BGM; generate only environmental sounds and action sounds. のように否定形で制御する方式である。2.5のガイドは基本原則をUse positive descriptions whenever possibleと置いたうえで、字幕と音声に限って否定指示を許容すると明記している。

では2.5で括弧文法は廃止されたのか。そう断ずる根拠はない。2.5のガイドはSubject referenceMotion referenceAudio referenceStyle referenceの使い方が2.0と同一であり、詳細な例は2.0のドキュメントを参照せよと案内している。ただ、2.5のドキュメントが直接保証しているのは否定制御のほうだという事実は、知ったうえで使うほうがよい。

30秒ワンショットを設計する

2.5の30秒は、2.0の15秒を二倍にしたものではない。ガイドの表現ではpresenting a complete story without multi-segment stitching — 繋ぎ合わせずにひとつの物語を収めよ、ということである。その分だけ設計が要る。

骨格は先に見た四ブロックである。実際の配置はこう流れる。

[1] 一文要約
    Subject + Location + Event + Genre/Style + Camera movement

[2] 固定情報
    人物の外見、空間、カメラの基本設定

[3] 区間ごとの記述
    0-3s: …
    3-8s: …
    8-15s: …

[4] 全区間で保つ事項
    カメラの性向、照明、サウンド、全体のムード

区間を分ける際、2.0が示した順序の規則はいまも有効である。ひとつの区間の中ではカメラの動き → 主体の動作と表情 → 位置の変化 → 音の順に書く。

動作の描写について、2.5は別途の原則を置いている。

Actions: Give priority to general descriptions … Only write specific details for a few memorable actions, and avoid repeating the same actions.

Expressions: Use descriptive sentences and reduce the use of idioms.

動作は大きな塊で書き、印象的なものだけ細部を記せということである。表情は慣用句を減らし記述文で書けとある。2.0のガイドはこの原則をはるかに具体的な表で提供しており、その趣旨は感情をラベルではなく観察可能な身体反応に置き換えよということである。「悲しみ」ではなく lowering the head, shoulders trembling slightly, eyes reddening, fingers unconsciously clutching the corner of clothing のように書く。

カメラ用語は2.5がリストで提供している。画面サイズはextreme wide shot/wide shot/medium shot/medium close-up/close-up、動きはpush in/pull out/pan/track/follow/orbit/dive/pull back/tilt up/handheld shake、アングルはlow angle/overhead shot/first-person perspectiveである。リストにない専門用語を使う場合の規則もある。

For overly niche or technical terms, convert them into [term + descriptive explanation].

用語だけを投げず、説明を添えよということである。Rack focusを使うなら、焦点がどこからどこへ移るのかを併記する。

LockedとUnlocked — リクエストが黙って無視されるとき

2.5が新たに導入した区別を見る番である。これが実務で最も頻繁に、そして最も気づきにくい形で失敗を生む。

症状はたいていこう現れる。16:9で出そうとratioを指定したのに結果物が縦になっている。10秒を要求したのに7秒のものが返ってくる。たしかにパラメータを入れたし、エラーも出なかった。それなのに反映されていない。

原因はタスクの種類である。2.5のガイドの説明はこうだ。

Seedance 2.5 divides tasks into two categories based on whether the input reference assets lock the properties of the output video. Seedance 2.0 does not make this distinction.

Lockedは入力assetが出力のタイムラインにそのまま載る場合である。モデルが入力に合わせるため、アスペクト比が、場合によっては長さまで固定される。Unlockedは入力を意味的な参照としてのみ使うため、アスペクト比と長さを自分で指定できる。

Lockedに該当するタスクは三つである。

タスク固定されるもの要求される値
映像編集アスペクト比 + 長さratio=adaptive, duration=-1
最初/最後のフレーム指定アスペクト比ratio=adaptive(長さは指定可)
映像の拡張アスペクト比ratio=adaptive(長さは指定可)

編集の場合は長さまで固定される。しかも完全に同じになるわけでもない。ガイドはthe output duration may differ slightly from the input, by up to about 0.3 secondsと記している。フレーム処理の仕組み上、遷移区間が一部圧縮されるという説明である。ただし2.5が生成した映像を再び編集の入力に使えば、この差は生じない。

さらに厄介な部分がある。タスクの種類はプロンプトの単語で判定される。 編集として認識されるにはedit videoaddinsertremovedeletemodifyreplacechange toといったトリガーがプロンプトに入っていなければならない。拡張はextend forwardextend backwardcontinuecontinue fromextend the storyである。

つまり意図と異なる単語を使えばモデルがタスクを誤判定し、その結果として想定と違うパラメータ規則が適用される。映像を複数投入した場合はthe model determines which video to edit based on the prompt — どの映像を編集するかもプロンプトが決める。

編集指示の書き方についても、ガイドは原則と例を併せて提供している。原則は何から何へ変えるのかを書けというものである。

Change the man's action from drinking coffee to mopping the floor from 4-6 seconds in Video 1, and leave the rest of the content unchanged.

Editing task: Replace the Asian woman on the right in Video 1 with the Latina woman from Image 1.

一つ目は区間まで指定し、残りは触るなという文を添えている。二つ目はEditing task:という語でタスクの種類を冒頭に打ち込んでいる。トリガー語が確実に入るようにする安全装置と見ることができる。

編集と拡張には出力フォーマットの推奨も付いている。It is recommended to set output_format to mov. 色と明るさ、音と映像の連続性がより良く保たれるという理由である。

症状で覚える

アスペクト比が勝手に変わったならLockedタスクに入っている。長さが0.3秒ずれるなら編集タスクが正常に動作している。指示した編集が丸ごと無視されたなら、トリガー語がなく編集として認識されなかったのである。

Seedance 2.5を実際の制作フローに取り入れる

CineVのStoryboardでシーンを整理し、Prompt Enhanceでプロンプトを整えてみましょう。

アニメーション制作に合わせたプロンプト

ここまでが公式ドキュメントから導いた内容である。これをCineV Creative Teamがアニメーション制作で実際に使う形に移してみよう。以下の例は公式の原則に従っているが、文章そのものは我々が書いたものである。

キャラクター一人を30秒間保持する場合

Use Images 1 to 3 in order as keyframes.

A hooded courier in a rain-soaked neon alley delivers a sealed package,
2D cel-shaded anime, slow push-in.

Subject 1: the courier in a mustard-yellow hooded jacket with a frayed
left sleeve and a cracked visor. Refer to Image 4 for the character design.
Environment refers to Image 5 for the alley's color and signage.

0-6s: Subject 1 walks toward camera through standing water. Camera pushes
in slowly from a wide shot. Reflected signage ripples underfoot.
6-14s: Subject 1 stops, looks down at the package, and adjusts the strap.
Medium shot, camera holds.
14-24s: Subject 1 raises the visor. Close-up. The face stays consistent
with Image 4.
24-30s: Subject 1 turns away and walks into the alley depth. Camera pulls
back to a wide shot.

Throughout: 2D cel-shaded anime with hand-painted backgrounds, cool cyan
and magenta palette, rain ambience and distant traffic only. No BGM.
No subtitles. Keep the character design consistent with Image 4 in every
shot.

このプロンプトで確認すべきは四点である。一文目にkeyframeの宣言が来ている。主体を2〜3個の静的特徴で指し示している。区間が途切れずに繋がっている。そして最後のブロックが全区間で保つ事項をまとめている。いずれも先に引用した公式原則そのままである。

動きだけを別の映像から取る場合

Refer to the fight choreography and camera work in Video 1 to generate a
rooftop duel between Subject 1 and Subject 2.

Subject 1: the silver-haired swordsman in a black high-collar coat,
refer to Image 1.
Subject 2: the masked opponent in red armor plating, refer to Image 2.
Refer to Image 3 for the rooftop environment and its lighting.

Keep the motion timing consistent with Video 1. 2D anime with strong
key-light rim separation.

Refer to … in Video 1という文型は2.0のガイドがMotion referenceのテンプレートとして示したものである。何を参照するかをfight choreography and camera workに絞って書いたのも、2.5の要求に従ったものである。

アニメーション制作においては、冒頭で述べた制限がむしろ有利に働く。実写の人物の顔を投入できないということは、裏を返せば生成されたキャラクターデザインをReferenceとして使う流れが正攻法だという意味である。公式ドキュメントが提示した回避経路のうち一つ目が、まさにそれである。

結果がずれたときの点検順序

失敗にはたいてい決まった原因がある。2.0のガイドのFAQが扱う症状が実務で最も頻繁に出会うものであり、以下はその処方を点検の順序に並べ替えたものである。

キャラクターの顔が途中で変わる。 2.0のガイドはこれをID driftと呼ぶ。処方は顔のクローズアップを一枚、別途用意することである。表情がなく、肩や首や背景といった干渉要素を最小化した正面の顔が最も良い。人物のReferenceは顔のクローズアップ一枚と全身写真一枚があれば十分であり、三面図や多視点画像は推奨されない。

同じ人物が画面に二人現れる。 ガイドはこれをtwin problemと呼び、プロンプトの末尾に付ける全域制約を提供している。Throughout the video, characters with completely identical appearance, clothing, and accessories are prohibited. Do not generate duplicate avatars or a twin effect. 人物が四人を超えると安定性が落ちるという数値も併記されている。

スタイルが途中で逸脱する。 スタイルの制約語を明示的に打ち込む。2Dの日本アニメスタイルなのか3Dなのかを文章で書く。より確実にするなら、Reference画像自体を目標のスタイルに変換してから投入する。

望まない字幕が付く。 Keep it subtitle-freeまたはAvoid generating any text or subtitlesを入れる。2.5であればDo not add subtitles.が公式の例である。なお2.0のガイドは、縦画面が横画面より字幕の生成確率が有意に高いと記している。

拡張のたびに画質が落ちる。 拡張を繰り返し重ねるなというのがガイドの勧告である。高画質の原本をReferenceとして使い、拡張の回数を制御する。

そしてこれらすべてに先立って確認すべきことがひとつある。assetを多く投入しすぎていないか。 2.0のガイドが推奨する総量は4〜5個である。50個を受け付けるというのは上限にすぎず、目標値ではない。

CineVでSeedance 2.5を使う

ここまでがSeedance familyを読み込んで得られるものである。残るのはこれらの原則を実際の制作に移すことだが、その過程で繰り返し足を引っ張る地点が二つある。

頭の中に像が結ばれずContextを作れない場合と、像はあるがドメイン言語に移せない場合である。先にそれぞれストーリーボードPrompt Enhanceに触れた。この二つが翻訳モジュールの前段と後段を担う。

そこにアニメーション志向のプラットフォームという立ち位置が加わる。実写の人物の顔という制限に突き当たらない経路で作業できること、そして3Dベースの直感的なconditioningで「言葉にならない像」を扱えること。冒頭で述べたのがその話である。

最小限の失敗でSeedance 2.5を使いこなせることを願っている。CineVでは現在50%オフキャンペーンを実施中です。

よくある質問

Seedance 2.5のプロンプトで秒単位のタイムスタンプを使ってよいか。 使える。2.5のガイドが整数秒単位のタイムスタンプへの対応を明記している。基準単位は1秒で、区間の間に隙間を空けないことが条件である。

2.0で使っていた「Shot 1, Shot 2」の方式は2.5でも有効か。 有効である。2.5はShot番号とタイムスタンプの両方を受け付ける。ただし「秒を使うと結果が不安定になる」という2.0の警告は2.5には当てはまらない。

Seedance 2.5は4Kに対応しているか。 出力は対応していない。2.5のチュートリアルが1080pと4Kに非対応と明記している。4Kは入力画像の最大解像度であり、4K出力が可能なモデルはSeedance 2.0である。

一度に何秒まで作れるか。 単一生成で最大30秒である。

映像編集の際にアスペクト比と長さを変えられるか。 変えられない。編集はLockedタスクであるためratioadaptiveduration-1でなければならない。出力の長さは入力と最大0.3秒程度ずれることがある。

Referenceは何個まで使えるか。 2.5で合計50個である。画像30枚、動画10本、音声10本。ただし2.0のガイドは合計4〜5個を推奨しており、上限まで埋めるとモデルが優先度を判断しにくくなると警告している。

実写の人物写真をReferenceとして使えるか。 使えない。公式ドキュメントが、実写の人物の顔を含む画像・映像の直接投入に対応していないと明記している。代替として、モデルが生成した結果物、事前に用意されたデジタルキャラクター、権利処理済みの素材の三つを挙げている。

Seedance 2.5の公式プロンプトガイドはどこで読めるか。 BytePlus ModelArkのドキュメントで公開されている。すべて下記にリンクしている。

参照した公式ドキュメント

この記事の引用はすべて下記のドキュメントから採られている。

ドキュメントは継続的に更新される。この記事は2026年8月時点の内容にもとづく。引用した文の権利は各ドキュメントの発行元に帰属する。

Scroll to Top