HeyGen Video 1 対 Tavus Griffin:生成された人間の1秒にはどれだけの価値があるのか

9月下旬、同じ市場領域で36時間以内に2つの製品が発表された。どちらも画面上に説得力のある人間を生成する。この組み合わせで最も有用な点は、購入者が両者を選ぶという話ではない。ローンチ時点で購入できたのは片方だけだったからだ。重要なのは、両者の違いが、それぞれ何のために作られたのか、そして合成人間の1秒がそれぞれの場合にどれだけの価値を持つのかを説明していることだ。
HeyGen Videoは9月30日に公開され、10月末まで1秒1セントで提供された。Tavus Griffinは10月1日に発表され、54人中26人の参加者が会話相手を実在の人物だと信じた対面ライブ調査とともに示された。Griffinは申請フォームの先にある選ばれたトラステッドテスターのみ利用可能で、公開識別子もエンドポイントも価格もない。
一方はクリップを売り、もう一方は会話を売る
HeyGen Videoは汎用動画モデルだが、たまたま人間の生成が異常に得意だ。プロンプト単体、プロンプト+画像1枚、またはプロンプト+最大9枚の参照画像、3本の参照動画、3つの参照音声クリップを受け取る。5~15秒のクリップを480pまたは768p、毎秒24フレームで返し、AAC音声には生成された会話、環境音、効果音が含まれる。条件付けを担う3モードがある:テキストから動画、画像から動画、参照から動画で、これが既定である。リクエスト内の未知のフィールドは無視されず拒否され、シードを使えば、一度に1つの条件だけを変えながらショットを再現できる。
これは決定論的な範囲を持つ制作ツールだ。何を要求し、何が返ってきたかを把握でき、再現もできる。
Griffinはそれらの性質をほぼすべて反転させる。参照写真1枚から、720pを320ミリ秒単位、毎秒25フレームで生成し、各チャンクをデコードしながら再生する。指定すべきクリップ長も、返されるファイルもない。継続的な会話モデリングエンジンが音声と映像を取り込み、1秒未満の間隔でやり取りを再評価し、沈黙するか、合図を送るか、あいづちを打つか、発言権を取るかを判断する。その表出制御はストリーミング音声生成器とストリーミング動画生成器を並行して駆動するため、文中で下された判断が同じミニターン内に声と顔へ現れる。
プロンプトを書くのではない。話しかけると、間、そらされた視線、遮りに反応する。だからこそ、どちらも人間を生成するとしても、両者は代替品ではない。HeyGen Videoは、記述された瞬間がどのように見えるかを問われる。Griffinは、次に何が起こるべきかを問われる。
価格設定、そしてそれがなぜ見出しなのか
HeyGenのローンチ価格は1秒1セントで、同社は標準の2セントから50パーセント割引だと説明している。同じページのコスト表は、ローンチプロモーション前の768p・音声ありの1秒あたり定価として脚注付きで3セントとしている。ベンダー自身の資料で、文章と表の間に50パーセントの隔たりがある。HeyGenがAPI価格ページを公開するまでは、安全な解釈として、1セントという数字は実際に提供中なので確認済みであり、10月以降の数字は2~3セントのどこかにある。
1000秒分で計算してみよう。これは10秒クリップ100本分であり、大量利用チームが実際に考える単位だ。HeyGen Videoは10月中なら10ドルになる。10月以降は2セントなら20ドル、表の3セントなら30ドルだ。調整元のベースモデルであるMiniMax H3は1秒8セントなので、同じ1000秒で80ドルになる。Kling 3.0 Proは168ドル、Veo 3.1は400ドルに達する。
この算術が見出しである理由は、破棄率にある。動画生成では、残すクリップが最初に生成したクリップであることはほとんどない。チームは複数テイクを生成し、その大半を捨てる。1秒あたりは安くても6回試行が必要なモデルは、より高価でも1回目か2回目で決まるモデルよりコストが高くつく。HeyGenは事実上、1秒1セントなら反復が高コストな部分ではなくなると賭けている。
注釈付きで受け取るべき数字
Tavusの見出し数字は、54人中26人の参加者が相手を人間だと信じたことだ。これは対照研究からの実際の結果であり、同時に過大に読み取りやすい種類の数字でもある。研究の条件は、実運用の条件ではない。対面実験の参加者は会話をするように仕向けられており、会話を監査するようにはなっていない。好都合な設定で示された、人間として通る48パーセントの成功率は、技術が進歩していることは伝えるが、誰かが検出しようとしたときや、会話が数分ではなく20分続いたときにどう振る舞うかは伝えない。
Griffinを面白くしているのは、欺瞞率ではなくインタラクションモデルだ。話すかどうかをリアルタイムで決め、文中の判断を同じ拍の中で顔に反映するデジタルヒューマンは、動画生成器とは別種の製品だ。それはコールセンター、チューター、コンパニオンアプリ向けのリアルタイムアバターに近い。それらは、価値がクリップではなくループにある市場だ。
Griffinが購入できないことも、小さな但し書きではない。トラステッドテスタープログラムが存在するのは、まさに製品が販売できるほど安定も予測可能でもないからだ。それは妥当な段階ではあるが、今日のHeyGen Videoとの比較は、出荷済み製品と約束の比較でもある。
それぞれが実際に何のためのものか
両者を並べると、市場はきれいに分かれる。
完成したクリップのライブラリが必要なら、それが広告スポット、ソーシャル動画、ローカライズされたマーケティング断片であれ、HeyGen Videoは今日存在するツールであり、スプレッドシートに入れられる価格と、パイプラインを構築できる決定論的な範囲を備えている。
ライブ通話で人のように振る舞い、レンダリングするのではなく応答する何かが必要なら、Griffinがその方向を指しているが、まだ統合できる製品ではない。
より大きな論点は、合成動画がどこへ向かっているかにある。2年間、ベンチマークは単一フレームのリアリズムに関するものだった。今や最前線は時間を通じた振る舞いにある。生成された人物がどのように応答し、記憶し、インタラクション全体を通じて一貫性を保つか、だ。HeyGenは、レンダリングして残すワークフローにおけるコストと信頼性で競争している。Tavusは、インタラクションがそもそもインタラクションのように感じられるかで競争している。両者とも勝てる。同じ1秒を売っているわけではないからだ。
関連記事
Claude Sonnet 5.5は30%安くなった。それはモデルの話ではなく、調達の話だ。
ベンダーの割引主張は通常、代表的なワークロードに対して測定されており、あなたのワークロードは代表的ではない。
HPEが12億ドル相当のハードウェアを売った理由——ネットワークが主役になったから
5つのカテゴリーへの配分が非開示の12億ドル受注は、12億ドルのマージンと同じではない。
次なる一手を4モデル投票で決めるマルウェア
コマンド・アンド・コントロール基盤は、一握りの公開APIと1つのDiscord Webhookだ。
ShopifyはAIエージェントに「購入」ボタンを押させた。それでも係争は加盟店が負う。
エージェントプラットフォームが意図を取り次ぎ、リスクは加盟店が負う。