HappyOysterは、視聴するクリップではなく、歩いて入れる世界を売る

ほとんどの動画モデルはファイルを渡してくる。HappyOysterは、ドアのある部屋を渡してくる。
2026年9月17日、Alibaba Cloud Model Studioのモデルリストに、HappyOysterの名前で3つのワールドモデルが登場した。happyoyster-1.0-adventure、happyoyster-1.0-directing、happyoyster-1.0-actingだ。それぞれテキストプロンプトと最初のフレーム画像を受け取り、通常の意味での動画クリップではないものを返す。出力はリアルタイムでインタラクティブなデジタル世界であり、クライアントが参加できるライブ映像ストリームとして配信される。
この違いは重要だ。生成されたクリップは固定されている。ワールドモデルは状態を持ち、入力に反応し、あなたが今行ったことに基づいて次に来るものを変える。
3つのモード、3つの異なる製品
3つのモードは独立してデプロイされ、それぞれ異なる用途をカバーする。
Adventureは世界探索だ。生成されたシーンに一人称または三人称で入り、自由に動き回れる。WASD移動、カメラ操作、戦闘、乗り物だ。一人称では没入感のある視点で、運転やステルスに適する。三人称ではキャラクター全体が見え、アクションやロールプレイに適する。モデルはフレーム内にあるものを読み取り、存在するオブジェクトに合った遊びを開く。つまり世界は、そこで見つけたものに反応する。

Directingはリアルタイム演出だ。プロンプトまたは構造化された脚本と最初のフレーム画像を入力すると、最大3分の動画をストリーミングする。途中でテキスト指示を注入し、物語の行き先を変えられる。一時停止、巻き戻し、分岐をサポートする。これによりインタラクティブドラマのツールとなり、より商業的には、監督がシーンを前に進めながら、撮り直しなしで方向転換したい映画のプリビズのツールとなる。
Actingはキャラクター演技だ。選んだペルソナスタイルでキャラクターとシーンを生成し、リアルタイムで対面会話を行う。キャラクターは表情、動作、声で応答する。デフォルトは縦9:16のフレームで、16:9もサポートする。一時停止と再開はサポートするが巻き戻しはなく、これは台本のあるシーケンスよりも会話に合っている。
アーキテクチャが誰向けかを教えてくれる
HappyOysterはサーバー側とクライアント側に明確に分かれており、この分割が最も本質を表している。
バックエンドはHappyOyster Open APIを通じてワールドのライフサイクル全体を管理する。標準HTTPS REST上で長期的なプライマリAPIキーを使い、ワールドの作成と管理、認証情報の交換、履歴とアーティファクトの照会を行う。Open APIはモードごとに3つの別々のスイートに分かれている。クライアントはHappyOyster SDKを通じて体験を提供する。SDKは一時APIキーとワンタイムチケットをRTCリアルタイム音声・映像チャネル上で使い、Android、iOS、Webをサポートする。SDKはRTC接続、映像再生、ステータスポーリング、インタラクションコマンドをカプセル化するため、基盤となるリアルタイムプロトコルに触れることはない。
これはプロンプトボックスではなく、インフラの形だ。プライマリキーはサーバー上にのみ存在し、クライアントは短命のチケットを受け取り、全体はAlibaba Cloud Model Studioゲートウェイを通じて認証される。この設計は、ファイルを生成するのではなく製品を出荷することを前提としている。
中国のワールドモデル競争における位置づけ
HappyOysterは真空から現れたわけではない。2026年を通じて、中国の最大手テック企業はそれぞれ異なるワールドモデルの道を推し進めており、その違いは示唆に富む。
ByteDanceはSeed3D 2.0で3Dアセット作成に挑み、画像や動画からPBRテクスチャ付きでパーツ分離可能な3Dモデルを生成することに注力した。用途はコンテンツ制作、産業シミュレーション、仮想シーンだ。TencentはHunyuan 3D World 2.0で3Dアセット制作を推し進め、生成されたアセットがBlenderやUnityに直接インポートできるようオープンに保ち、ゲームやコンテンツパイプラインの障壁を下げた。AlibabaはHappy Oysterでリアルタイムインタラクションの道を選び、ワールド内の移動とライブのテキスト駆動による物語の変更を中心に据えた。Huaweiはまったく別の道を行き、主流の視覚-言語-行動スタックではなく、自動運転向けのワールド-アクションアプローチを支持し、運転、キャビン、シャシーのモデリングを統合した。Geelyは自社車両に特化したワールド行動モデルを構築した。
まとめて読むと、パターンはこうだ。全員が異なる出発点から同じ前提に収束している。つまり、あなたが中で行動できる環境を予測してレンダリングするモデルは、ただ眺めるシーンをレンダリングするモデルよりも有用だという前提だ。違うのは買い手だ。ByteDanceはコンテンツクリエイターに、Tencentはゲームとデザインチームに、Alibabaはインタラクティブエンターテインメントと消費者体験に、自動車メーカーは自社自身に売る。
リアルタイムが強いるトレードオフ
レイテンシ予算内で応答しなければならないシステムは、オフラインレンダラーよりも小さく高速なパスを実行している。これはHappyOysterのバグではなく、このカテゴリの物理だ。リアルタイム世界のシングルパス画質は、同じプロンプトに対してトップのオフライン動画モデルが生成できるものに後れを取る。永続的な価値はピクセル数ではなくインタラクションにある。動かしてシーンを変えられる視聴者は、柔らかいフレームを許す。静止画を比較する視聴者は許さない。
運用コストの層もある。サーバーとSDKとRTCチャネルは、ファイルを返すAPI呼び出しよりも重い統合であり、常時稼働のセッションは分単位で課金される。ワールドを構築することは1つの問題だ。セッションを正当化できるほど長く誰かをその中に留めることは別の問題であり、どのモデルリリースも答えない製品設計の問いだ。
ワールドモデルは実際に何に向いているか
挙げられている用途は、インタラクティブドラマ、映画プリビズ、AIコンパニオン、プレイアブルな世界だ。その中で最初に収益化するのはプリビズかもしれない。リアルタイムでシーンを歩き回り、配信中に方向転換できる監督は、絵コンテでは提供できないものを得る。そして間違ったアイデアのコストは、撮影日から1セッションへと下がる。
コンパニオンとプレイアブルな世界は、より野心的な賭けだ。発話、表情、動きに反応する持続的アイデンティティを持つキャラクターは、チャットボットとは別の製品であり、動画生成器とも別の製品だ。人がその中で時間を過ごしたいと思うかどうかは、まだ未解決の問いだ。
述べておく価値のある限界
正直な制約は、リアルタイム世界は維持するのに依然としてコストがかかり、作られたコンテンツが薄いことだ。生成された環境は動く空間を与えるが、留まる理由は与えない。そしてその理由こそが依然として難しい部分だ。映画プリビズは最も依存度が低い。ユーザーにはすでにそこにいる理由があるからだ。消費者向けの世界は最も依存度が高く、最も実証が進んでいない。
注目すべき点
印象的なデモはほとんど何も教えてくれない。ワールドモデルの試金石は、誰かが人々が戻ってくるものを作るかどうかだ。HappyOysterの3つのモードは開発者に3つの異なる入口を与え、サーバー・クライアント分割は、Alibabaが一度きりの試用ではなく実際のアプリケーションを期待していることを示唆する。追うべき問いは、ワールドモデルの上に載る最初の魅力的な製品がゲームなのか、映画ツールなのか、コンパニオンなのかということだ。その答えが、このカテゴリで作る他のすべての方向性を決めるからだ。
関連記事
AI動画ツールの使いやすさは10点中9点。コンプライアンススコアは別の話
ユーザーはAI動画生成ツールを高く評価している。法務部門はまだ意見を求められていない。
InternLumina-U2、テキスト・画像・動画・3Dを単一の16Bモデルに統合し、2種類のウェイトを公開
タスク一覧は野心的だ。だが公開フォーマットのほうが多くのシグナルを運んでいる。
Luma Ray3 Modifyは演技を保ち、その周囲の世界を再交渉する
AI動画編集で最も難しい問題は、エフェクトではありません。すでに費用をかけて撮影したテイクを台無しにしないことです。
Vidu Q3、参照画像からの動画生成を3製品に分割。それはモデルと同じくらいパッケージングの決断だ。
同じ価格の3つのモデルIDは、マーケティング上の判断というより調達上の決断に近い。