GNIT北アメリカがテキストからビデオモデルAIに関するオンラインディスカッションを開催
2026年1月3日

1月2日、GNIT北アメリカのメンバーがテキストからビデオモデルAI、特にOpenAIのSoraについて議論しました。OpenAIは新しいテキストからビデオのAIを発表し、生成的人工知能の大きな進歩を示しました。従来のモデルを基に、このAIは向上したリアリズム、改良された創造的なコントロール、統合された音声機能を提供し、クリエイターや開発者にとって強力なツールとなっています。このシステムはテキストのプロンプトに基づいて短いビデオクリップを生成し、書かれた説明を高品質のビデオコンテンツに変換し、リアルな動き、正確な物理、セリフや効果音を含む同期音声を実現します。
注目すべき特徴は、ユーザーがフェイシャルスキャンと音声サンプリングを通じて自分のデジタル肖像をビデオに挿入できる能力であり、ユニークでパーソナライズされた体験を提供します。このモデルは、シネマティックやフォトリアル、アニメーションやシュールなさまざまな創造的スタイルをサポートしており、ユーザーに物語を語るための広いキャンバスを与えます。
このモデルに付随するソーシャルアプリは、現在、米国とカナダで招待制のシステムを通じてiOSで利用可能です。このアプリはTikTokスタイルのプラットフォームとして機能し、ユーザーはAI生成ビデオを作成、共有、探求できます。また、プライバシーコントロールも含まれており、ユーザーは自分のデジタル肖像を誰が使用できるか管理し、自分の画像や声が新しいコンテンツに含まれるたびに通知を受け取ることができます。
その能力にもかかわらず、このAIは特になりすましやディープフェイクコンテンツに関する倫理的な懸念を引き起こします。OpenAIは、不正使用を防ぐための安全策を講じており、明示的、暴力的、過激派、または自己傷害に関するコンテンツについての制限を含んでいます。しかし、コンテンツのモデレーションには課題が残っており、不正使用のケースが報告されており、慎重な監視の継続的な必要性が浮き彫りになっています。
このAIは現在、ChatGPT PlusおよびProユーザーにアクセス可能で、今後APIを通じてより広範な利用が計画されています。コンパニオンアプリは、OpenAIがモデルとそのアプリケーションの両方を洗練させながら、より多くのiOSユーザーへの展開を徐々に進めています。全体的に、この新しいAIはテキストからビデオ技術の重要な飛躍を示し、リアリズム、パーソナライズ、創造的柔軟性を組み合わせて、複数の産業にわたるコンテンツ制作を変革する可能性を秘めています。
GNIT北アメリカ · originally published on gnit.org.