新興AI動画モデル Seedance 2.5・MiniMax H3・Wan 3.0 の比較
動画生成AIモデルである Seedance 2.5、MiniMax H3、Wan 3.0 の性能や特徴について比較検証が行われている。それぞれのモデルの実用性や投資対効果が評価されている。
Google News (中国AI企業) ・ 2026-09-05
画像・動画生成 に関する AI ニュースを新しい順に 382 件。3 時間おきに自動収集し、AI が要約しています。
動画生成AIモデルである Seedance 2.5、MiniMax H3、Wan 3.0 の性能や特徴について比較検証が行われている。それぞれのモデルの実用性や投資対効果が評価されている。
Google News (中国AI企業) ・ 2026-09-05
AI動画編集ツール「Katto」が公式MCP(Model Context Protocol)サーバーの提供を開始した。ユーザーはClaudeから自然言語で指示を出すだけで、YouTube動画のダウンロード、文字起こし、要所抽出、字幕付き縦型クリップ生成までを一括で実行できる。
Zenn AI ・ 2026-09-05
Comfy-OrgとMiniMaxが主催する「#ComfyH3 Sync Sound Challenge」のBest Creative部門を受賞した。自作の画質指標の判定をあえて目視で覆した判断が受賞につながった。
Zenn AI ・ 2026-09-04
MiniMax H3は、参照アート画像から音声付きの2K AI動画を生成できるモデルである。ユーザーが指定した画像を基に高解像度映像と音響を同時に出力する。
Google News (中国AI企業) ・ 2026-09-04
中国初となるAI長編ドラマが衛星テレビのゴールデンタイムで放送され、制作を手掛けた芒果超媒が2日連続でストップ高となり時価総額が急騰した。
Google News (中国のAI) ・ 2026-09-04
レストラン経営者が生成AIをメニュー作成に活用しようとしているが、顧客はAI生成メニューの不自然さを直感的に感じ取っている。これはAIが食材や料理の文化的背景を理解できていないためと考えられる。
TechCrunch AI ・ 2026-09-04
中国のAIショートドラマのうち98.7%が制作費を回収できていないと香港メディアが報じた。AI顔の使用に対する疲労感も指摘されている。
Google News (中国のAI) ・ 2026-09-03
OpenRouterが公開した「Image Benchmarks」で、39の画像生成AIを比較評価した。ワイングラスの満杯表現や指の本数描写など、具体的なタスクで性能を測定。
Google News (画像・動画生成) ・ 2026-09-03
外部のオフラインモジュールに依存せず、物理・幾何学・外観の3つのネイティブな世界状態を同時にモデル化するマルチモーダルアーキテクチャ「Puffin-World」を提案した。オムニカメラ表現を用いて絶対的なカメラプロパティを現実世界に接地させ、物理的に一貫性のある3D世界の生成を実現する。
arXiv cs.CV ・ 2026-09-03
長期の動画における累積ドリフトや幾何学的崩壊を防ぐため、オンライン3D再構築をマルチリファレンス相対姿勢クエリとして再定式化した「Scal3R」を提案した。凍結されたバックボーンに約1%のパラメータである軽量トークンを非対称アテンションで挿入し、ループ閉じ込みを伴う姿勢グラフ最適化で長期ドリフトを抑制する。
arXiv cs.CV ・ 2026-09-03
ラベルや報酬信号を一切使用せず、動画の状態追跡を自己教師あり学習で行うフレームワーク「S$^3$T」を提案した。時間的サンプリング密度の高い教師ビューの次トークン分布を、疎なビューの学生モデルが模倣することで、推論コストを追加せずに精度を向上させた。
arXiv cs.CV ・ 2026-09-03
指示および参照に基づく動画編集を単一のフレームワークで実現するEditVidを提案する。スパース因果メモリやクロスアテンションのトークン注入などを組み合わせることで、ローカルの一貫性と長距離のアイデンティティ保持を両立している。
arXiv cs.AI ・ 2026-09-03
未トリミング動画内の複数イベントを局所化・記述するフレームワークSBSを提案する。VLMを活用してイベント間のフレームレベルのナラティブを生成し、視覚的に根拠のある言語的ガイダンスを適応的に提供する。
arXiv cs.AI ・ 2026-09-03
VGGTなどの3次元基盤モデル(3DFMs)の内部表現から隠れたサーフェスをデコードし、未見の視点におけるポイントマップを推定する手法 Z3D を提案している。3DFM表現に対して潜在拡散を行うことで、複数のデータセットにおいて新規視点のリアルな深度マップを予測する。
arXiv cs.CV ・ 2026-09-03
特定被写体の生成・編集時におけるアイデンティティのドリフト(ポーズや表情の変化による別人化)を評価・比較する系統的なベンチマークを実施している。入力コンテキスト、訓練可能なLoRA、永続的アイデンティティ層などの多様なパラダイムを検証し、アイデンティティ保持が依然として主要な課題であると指摘している。
arXiv cs.CV ・ 2026-09-03
マルチモーダル大規模言語モデル(MLLM)によるストリーミング動画理解において、従来の外部メモリからの検索・取得モデルから、情報をコンパクトな進化型潜在メモリに内部化する LatentStream フレームワークを提案している。因果性と限られたメモリの制約下で、視覚的履歴を階層的に整理して連続的な推論をガイドする。
arXiv cs.CV ・ 2026-09-03
大規模な動画レベルの疑似データの収集コストという課題を克服し、マスクなしでリアルな動画バーチャル試着を実現する BooM-VVT フレームワークを提案している。キーフレーム駆動型パラダイムを拡張し、大振幅の動作や激しいオクルージョンがある環境でも衣服の一貫性を維持する。
arXiv cs.CV ・ 2026-09-03
動画拡散モデル(VDMs)の量子化時に発生する視覚的詳細やテクスチャの劣化を防ぐため、デノイズプロセスの段階的機能を考慮した量子化認識訓練手法「DSAQuant」を提案した。大域的構造を確立する初期デノイズステップと、局所的詳細を洗練する中後期ステップの特性の違いを反映させる。
arXiv cs.CV ・ 2026-09-03
ゼロショットビジョン言語モデル(VLM)を用いた淡水魚の種認識精度とコンテキスト感度を監査した。BioCLIP2などが英語の共通名や学名で高い精度を示す一方で、ベンガル語のプロンプトではランダムに近い水準まで性能が低下することを明らかにした。
arXiv cs.CL ・ 2026-09-03
カメラ条件付きワールドモデルは、命令された動作が期待されるシーン変化を誘発し、外観や幾何学、時間的動態を一貫させる動画を生成する。既存の報酬関数は、幾何学ベースの報酬が軌道実行を評価するが、視覚的品質を判断できない。一方、画像ベースの報酬はフレームの品質を測定するが、動作実行や時間的動態を捉えられない。研究チームは、視覚言語モデル(VLM)を用いて、動作とその視覚的結果を統合した判断基準を構築。しかし、長時間のビデオとその全動作シーケンスを判断する際、短期的な動作証拠が希釈される問題を解決するため、「WorldReward」を提案。VLMベースのペアワイズ好み報酬モデルを用いて、動作一貫性と視覚品質の評価を統合した。
arXiv cs.CV ・ 2026-09-03
単一の画像から一貫性のある探索可能な3Dシーンを安定して自己回帰的に生成する動画拡散フレームワーク「OctWorld」を提案している。動的なスパースオクツリー内でTSDFフュージョンを採用した拡張可能な3Dメモリ「OctMap」を導入し、広範囲なカメラパスや視点移動でも幾何学的詳細と外観を保持する。
arXiv cs.CV ・ 2026-09-03
完全オープンなトレーニングレシピを採用した6Bの拡散トランスフォーマー(DiT)と、LLaDA2.0-Miniをベースにした視覚言語理解モジュールを統合した画像生成フレームワーク「LLaDA-Image」を発表した。RMSNormとMuonオプティマイザーを用いることで、高写実的な画像の生成と微細な編集指示への追従を実現し、数ステップで高速推論する「LLaDA-Image-Turbo」も構築した。
arXiv cs.CV ・ 2026-09-03
Google PicsがGoogleドキュメントやスライド上で画像編集機能を提供開始した。ユーザーはチャットで指示を出すだけで画像を生成・編集できる。
Google News (画像・動画生成) ・ 2026-09-03
中国で制作されたAI長編ドラマが地上波放送に進出し、産業化の試金石として注目を集めている。AI技術を活用した映像制作の新たな可能性を示す事例だ。
Google News (中国のAI) ・ 2026-09-03
中国軍が公開したAIアニメに対し、スタジオジブリの作品に酷似しているとの批判が集まっている。特に「火垂るの墓」の節子に似た少女の描写が指摘された。
Google News (中国のAI) ・ 2026-09-03
スパースな入力画像からシーンの暗黙的表現を構築し、カメラ軌道に沿った一時的に整合性のある動画を生成するRoGeを提案した。従来手法のような明示的な3D表現やレンダリング画像を介さず、エンドツーエンドで再構成と生成を統合する。
arXiv cs.CV ・ 2026-09-02
雨、霧、雪などの悪天候下で劣化した画像を復元する軽量な全天候画像復元モデルFReSH-IRを開発した。周波数分解と空間処理を組み合わせた階層型アーキテクチャにより、トランスフォーマーモデル比でパラメータ数と演算量を80%削減しながら同等の品質を達成した。
arXiv cs.CV ・ 2026-09-02
4つのスマートフォングループと2つの学習型ISPを対象に、RAW領域とsRGB領域での画像復元モデルのベンチマークを実施した。RAW領域の復元が一般的なRGB復元より優れる一方で、ISP変換を考慮したRGB復元モデルが最も高い性能を達成した。
arXiv cs.CV ・ 2026-09-02
グラフィックデザインにおける正確な制約(書体、レイアウト、色彩)を満たすテキスト画像生成を目指し、評価指標を報酬関数に変換するGDB-Rewardを提案した。強化学習により、拡散モデルの微調整なしでデザイン品質を向上させる。
arXiv cs.CV ・ 2026-09-02
AutoCompassは、不正確なGPSラベルから画像の3DoF姿勢を高精度に推定する手法だ。生のGPSラベルから方位を自動学習し、位置精度を向上させる。運転と一人称視点ベンチマークで既存手法を上回る性能を示した。
arXiv cs.CV ・ 2026-09-02
掌静脈認証のビデオベースデータセット CUP を新たに公開した。汚れや温度変化など実環境のノイズ下で21種類の認証器をベンチマークし、汚れた掌では平均等価エラー率が4倍に悪化することを確認。マルチフレーム集約で回復可能なことを示した。
arXiv cs.CV ・ 2026-09-02
顔画像のマルチツール編集を帰属する MultiEdit を提案した。50万以上の編集画像を含む MultiEdit データセットを構築し、6種類の編集ツールを対象にマルチツール編集の帰属精度を評価した。
arXiv cs.CV ・ 2026-09-02
自然画像の1/f²スペクトル分布とピクセル空間損失の不均衡に着目し、周波数とピクセルの両方を最適化する Focal Log-Frequency Loss を提案した。高周波成分の学習を強化し、画像生成品質を向上させる。
arXiv cs.CV ・ 2026-09-02
広域のコンテキストと高解像度を同時に満たすマルチスケールの衛星画像を生成するため、新しいタスクであるマルチスケールタイル補完と生成エンジン「Genesis」を提案した。任意のズームレベルや位置における疎なシードタイルから、スケール間および空間全体でグローバルに一貫性のある完全な四分木(クアッドツリー)を合成する。既存の手法が単一の軸に依存していた課題を解決し、整合性の取れたピラミッド構造の生成を実現した。
arXiv cs.CV ・ 2026-09-02
言語誘導型動的シーン理解において、冗長で文脈的なノイズを含むクエリが4Dガウス表現のセグメンテーション性能に与える影響を調査した。長い記述的クエリを簡潔なキーワードベースの形式に変換する、訓練不要の再解釈戦略を提案した。HyperNeRFおよびNeu3Dを用いた実験により、書き換えられた簡潔なクエリが時間的局所化と空間的セグメンテーションの双方を大幅に向上させることを実証した。
arXiv cs.CV ・ 2026-09-02
AdobeがPhotoshop、Firefly、Acrobatの各機能をSlack内で直接利用可能にした。ユーザーは日常のチャットワークフローから離れることなく、生成AIを用いた画像作成やPDFの処理、デザイン作業を実行できるようになる。
Google News (エージェント相互接続) ・ 2026-09-02
Runwayがコード不要の対話型インターフェイスを備えた世界モデル「Solaris」を発表した。直感的な操作で高度な映像生成が可能な同モデルにより、クリエイティブ作業の敷居が下がる。
Google News (画像・動画生成) ・ 2026-09-02
UGC 画像強化時に生じる微細な異常(顔・テキスト・テクスチャ)を検知する UEAP-4k データセットを公開した。差分融合異常検知メトリック(DFAM)で、強化前後の差分から局所的な異常を検出する。
arXiv cs.AI ・ 2026-09-02
テキストから画像生成(T2I)モデルの視覚的隠喩の生成能力を評価する初のベンチマーク「VMetaphor-Bench」を提案した。現実世界のクリエイティブな画像から収集した1,500の視覚的隠喩を3つのレベルと10のカテゴリに分類し、MLLMをジャッジとするハイブリッドな評価フレームワークを開発した。これにより、隠喩的忠実度や知覚的次元に基づく詳細なモデル評価を可能にする。
arXiv cs.AI ・ 2026-09-02
Runwayが、コード不要でデジタル世界を構築するAIモデル「Solaris」を発表した。ユーザーはテキストや画像から直感的に3D空間を生成できる新たなツールを提供する。
Google News (画像・動画生成) ・ 2026-09-02