トレンド一覧

画像・動画生成 の AI ニュース

画像・動画生成 に関する AI ニュースを新しい順に 382 件。3 時間おきに自動収集し、AI が要約しています。

60秒でKattoをClaudeに接続する(公式MCPサーバー)✂️

AI動画編集ツール「Katto」が公式MCP(Model Context Protocol)サーバーの提供を開始した。ユーザーはClaudeから自然言語で指示を出すだけで、YouTube動画のダウンロード、文字起こし、要所抽出、字幕付き縦型クリップ生成までを一括で実行できる。

Zenn AI ・ 2026-09-05

生成AIで作成されたメニューが食欲をそぐ理由

レストラン経営者が生成AIをメニュー作成に活用しようとしているが、顧客はAI生成メニューの不自然さを直感的に感じ取っている。これはAIが食材や料理の文化的背景を理解できていないためと考えられる。

TechCrunch AI ・ 2026-09-04

物理シミュレーションと3D世界生成を統合したマルチモーダルモデル「Puffin-World」

外部のオフラインモジュールに依存せず、物理・幾何学・外観の3つのネイティブな世界状態を同時にモデル化するマルチモーダルアーキテクチャ「Puffin-World」を提案した。オムニカメラ表現を用いて絶対的なカメラプロパティを現実世界に接地させ、物理的に一貫性のある3D世界の生成を実現する。

arXiv cs.CV ・ 2026-09-03

スケーラブルなオンライン3D再構築に向けた効率的なマルチ相対姿勢クエリの学習

長期の動画における累積ドリフトや幾何学的崩壊を防ぐため、オンライン3D再構築をマルチリファレンス相対姿勢クエリとして再定式化した「Scal3R」を提案した。凍結されたバックボーンに約1%のパラメータである軽量トークンを非対称アテンションで挿入し、ループ閉じ込みを伴う姿勢グラフ最適化で長期ドリフトを抑制する。

arXiv cs.CV ・ 2026-09-03

自己教師あり時間的セルフディスティレーションによる動画内の視覚的状態追跡

ラベルや報酬信号を一切使用せず、動画の状態追跡を自己教師あり学習で行うフレームワーク「S$^3$T」を提案した。時間的サンプリング密度の高い教師ビューの次トークン分布を、疎なビューの学生モデルが模倣することで、推論コストを追加せずに精度を向上させた。

arXiv cs.CV ・ 2026-09-03

生成画像モデルにおける恒常的アイデンティティ保持のベンチマークと評価システム

特定被写体の生成・編集時におけるアイデンティティのドリフト(ポーズや表情の変化による別人化)を評価・比較する系統的なベンチマークを実施している。入力コンテキスト、訓練可能なLoRA、永続的アイデンティティ層などの多様なパラダイムを検証し、アイデンティティ保持が依然として主要な課題であると指摘している。

arXiv cs.CV ・ 2026-09-03

ストリーミング動画理解のためのプログレッシブ潜在メモリ拡張手法 LatentStream

マルチモーダル大規模言語モデル(MLLM)によるストリーミング動画理解において、従来の外部メモリからの検索・取得モデルから、情報をコンパクトな進化型潜在メモリに内部化する LatentStream フレームワークを提案している。因果性と限られたメモリの制約下で、視覚的履歴を階層的に整理して連続的な推論をガイドする。

arXiv cs.CV ・ 2026-09-03

画像レベルの疑似データを用いたマスク不要の動画バーチャル試着フレームワーク BooM-VVT

大規模な動画レベルの疑似データの収集コストという課題を克服し、マスクなしでリアルな動画バーチャル試着を実現する BooM-VVT フレームワークを提案している。キーフレーム駆動型パラダイムを拡張し、大振幅の動作や激しいオクルージョンがある環境でも衣服の一貫性を維持する。

arXiv cs.CV ・ 2026-09-03

動画生成の量子化におけるデノイズ段階アラインメント訓練DSAQuant

動画拡散モデル(VDMs)の量子化時に発生する視覚的詳細やテクスチャの劣化を防ぐため、デノイズプロセスの段階的機能を考慮した量子化認識訓練手法「DSAQuant」を提案した。大域的構造を確立する初期デノイズステップと、局所的詳細を洗練する中後期ステップの特性の違いを反映させる。

arXiv cs.CV ・ 2026-09-03

カメラ条件付きワールドモデルの報酬モデル「WorldReward」

カメラ条件付きワールドモデルは、命令された動作が期待されるシーン変化を誘発し、外観や幾何学、時間的動態を一貫させる動画を生成する。既存の報酬関数は、幾何学ベースの報酬が軌道実行を評価するが、視覚的品質を判断できない。一方、画像ベースの報酬はフレームの品質を測定するが、動作実行や時間的動態を捉えられない。研究チームは、視覚言語モデル(VLM)を用いて、動作とその視覚的結果を統合した判断基準を構築。しかし、長時間のビデオとその全動作シーケンスを判断する際、短期的な動作証拠が希釈される問題を解決するため、「WorldReward」を提案。VLMベースのペアワイズ好み報酬モデルを用いて、動作一貫性と視覚品質の評価を統合した。

arXiv cs.CV ・ 2026-09-03

3Dツリーマッピングを用いた長距離かつ世界観が一貫する動画生成モデルOctWorld

単一の画像から一貫性のある探索可能な3Dシーンを安定して自己回帰的に生成する動画拡散フレームワーク「OctWorld」を提案している。動的なスパースオクツリー内でTSDFフュージョンを採用した拡張可能な3Dメモリ「OctMap」を導入し、広範囲なカメラパスや視点移動でも幾何学的詳細と外観を保持する。

arXiv cs.CV ・ 2026-09-03

完全オープンな訓練レシピに基づく画像生成フレームワーク「LLaDA-Image」

完全オープンなトレーニングレシピを採用した6Bの拡散トランスフォーマー(DiT)と、LLaDA2.0-Miniをベースにした視覚言語理解モジュールを統合した画像生成フレームワーク「LLaDA-Image」を発表した。RMSNormとMuonオプティマイザーを用いることで、高写実的な画像の生成と微細な編集指示への追従を実現し、数ステップで高速推論する「LLaDA-Image-Turbo」も構築した。

arXiv cs.CV ・ 2026-09-03

RoGe 新たな視点合成手法でスパース入力からの動画生成を実現

スパースな入力画像からシーンの暗黙的表現を構築し、カメラ軌道に沿った一時的に整合性のある動画を生成するRoGeを提案した。従来手法のような明示的な3D表現やレンダリング画像を介さず、エンドツーエンドで再構成と生成を統合する。

arXiv cs.CV ・ 2026-09-02

FReSH-IR スペクトル調和を用いた軽量な全天候画像復元モデル

雨、霧、雪などの悪天候下で劣化した画像を復元する軽量な全天候画像復元モデルFReSH-IRを開発した。周波数分解と空間処理を組み合わせた階層型アーキテクチャにより、トランスフォーマーモデル比でパラメータ数と演算量を80%削減しながら同等の品質を達成した。

arXiv cs.CV ・ 2026-09-02

RAWとRGB復元のベンチマークでISP配置の影響を定量化

4つのスマートフォングループと2つの学習型ISPを対象に、RAW領域とsRGB領域での画像復元モデルのベンチマークを実施した。RAW領域の復元が一般的なRGB復元より優れる一方で、ISP変換を考慮したRGB復元モデルが最も高い性能を達成した。

arXiv cs.CV ・ 2026-09-02

AutoCompass: 弱教師データで高精度な画像位置合わせを実現

AutoCompassは、不正確なGPSラベルから画像の3DoF姿勢を高精度に推定する手法だ。生のGPSラベルから方位を自動学習し、位置精度を向上させる。運転と一人称視点ベンチマークで既存手法を上回る性能を示した。

arXiv cs.CV ・ 2026-09-02

ビデオベースの掌静脈認証で課題条件下の性能を評価

掌静脈認証のビデオベースデータセット CUP を新たに公開した。汚れや温度変化など実環境のノイズ下で21種類の認証器をベンチマークし、汚れた掌では平均等価エラー率が4倍に悪化することを確認。マルチフレーム集約で回復可能なことを示した。

arXiv cs.CV ・ 2026-09-02

顔画像のマルチツール編集帰属手法 MultiEdit を提案

顔画像のマルチツール編集を帰属する MultiEdit を提案した。50万以上の編集画像を含む MultiEdit データセットを構築し、6種類の編集ツールを対象にマルチツール編集の帰属精度を評価した。

arXiv cs.CV ・ 2026-09-02

階層的衛星画像生成エンジンGenesisの実現手法

広域のコンテキストと高解像度を同時に満たすマルチスケールの衛星画像を生成するため、新しいタスクであるマルチスケールタイル補完と生成エンジン「Genesis」を提案した。任意のズームレベルや位置における疎なシードタイルから、スケール間および空間全体でグローバルに一貫性のある完全な四分木(クアッドツリー)を合成する。既存の手法が単一の軸に依存していた課題を解決し、整合性の取れたピラミッド構造の生成を実現した。

arXiv cs.CV ・ 2026-09-02

4Dガウス表現での複雑な物体セグメンテーション

言語誘導型動的シーン理解において、冗長で文脈的なノイズを含むクエリが4Dガウス表現のセグメンテーション性能に与える影響を調査した。長い記述的クエリを簡潔なキーワードベースの形式に変換する、訓練不要の再解釈戦略を提案した。HyperNeRFおよびNeu3Dを用いた実験により、書き換えられた簡潔なクエリが時間的局所化と空間的セグメンテーションの双方を大幅に向上させることを実証した。

arXiv cs.CV ・ 2026-09-02

AdobeがPhotoshopやFirefly、AcrobatをSlack内に統合

AdobeがPhotoshop、Firefly、Acrobatの各機能をSlack内で直接利用可能にした。ユーザーは日常のチャットワークフローから離れることなく、生成AIを用いた画像作成やPDFの処理、デザイン作業を実行できるようになる。

Google News (エージェント相互接続) ・ 2026-09-02

Runwayがコード不要の世界モデル「Solaris」を発表

Runwayがコード不要の対話型インターフェイスを備えた世界モデル「Solaris」を発表した。直感的な操作で高度な映像生成が可能な同モデルにより、クリエイティブ作業の敷居が下がる。

Google News (画像・動画生成) ・ 2026-09-02

画像生成モデルの視覚的隠喩生成能力を評価する新ベンチマーク

テキストから画像生成(T2I)モデルの視覚的隠喩の生成能力を評価する初のベンチマーク「VMetaphor-Bench」を提案した。現実世界のクリエイティブな画像から収集した1,500の視覚的隠喩を3つのレベルと10のカテゴリに分類し、MLLMをジャッジとするハイブリッドな評価フレームワークを開発した。これにより、隠喩的忠実度や知覚的次元に基づく詳細なモデル評価を可能にする。

arXiv cs.AI ・ 2026-09-02