Wonder: Video World Model Done Better
カメラ操作によるリアルタイムな世界探索を可能にする汎用ビデオワールドモデル「Wonder」が発表された。密な座標フィールドによるカメラ条件付けと効率的なスパース注意機構に基づくメモリにより、長期的かつ一貫性のあるインタラクティブな映像生成を実現している。
arXiv cs.CV ・ 2026-07-28
画像・動画生成 に関する AI ニュースを新しい順に 29 件。3 時間おきに自動収集し、AI が要約しています。
カメラ操作によるリアルタイムな世界探索を可能にする汎用ビデオワールドモデル「Wonder」が発表された。密な座標フィールドによるカメラ条件付けと効率的なスパース注意機構に基づくメモリにより、長期的かつ一貫性のあるインタラクティブな映像生成を実現している。
arXiv cs.CV ・ 2026-07-28
拡散モデルやフローモデルの高速な画像・ビデオ生成を実現する新しい軌跡ベースの蒸留手法「Parallel Decoding Distillation (PDD)」が提案された。従来の敵対的損失やVSDの最適化の難しさを克服し、品質の低下や動きの欠落を抑えつつ高速な推論を可能にする。
arXiv cs.LG ・ 2026-07-28
単一画像から起こり得る将来の複数の運動軌道とその確率分布をモデル化する手法「GARFIELD」が発表されました。将来の動きの曖昧さを時空間潜在表現として明示的に扱うことで、詳細な視覚生成に偏らず確定的な密度デコードと柔軟な運動予測を可能にします。
arXiv cs.LG ・ 2026-07-28
画像生成AI「Midjourney」を用いて高品質なイラストが短時間で生成できることが話題となっている。ユーザーの間で手軽に高いクオリティの画像が得られるとして注目を集めている。
Google News (画像・動画生成) ・ 2026-07-28
画像生成AI「Midjourney」が話題になっている。絵が下手な漫画家を救えるかどうかについて議論されている。
Google News (画像・動画生成) ・ 2026-07-28
ImageCLEF 2026のディープフェイク検出・生成課題において、敵対的攻撃を付加した画像生成と複合アンサンブル検出手法の有効性が評価されました。生成側は多様な検出器を回避する高度な回避性能を示した一方、検出側は高い精度を達成しつつも実画像に対する誤検知リスクが課題として示されました。
arXiv cs.CV ・ 2026-07-28
OpenAIは高性能動画生成AIモデル「Sora」の一般提供を開始し、ChatGPTの有料会員であれば追加料金なしで利用可能にしました。画像・動画コンテンツ制作のあり方を一変させる主要モデルの正式展開であり、業界全体へのインパクトは甚大です。
Google News (画像・動画生成) ・ 2026-07-28
Mavericks株式会社が動画生成AI「NoLang」に公式Live2Dアバターを100体以上追加した。AIを活用した動画生成の可能性が広がりつつある。AI技術の進歩とその応用が注目されている。
Google News (画像・動画生成) ・ 2026-07-28
動画生成AI「NoLang」の編集画面がアップデートされ、シーンの分割・結合や素材の伸縮に対応しました。構成の自由度が向上し、動画編集の効率化が期待されます。
Google News (画像・動画生成) ・ 2026-07-28
画像生成AIのワークショップが開催され、Krea 2などの画像生成AIの実践が紹介されます。テクノエッジ アルファ会員は、全過去回を含めて無料で視聴できます。
Google News (画像・動画生成) ・ 2026-07-28
試行錯誤が多くなりがちなAI動画生成において、キーフレーム確定後に「尺」をあらかじめ設定する制作フローのノウハウが解説された。生成のブレを減らし少ない試行回数で目的の映像を得る設計手法は、効率的なコンテンツ制作において実用的である。
Zenn AI ・ 2026-07-27
広角の全体写真と少数の顕微鏡画像から最大350倍のギガピクセル解像度でテクスチャを合成する「MicroZoom」が発表されました。巨視的なパターン構造と微細な質感を維持しながら画像補間を行うことで、広範囲の顕微鏡レベルのビジュアル生成を可能にします。
arXiv cs.CV ・ 2026-07-27
オンポリシー拡散蒸留におけるClassifier-Free Guidance (CFG) の挙動と問題点を解明する研究が発表されました。生徒モデルと教師モデルの間で正負ブランチの誤差が打ち消し合うメカニズムを特定し、拡散モデルのより効果的な蒸留手法の開発に貢献します。
arXiv cs.AI ・ 2026-07-27
3Dアセット生成において、幾何構造とスタイルを分離して制御する軽量フレームワーク「DreamStyle3D」が開発されました。分離型二重クロスアテンションを用いることで、形状の整合性を保ちながら高品質なスタイライズ処理を効率的に実現します。
arXiv cs.CV ・ 2026-07-27
不完全な領域指定ラベルを用いたフューショット・セグメンテーション(FSS)向けに、ノイズを除去する層「SADe」が提案されました。スパースオートエンコーダー(SAE)を用いて信頼性の低い領域を判定・クレンジングすることで、曖昧な指示ラベルによる予測精度低下を防ぎます。
arXiv cs.CV ・ 2026-07-27
女性の骨盤MRI画像におけるリアルタイムの異常検知を目的とした、教師なし学習フレームワーク「Panda」を提案した研究。DINOv3ビジョンTransformerエンコーダーを活用し、アノテーションデータなしで正常な表現から逸脱した異常を検出する。医療画像診断の課題解決に貢献する。
arXiv cs.CV ・ 2026-07-27
Diffusion Transformer(DiT)に軽量なMixture-of-Experts(MoE)構造を導入する新アーキテクチャ「ModernMOE (MMOE)」が提案されました。大言語モデルで培われた効率的なスケーリング手法を画像生成モデルに応用することで、品質を維持したまま訓練・推論の計算コストを大幅に削減します。
arXiv cs.LG ・ 2026-07-27
困っていたこと 画像生成モデルを比較したいだけなのに、準備が一番重い。 モデルごとにアカウントを作り、APIキーを発行し、それぞれのSDKを入れて、 レスポンス形式の違いを吸収するコードを書く。「このプロンプト、別の モデルだとどう出るんだろう」を確認するまでに30分かかる。本題はそこじゃない。 結局、OpenAI互換の統一エンドポイント経由に寄せた。モデルの切り替えが 文字列1個で済むようになったので、その構成と、そこで検証して分かった プロンプトの話を書く。 構成: 画像生成は非同期なので2ステップ ここが最初のハマりどころだった。画像系は POST /v1/images/g...
Zenn AI ・ 2026-07-27
動画編集において、カメラの外部パラメータだけでなく焦点距離などの内部パラメータも統合制御できるフレームワーク「CameraAnything」が発表された。従来の複雑な3D再構成を必要とせずに自由なカメラワークによる再撮影・編集を実現し、高品質な生成AI動画編集の可能性を広げる。
arXiv cs.CV ・ 2026-07-27
NVIDIAが手術ロボティクス向けにリアルタイムな生成シミュレーションを実現する「Cosmos-H-Dreams」を発表した。高度なシミュレーション技術によって医療ロボットの開発やトレーニングを革新するアプローチとして重要である。
Hugging Face Blog ・ 2026-07-27
マウスのPET-CT画像における腫瘍セグメンテーションのための、不確実性定量化モジュールを備えた深層学習手法に関するNature誌の論文。医療分野へのAI応用の精度向上に寄与する研究である。
Nature (機械学習) ・ 2026-07-27
NECは、スマートフォンなどの汎用カメラで撮影した映像から最短1分で高精細な3Dモデルを生成する技術を開発しました。障害物の自動除去や背景補完機能を備えており、特別な計測機材を必要とせずに短時間で3D空間データを構築できる点が重要です。
ITmedia AI+ ・ 2026-07-27
株式会社Mavericksは、動画生成AI「NoLang」のテキストテンプレートを拡充しました。120カテゴリ・1,192バリエーションに増え、選ぶだけで動画に合うテロップデザインを適用可能になりました。
Google News (画像・動画生成) ・ 2026-07-26
画像生成AI「Midjourney V8.2」が公開され、ユーザーごとの好みを学習して出力に反映するパーソナライゼーション機能が強化されました。個々のクリエイターの意図に沿った高品質な画像生成が容易になり、制作プロセスの効率化につながります。
Google News (画像・動画生成) ・ 2026-07-26
株式会社Mavericksは、動画生成AI「NoLang」に既存画像をAIで編集できる新機能「AI画像編集」を追加した。同時に画像単体のダウンロード解禁やクレジット消費の半減も行われ、ユーザーの利便性が向上している。
Google News (画像・動画生成) ・ 2026-07-26
renueは、2D図面から3D CADモデルを生成するAI「Drawing Agent」に、関節や可動域を自動認識して動かせるモデルを作る新機能を追加した。設計の検証精度を高める上で重要なアップデートとなる。
ITmedia AI+ ・ 2026-07-24
複数のオブジェクト間インタラクションを構造化グラフで制御できる動画生成モデル「GraphVid」が発表された。複雑なシーンにおける柔軟かつ正確な制御を可能にし、専用のデータセット「GraphVid-Bench」も構築されている。
arXiv cs.AI ・ 2026-07-23
AI生成機能やローカルMCPサーバー連携を備えたオープンソースのmacOS向け動画エディタ「Palmier Pro」が公開された。動画作成とAIプロンプト試行の往復作業を同一ツール内で完結させることで、エージェントを活用した映像制作の効率を高めている。
Hacker News ・ 2026-07-23
Hugging FaceのDiffusersライブラリにおいて、4-bit量子化による効率的な拡散モデル推論エンジン「Nunchaku」が利用可能になりました。大幅な軽量化とメモリ削減により、リソース制限のある環境でも高品質な画像生成モデルの推論が高速化されます。
Hugging Face Blog ・ 2026-07-23