トレンド一覧

画像・動画生成 の AI ニュース

画像・動画生成 に関する AI ニュースを新しい順に 29 件。3 時間おきに自動収集し、AI が要約しています。

Wonder: Video World Model Done Better

カメラ操作によるリアルタイムな世界探索を可能にする汎用ビデオワールドモデル「Wonder」が発表された。密な座標フィールドによるカメラ条件付けと効率的なスパース注意機構に基づくメモリにより、長期的かつ一貫性のあるインタラクティブな映像生成を実現している。

arXiv cs.CV ・ 2026-07-28

Parallel Decoding Distillation for Fast Image and Video Generation

拡散モデルやフローモデルの高速な画像・ビデオ生成を実現する新しい軌跡ベースの蒸留手法「Parallel Decoding Distillation (PDD)」が提案された。従来の敵対的損失やVSDの最適化の難しさを克服し、品質の低下や動きの欠落を抑えつつ高速な推論を可能にする。

arXiv cs.LG ・ 2026-07-28

Schrödinger's Cat: Probabilistic Representation and Prediction of Potential Scene Kinematics

単一画像から起こり得る将来の複数の運動軌道とその確率分布をモデル化する手法「GARFIELD」が発表されました。将来の動きの曖昧さを時空間潜在表現として明示的に扱うことで、詳細な視覚生成に偏らず確定的な密度デコードと柔軟な運動予測を可能にします。

arXiv cs.LG ・ 2026-07-28

Adversarial Deepfake Generation and an Investigation of Purification-Based Adversarial Detection

ImageCLEF 2026のディープフェイク検出・生成課題において、敵対的攻撃を付加した画像生成と複合アンサンブル検出手法の有効性が評価されました。生成側は多様な検出器を回避する高度な回避性能を示した一方、検出側は高い精度を達成しつつも実画像に対する誤検知リスクが課題として示されました。

arXiv cs.CV ・ 2026-07-28

OpenAIの動画生成AI「Sora」、ついに一般提供開始 「ChatGPT」課金ユーザーなら追加負担なし(画像)(3/5枚目) - ITmedia

OpenAIは高性能動画生成AIモデル「Sora」の一般提供を開始し、ChatGPTの有料会員であれば追加料金なしで利用可能にしました。画像・動画コンテンツ制作のあり方を一変させる主要モデルの正式展開であり、業界全体へのインパクトは甚大です。

Google News (画像・動画生成) ・ 2026-07-28

株式会社Mavericksは、動画生成AI「NoLang」に公式Live2Dアバターを100体以上追加。合計200体以上から選ぶだけで、キャラクターが動いて話す動画をモデル制作なしに制作可能に - PR TIMES

Mavericks株式会社が動画生成AI「NoLang」に公式Live2Dアバターを100体以上追加した。AIを活用した動画生成の可能性が広がりつつある。AI技術の進歩とその応用が注目されている。

Google News (画像・動画生成) ・ 2026-07-28

株式会社Mavericksは、動画生成AI「NoLang」の動画編集画面で、シーンの分割・結合に対応。テキストや画像などの素材も分割・伸縮でき、素材を置き直さずに構成を組み替え可能に - イザ!

動画生成AI「NoLang」の編集画面がアップデートされ、シーンの分割・結合や素材の伸縮に対応しました。構成の自由度が向上し、動画編集の効率化が期待されます。

Google News (画像・動画生成) ・ 2026-07-28

生成AIグラビア実践ワークショップ、次回は「今、最も勢いのある画像生成AI、Krea 2」をテーマに7月31日開催。テクノエッジ アルファ会員なら全過去回含め無料視聴できます 1枚目の写真・画像 - techno-edge.net

画像生成AIのワークショップが開催され、Krea 2などの画像生成AIの実践が紹介されます。テクノエッジ アルファ会員は、全過去回を含めて無料で視聴できます。

Google News (画像・動画生成) ・ 2026-07-28

MicroZoom: Structure-Preserving Detail Synthesis at Extreme Scale

広角の全体写真と少数の顕微鏡画像から最大350倍のギガピクセル解像度でテクスチャを合成する「MicroZoom」が発表されました。巨視的なパターン構造と微細な質感を維持しながら画像補間を行うことで、広範囲の顕微鏡レベルのビジュアル生成を可能にします。

arXiv cs.CV ・ 2026-07-27

Rethinking Classifier-Free Guidance in On-Policy Diffusion Distillation

オンポリシー拡散蒸留におけるClassifier-Free Guidance (CFG) の挙動と問題点を解明する研究が発表されました。生徒モデルと教師モデルの間で正負ブランチの誤差が打ち消し合うメカニズムを特定し、拡散モデルのより効果的な蒸留手法の開発に貢献します。

arXiv cs.AI ・ 2026-07-27

DreamStyle3D: Efficient 3D Stylized Asset Generation via Dual-Attention Disentanglement

3Dアセット生成において、幾何構造とスタイルを分離して制御する軽量フレームワーク「DreamStyle3D」が開発されました。分離型二重クロスアテンションを用いることで、形状の整合性を保ちながら高品質なスタイライズ処理を効率的に実現します。

arXiv cs.CV ・ 2026-07-27

SADe: Sparse-Atom Support Decontamination for Few-Shot Segmentation with Weak Support Annotations

不完全な領域指定ラベルを用いたフューショット・セグメンテーション(FSS)向けに、ノイズを除去する層「SADe」が提案されました。スパースオートエンコーダー(SAE)を用いて信頼性の低い領域を判定・クレンジングすることで、曖昧な指示ラベルによる予測精度低下を防ぎます。

arXiv cs.CV ・ 2026-07-27

Panda: Unsupervised Pelvic Anomaly Detection for Real-Time MR Imaging

女性の骨盤MRI画像におけるリアルタイムの異常検知を目的とした、教師なし学習フレームワーク「Panda」を提案した研究。DINOv3ビジョンTransformerエンコーダーを活用し、アノテーションデータなしで正常な表現から逸脱した異常を検出する。医療画像診断の課題解決に貢献する。

arXiv cs.CV ・ 2026-07-27

MMOE: Modernizing Diffusion Transformers with Efficient Expert Design

Diffusion Transformer(DiT)に軽量なMixture-of-Experts(MoE)構造を導入する新アーキテクチャ「ModernMOE (MMOE)」が提案されました。大言語モデルで培われた効率的なスケーリング手法を画像生成モデルに応用することで、品質を維持したまま訓練・推論の計算コストを大幅に削減します。

arXiv cs.LG ・ 2026-07-27

画像生成モデルの比較を1つのAPIキーで回す構成と、プロンプトから「品質ワード」を消した話

困っていたこと 画像生成モデルを比較したいだけなのに、準備が一番重い。 モデルごとにアカウントを作り、APIキーを発行し、それぞれのSDKを入れて、 レスポンス形式の違いを吸収するコードを書く。「このプロンプト、別の モデルだとどう出るんだろう」を確認するまでに30分かかる。本題はそこじゃない。 結局、OpenAI互換の統一エンドポイント経由に寄せた。モデルの切り替えが 文字列1個で済むようになったので、その構成と、そこで検証して分かった プロンプトの話を書く。 構成: 画像生成は非同期なので2ステップ ここが最初のハマりどころだった。画像系は POST /v1/images/g...

Zenn AI ・ 2026-07-27

CameraAnything: Refilming Videos with Arbitrary Camera Control

動画編集において、カメラの外部パラメータだけでなく焦点距離などの内部パラメータも統合制御できるフレームワーク「CameraAnything」が発表された。従来の複雑な3D再構成を必要とせずに自由なカメラワークによる再撮影・編集を実現し、高品質な生成AI動画編集の可能性を広げる。

arXiv cs.CV ・ 2026-07-27

スマホ映像から最短1分で高精細3Dモデル、NECが生成技術を開発

NECは、スマートフォンなどの汎用カメラで撮影した映像から最短1分で高精細な3Dモデルを生成する技術を開発しました。障害物の自動除去や背景補完機能を備えており、特別な計測機材を必要とせずに短時間で3D空間データを構築できる点が重要です。

ITmedia AI+ ・ 2026-07-27

株式会社Mavericksは、動画生成AI「NoLang」のテキストテンプレートを56種から120カテゴリ・1,192バリエーションへ拡充。選ぶだけで動画に合うテロップデザインを適用可能に - イザ!

株式会社Mavericksは、動画生成AI「NoLang」のテキストテンプレートを拡充しました。120カテゴリ・1,192バリエーションに増え、選ぶだけで動画に合うテロップデザインを適用可能になりました。

Google News (画像・動画生成) ・ 2026-07-26

株式会社Mavericksは、動画生成AI「NoLang」の動画編集画面に、既存画像をAIで編集できる新機能「AI画像編集」を追加。画像単体のダウンロード解禁とクレジット消費半減も実施 - PR TIMES

株式会社Mavericksは、動画生成AI「NoLang」に既存画像をAIで編集できる新機能「AI画像編集」を追加した。同時に画像単体のダウンロード解禁やクレジット消費の半減も行われ、ユーザーの利便性が向上している。

Google News (画像・動画生成) ・ 2026-07-26

GraphVid: Interactive Graph-Controllable Video Generation

複数のオブジェクト間インタラクションを構造化グラフで制御できる動画生成モデル「GraphVid」が発表された。複雑なシーンにおける柔軟かつ正確な制御を可能にし、専用のデータセット「GraphVid-Bench」も構築されている。

arXiv cs.AI ・ 2026-07-23

Show HN: Palmier Pro – Open-source macOS video editor built for AI

AI生成機能やローカルMCPサーバー連携を備えたオープンソースのmacOS向け動画エディタ「Palmier Pro」が公開された。動画作成とAIプロンプト試行の往復作業を同一ツール内で完結させることで、エージェントを活用した映像制作の効率を高めている。

Hacker News ・ 2026-07-23

Bringing Nunchaku 4-bit Diffusion Inference to Diffusers

Hugging FaceのDiffusersライブラリにおいて、4-bit量子化による効率的な拡散モデル推論エンジン「Nunchaku」が利用可能になりました。大幅な軽量化とメモリ削減により、リソース制限のある環境でも高品質な画像生成モデルの推論が高速化されます。

Hugging Face Blog ・ 2026-07-23