ECCV
[Paper Note] Flash-BoN: Instant Drafts for Inference-Time Scaling in Diffusion Models, Ruchit Rawal+, ECCV'26, 2026.07
Paper/Blog Link My Issue
#ComputerVision #NLP #DiffusionModel #TextToImageGeneration #Test-Time Scaling #One-Line Notes #ImageSynthesis #Author Thread-Post Issue Date: 2026-07-19 GPT Summary- 推論時のスケーリングは、Best-of-N(BoN)サンプリングからガイド付き探索に進化してきたが、生成コストを固定と見なしている。効率性評価でBoNがガイド付き探索に匹敵することを示し、Flash-BoNを提案。これはアクセラレーション技術を組み合わせ、多数の安価なドラフト候補を生成し、高品質へ精練する。ベンチマークではFlash-BoNが全ての基準を上回り、特にモデルスケールが大きいほど利得が顕著(AUCで+8%)。他の手法と相乗効果があり、候補の多様性向上が強化学習の収束を加速する。 Comment
pj page: https://flash-bon.github.io/
元ポスト:
中間サンプルを安価で効率的な方法で生成することで多様な中間候補を探索し、有望な候補のみに対して完全な生成をするようなBest-of-Nに基づくTextToImage手法を提案。
また効率性の評価において Number of Function Evaluations (NFEs)[^1] が利用されることが多かったが、これはdenoisingのforward passのみが考慮され、verifierのコストが無視されており、verificationコストが大きい手法が本来効率的ではないのに、効率的に見えてしまう問題があった。実際、BFSのような手法では固定されたNFEの元では効率的に見えるが、頻繁にverifierを呼び出すため、固定されたwallclock timeの元では効率性が逆転する。
[^1]: デノイジングを実施するネットワークの呼び出し回数
[Paper Note] Video Generation Models are General-Purpose Vision Learners, Letian Wang+, ECCV'26, 2026.07
Paper/Blog Link My Issue
#ComputerVision #Pretraining #FoundationModel #DiffusionModel #PostTraining #UMM #3D (Video) #TextToVideoGeneration #Author Thread-Post Issue Date: 2026-07-19 GPT Summary- 大規模テキストからの動画生成がコンピュータビジョンにおける強力な事前学習パラダイムとして機能し、一般的な視覚知性を支えることを提案。GenCeptionという前方伝播型の知覚モデルは、テキスト指示で多様な視覚タスクを実行し、専門モデルと同等またはそれを上回る性能を示す。また、動画生成の事前学習バックボーンは他のパラダイムより優れており、少ないデータで同等の性能を達成。さらに、合成ビデオで訓練されたモデルが現実世界に一般化することを示唆している。 Comment
元ポスト:
似たようなタイトルを見たことあるなと思ったら以下だった:
- [Paper Note] Image Generators are Generalist Vision Learners, Valentin Gabeur+, arXiv'26, 2026.04
著者ポスト:
[Paper Note] ELT: Elastic Looped Transformers for Visual Generation, Sahil Goyal+, arXiv'26, 2026.04
Paper/Blog Link My Issue
#Author Thread-Post Issue Date: 2026-04-17 GPT Summary- ELTは再帰的トランスフォーマーを基にした効率的な視覚生成モデルで、ウェイト共有によりパラメータ数を削減し高品質な合成を実現。ILSDを用いて中間ループから教師構成への蒸留を行い、一貫性のある訓練を実現。エラスティックモデルのファミリーを形成し、計算コストと生成品質のトレードオフを可能にするAny-Time推論機能を提供。パラメータ数を4倍削減しても、競争力のあるFIDとFVDを達成。 Comment
元ポスト:
著者ポスト:
[Paper Note] MeshVPR: Citywide Visual Place Recognition Using 3D Meshes, Gabriele Berton+, ECCV'24, 2024.06
Paper/Blog Link My Issue
Issue Date: 2025-11-02 GPT Summary- メッシュベースのシーン表現を用いた新しい視覚的場所認識パイプラインMeshVPRを提案。合成メッシュデータベース使用時の性能低下に対処するため、実世界と合成ドメインのギャップを埋める特徴整合フレームワークを導入。広範な評価により、MeshVPRが従来のVPRパイプラインと競争力のある性能を示し、メッシュベースのローカリゼーションシステムの可能性を開くことを確認。データとコードは公開されている。 Comment
pj page: https://meshvpr.github.io/
元ポスト:
[Paper Note] Implicit Style-Content Separation using B-LoRA, Yarden Frenkel+, ECCV'24
Paper/Blog Link My Issue
#ComputerVision #PEFT(Adaptor/LoRA) Issue Date: 2025-09-16 GPT Summary- 画像スタイライズにおいて、LoRAを用いてスタイルとコンテンツを暗黙的に分離する手法B-LoRAを提案。特定のブロックのLoRA重みを共同で学習することで、独立したトレーニングでは達成できない分離を実現。これによりスタイル操作が改善され、過学習の問題を克服。トレーニング後は、独立したコンポーネントとして様々なスタイライズタスクに利用可能。 Comment
pj page: https://b-lora.github.io/B-LoRA/
[Paper Note] COM Kitchens: An Unedited Overhead-view Video Dataset as a Vision-Language Benchmark, Koki Maeda+, arXiv'24, 2024.08
Paper/Blog Link My Issue
#ComputerVision #Dataset #needs-revision Issue Date: 2024-09-30 GPT Summary- 手順型動画理解に向けて、COM Kitchensという新データセットを提案。スマートフォンで撮影した編集なしの俯瞰視点動画で、参加者がレシピに従った調理を記録。これにより、幅広い環境でのデータ収集が可能に。新タスクとして、動画からテキストへの検索(OnRR)と未編集動画上のキャプショニング(DVC-OV)を設定し、既存手法の能力と限界を実験で検証。 Comment
とてもおもしろそう!
[Paper Note] ZipLoRA: Any Subject in Any Style by Effectively Merging LoRAs, Viraj Shah+, N_A, ECCV'24
Paper/Blog Link My Issue
#ComputerVision #PEFT(Adaptor/LoRA) Issue Date: 2023-11-23 GPT Summary- 概要:概念駆動型のパーソナライズのための生成モデルの微調整手法であるZipLoRAを提案。ZipLoRAは、独立してトレーニングされたスタイルと主題のLoRAを統合し、任意の主題とスタイルの組み合わせで生成することができる。実験結果は、ZipLoRAが主題とスタイルの忠実度を改善しながら魅力的な結果を生成できることを示している。 Comment
pj page: https://ziplora.github.io/
[Paper Note] Three things everyone should know about Vision Transformers, Hugo Touvron+, ECCV'22, 2022.03
Paper/Blog Link My Issue
#ComputerVision #Transformer #Architecture #2D (Image) #Initial Impression Notes Issue Date: 2026-07-16 GPT Summary- 視覚トランスフォーマーは、精度を損なうことなく並列処理が可能であり、アテンション層の微調整により様々なタスクへ適応可能であることを示す3つの洞察を提供。さらに、MLPベースのパッチ前処理層の追加が自己教師付き学習を改善。これらの影響をImageNet-1kデータセットで評価し、転移性能を小規模データセットで測定。 Comment
Inklingによって採用されているhMLPと呼ばれるアーキテクチャが提案されている(図5)
[Paper Note] Generating Visual Explanations, Lisa Anne Hendricks+, ECCV'16, 2016.03
Paper/Blog Link My Issue
#NeuralNetwork #ComputerVision Issue Date: 2017-12-28 GPT Summary- 分類決定の説明は重要であり、既存の深層視覚認識は不透明である。本研究では、可視オブジェクトの識別特性に基づき、クラスラベルを予測し、その理由を説明する新モデルを提案。新しい損失関数を用いて、グローバルな文の特性を実現する。実験結果は、提案モデルがより識別的な説明を生成できることを示した。
[Paper Note] Indoor Segmentation and Support Inference from RGBD Images, Silberman+, ECCV'12
Paper/Blog Link My Issue
#ComputerVision #Dataset #Evaluation Issue Date: 2025-11-20 GPT Summary- RGBD画像を用いて、散らかった屋内シーンの主要な表面や物体、支持関係を解析するアプローチを提案。物理的相互作用を考慮し、3Dの手がかりが構造化された解釈に与える影響を探求。新たに1449のRGBD画像からなるデータセットを作成し、支持関係の推測能力を実験で検証。3D手がかりと推測された支持が物体セグメンテーションの向上に寄与することを示す。
[Paper Note] A naturalistic open source movie for optical flow evaluation, Butler+, ECCV'12
Paper/Blog Link My Issue
#ComputerVision #Dataset #Evaluation Issue Date: 2025-11-20 Comment
dataset: https://www.kaggle.com/datasets/artemmmtry/mpi-sintel-dataset
