VideoCaptioning
[Paper Note] CapRL++: Unified Reinforcement Learning with Verifiable Rewards for Dense Image and Video Captioning, Penghui Yang+, arXiv'26, 2026.06
Paper/Blog Link My Issue
#ComputerVision #ReinforcementLearning #ImageCaptioning #VisionLanguageModel #3D (Video) #Initial Impression Notes Issue Date: 2026-06-11 GPT Summary- マルチモーダルキャプション生成において、強化学習を用いる新たなフレームワークCapRL++を提案。特に、キャプションの品質を有用性に基づいて再定義し、視覚情報を用いない質問に正確に答えられることを重視。これにより、高密度なキャプション生成能力が向上し、複数のタスクでのパフォーマンスが強化。CapRL++を用いた訓練モデルは、大規模モデルと同等の性能を達成し、従来の方法の限界を超えることを示した。 Comment
元ポスト:
CapRLのアイデア(i.e., 画像に関する質問をtext-onlyモデルがcaptionのみから正解できたらそのcaptionの品質は高い; キャプションの品質を有用性で測る)をvideo-captioninに拡張
[Paper Note] Multi-Task Video Captioning with Video and Entailment Generation, Ramakanth Pasunuru+, ACL'17, 2017.04
Paper/Blog Link My Issue
#NeuralNetwork #ComputerVision #NaturalLanguageGeneration #NLP #MultitaskLearning #ACL #Encoder-Decoder #3D (Video) #One-Line Notes Issue Date: 2017-12-31 GPT Summary- ビデオキャプショニングの改善のため、教師なしビデオ予測タスクと論理的言語含意生成タスクを共有し、リッチなビデオエンコーダ表現を学習。パラメータを共有するマルチタスク学習モデルを提案し、標準データセットで大幅な改善を達成。 Comment
multitask learningで動画(かなり短め)のキャプション生成を行なった話
