Video (18) — 1/1


Paper/Blog Link My Issue
#ComputerVision #EfficiencyImprovement #ImageSegmentation #SmallModel #OpenWeight #2D (Image) #EdgeDevices Issue Date: 2025-11-09 GPT Summary- SAM 2は動画セグメンテーションの基盤モデルであり、メモリバンクメカニズムを通じて性能を向上させています。本研究では、モバイルデバイス上での効率を高めるために、EdgeTAMを提案し、2D空間パーセプターを用いて計算コストを削減します。これにより、メモリの空間構造を保持しつつ、推論オーバーヘッドなしで性能を向上させる蒸留パイプラインも導入。EdgeTAMは複数のデータセットで高いJ&Fスコアを達成し、iPhone 15 Pro Maxで16 FPSで動作します。 Comment

元ポスト:

Loading…

SAM2より性能は少し劣るが、edge-deviceてわ動作可能で非常に高速なモデル(promptによって制御可能なsegmentation)とのこと
- [Paper Note] SAM 2: Segment Anything in Images and Videos, Nikhila Ravi+, ICLR'25, 2024.08




Paper/Blog Link My Issue
#Article #ComputerVision #NLP #LanguageModel #Alignment #AIAgents #GenerativeAI #FoundationModel #Safety #Selected Papers/Blogs #VisionLanguageModel #Robotics #WorldModels #VisionLanguageActionModel #EmbodiedAI #Reading Reflections #WorldActionModel Issue Date: 2026-09-18 Comment

非常におもしろかった...色々と考えさせられるなあ。

特にフィジカルAIにおいて、中国は人海戦術で、(簡単な動作を学習できたら複雑な動作を実現することにつながるという仮説の元)非専門家の簡単な動作に関するデータを大量に収集し、最近では仮想環境でデータを合成し活用する動きがある(Sim-to-Real)に対して、日本の場合は、特定の企業の現場のデータを収集しようとする動きがある。(このような文脈において、日本の政策として考えた場合に)特定の企業が有する現場のデータは、その現場特有の特徴が入り込むから実はロボットの学習データに向いていない、という話は、なるほど、と思うなどした。

たとえば、
- [Paper Note] Open X-Embodiment: Robotic Learning Datasets and RT-X Models, Open X-Embodiment Collaboration+, arXiv'23, 2023.10
- [Paper Note] LeRobot: An Open-Source Library for End-to-End Robot Learning, Remi Cadene+, ICLR'26, 2026.02

のように、多様なデータを統一された枠組みで学習をすることで汎化することを狙うという戦略の場合は、現場データの現場特有のバイアス問題はどの程度緩和されるのだろうか。

- Superposition, Memorization, and Double Descent, Transformer Circuits Thread, 2023.01

のDouble Decentのような議論を考えると、同じ種別のデータで、きちんと多様なデータが集まっていれば、現場固有のバイアスが含まれていても汎用的な特徴量としては学習されずらい、という現象は起こるように思える。

また、仮想空間と実世界のgapもあるようで、視覚的なgapは合成データ等で埋め合わせがある程度できそうな一方で、触覚や力感のような繊細な部分や、物理的なセンサーのノイズや、実際のデバイスの物理的な個体差のようなものは、仮想空間上では再現しづらいという話もあるようである。

ただ、なんとなーく、まず汎用的なモデルを学習して基礎的な動作(LLMで言うところのatomic skill)を満足にできる基盤モデルを用意し(これはおそらく仮想空間や非専門家データで足りる)、その基盤モデルはin-context learning能力を備えていて、現場のロボットに適用する際にはfew-shotのdemonstrationや、ルーブリックのようなものを与えて制御する、というのでうまくいくシナリオは起きそうな気がしており、そうなると大量の現場データは必ずしも必要ではなさそうだよね、という気はする。

ただし、日本が人海戦術をとれないのであれば、汎用基盤モデル→現場での適用、というレールの上に乗るのであれば、直接的に汎化させるには専門的すぎる現場のデータが与えられたときに、そこからどのようにして汎用的な基盤モデルを学習できるのか、というところがうまくいけば、ある程度形になるのではなかろうか、と思うなどした。




Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Alignment #AIAgents #Evaluation #Blog #Safety #Attack #Selected Papers/Blogs #Security Issue Date: 2026-07-22 Comment

Hugging Face側のブログ:
Security incident disclosure — July 2026
https://huggingface.co/blog/security-incident-july-2026

元ポスト:

Loading…

video: https://youtu.be/87DyyMV0kCY

関連:
- Incident Report: unsanctioned agent behaviour during cyber testing, AISI, 2026.08
- [Paper Note] Chunky Post-Training: Data Driven Failures of Generalization, Seoirse Murray+, arXiv'26, 2026.02
- [Paper Note] Natural Emergent Misalignment from Reward Hacking in Production RL, Monte MacDiarmid+, arXiv'25, 2025.11

所見:

Loading…




Paper/Blog Link My Issue
#Article #Tutorial #ComputerVision #Pretraining #Transformer #MultiModal #ContrastiveLearning #read-later #VisionLanguageModel #Backbone Issue Date: 2026-05-21 Comment

関連:
- [Paper Note] An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale, Alexey Dosovitskiy+, ICLR'21
- [Paper Note] Sigmoid Loss for Language Image Pre-Training, Xiaohua Zhai+, ICCV'23
- [Paper Note] PaliGemma: A versatile 3B VLM for transfer, Lucas Beyer+, arXiv'24, 2024.07

元ポスト:

Loading…




Paper/Blog Link My Issue
#Article #NLP #AIAgents #ContextEngineering #One-Line Notes Issue Date: 2026-04-24 Comment

元ポスト:

Loading…

サブエージェントを構築する際に、メインエージェントの過去のcontextを全て継承することが可能な方式が実装されたようで(従来はcontextをメインとサブが共有しない方法が主流)、サブエージェントはメインエージェントのcontextを全て使いresultを得て、resultのみをメインエージェントに返すような挙動が実現可能。




Paper/Blog Link My Issue
#Article #Tutorial #VCS #git #KeyPoint Notes Issue Date: 2024-11-04 Comment

VCSの歴史から原理、実用的な使い方まで、Gitについて体系的にまとまっている。普段何気なく使っているが、改めて勉強すると、なるほど、と思うことが多い。

- VCSの歴史、モチベーション(複数並列するバージョンを適切に管理したい)
- ワークツリー、インデックス、リポジトリ(HEAD)の違い
- 基本的なgitコマンドから、普段あまり使わないハンク(hunk)の選択的なaddなどのコマンド
- コミットオブジェクト(ワークツリーのスナップショットを保持したもの≠前回のコミットに対する差分)
- HEAD/Detached HEADの原理
- Gitタグ
- checkoutの原理(ワークツリーとインデックスをHEADの内容に更新する)
- ブランチ、ブランチとHEADの関係性
- マージ方式(2way マージ、3wayマージ)
 - 2wayマージは元ファイルを参照しないのでマージ時に特定の編集がなかったことになってしまう)
 - 3wayマージは元ファイルも見て差分を計算するのでこのようなことが起こらない
- 競合の原理、競合解決時のファイル内容
 - Fast-Forwardマージ(ポインタを動かすだけで事足りる場合に利用)
- cherry pick(任意のコミットをとってくる)
 - (cherry pickを連続して利用する)リベース(ベースを付け替える操作)
 - 歴史を修正する
  - git reflogで起点とするコミットIDを見つけ、git rebase -iでコミット順変更orメッセージ変更、git commit --amendでコミット修正
- 状態のリセット
 - soft: HEADを指定したコミットにリセット
 - mixed: インデックスをリセット
 - hard: インデックスとワークツリーをリセット
- git stash
- コミット粒度とメッセージ
 - 単一の関心事項のみを含むような粒度でコミットしよう(一言で説明できる粒度)
  - cherry pickが容易になる
  - 別ブランチの脆弱性への対応のみを適用したい、など
  - 現在形で書く。そうすると、後からcherry pickするときに内容の判断をしやすい。
 

神講義