Security


Paper/Blog Link My Issue
#NLP #LanguageModel #Chain-of-Thought #Proprietary #API #Attack #read-later #PII #Author Thread-Post Issue Date: 2026-08-14 GPT Summary- 大規模言語モデルの推論過程が隠蔽され、クライアントに暗号化されたテキストブロックが返される中、設計上の脆弱性が明らかになった。これにより、異なるモデル間の暗号化ブロックの互換性を利用した復号ジャイルブレイクが可能となり、推論の抽出やプライベートデータの漏洩が実証された。具体的には、個人情報や資格情報が回収された他、有害情報の露呈や悪意のあるペイロードの埋め込みが可能になる課題が示された。各攻撃に対処するため、クライアント側の推論を保護する具体的な暗号技術やシステム緩和策が提案されている。 Comment

元ポスト:

Loading…

所見:
-

Loading…

-
Loading…

所見:

Loading…

関連:
- [Paper Note] How to Steal Reasoning Without Reasoning Traces, Tingwei Zhang+, arXiv'26, 2026.03




Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Evaluation #Environment Issue Date: 2026-06-27 GPT Summary- 悪用は段階的な進展を伴う能力であり、従来のLLMセキュリティベンチマークが二値的結果に依存することに問題がある。本研究では、16の測定可能なフラグによる能力評価型ベンチマークであるExploitBenchを提案し、様々な悪用技術を評価する。V8の41件のバグに適用した結果、公開されているモデルとプライベートモデルとの間に能力の顕著な差を確認。特に、プライベートモデルでは任意コード実行が観測され、堅牢化されたターゲットに対する悪用能力の構築が新たな重要性を持つことを示唆している。 Comment

github: https://github.com/exploitbench/exploitbench




Paper/Blog Link My Issue
#Controllable #NLP #Dataset #LanguageModel #AIAgents #Evaluation #Initial Impression Notes #Environment #Author Thread-Post #RedTeaming Issue Date: 2026-05-12 GPT Summary- AIエージェントは複雑なワークフローを自動化する一方で、重要なセキュリティリスクを引き起こす。エージェントが操作されることで、APIキー漏えいや未承認の取引などが発生する可能性があり、そのセキュリティ評価は動的な環境下で困難である。これに対抗するため、DecodingTrust-Agent Platform(DTap)を導入し、14の現実世界ドメインを再現したインタラクティブなレッドチーミングプラットフォームを提供。また、初の自律的レッドチーミングエージェントDTap-Redを提案し、さまざまな攻撃戦略を自律的に探索する。これにより、DTap-Benchという大規模なレッドチーミングデータセットをキュレーションし、安全な次世代エージェント開発のための重要な洞察を提供する。 Comment

元ポスト:

Loading…

Opus-4.6が本ベンチマーク上は最もセキュリティリスクに対して安全で、良性なタスクに対する性能を発揮するモデルに見える。
image

論文は279ページもある🤯




Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Evaluation #Environment Issue Date: 2026-06-27 GPT Summary- AIエージェントのサイバーセキュリティ能力を評価するために、実世界の脆弱性を扱った大規模ベンチマークCyberGymを導入。1,507件の脆弱性を持つ188のプロジェクトにわたるデータを使用し、エージェントが脆弱性を再現するPoCテストを生成することを主な課題とする。評価の結果、成功率は約20%にとどまり、CyberGymの難易度が示された。また、34件のゼロデイ脆弱性と18件の不完全なパッチが発見され、AIの進歩を測るための有効なプラットフォームであることが確認された。 Comment

pj page: https://www.cybergym.io/#benchmarks




Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #ReinforcementLearning #AIAgents #Reasoning #PostTraining #RLVR Issue Date: 2026-02-17 GPT Summary- セキュリティ分野におけるLLMエージェントの潜在能力を引き出すために、手続き的に生成された暗号用CTFデータセット『Random-Crypto』を提案。暗号推論を強化学習の理想的なテストベッドとして活用し、Pythonツールを用いてLlama-3.1-8BをGRPOでファインチューニング。得られたエージェントはPass@8で顕著な改善を見せ、『picoCTF』や『AICrypto MCQ』の外部ベンチマークにも一般化。アブレーション研究により、ツール活用の強化と手続き的推論の向上が寄与していることが示され、複雑なサイバーセキュリティタスクに対応可能な知的LLMエージェント構築の基盤を確立。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#Article #AIAgents #Blog #read-later #Selected Papers/Blogs Issue Date: 2026-08-10 Comment

元ポスト:

Loading…

所見:

Loading…

所見:

Loading…

関連:
- OpenAI and Hugging Face partner to address security incident during model evaluation, OpenAI, 2026.07
- [Paper Note] Chunky Post-Training: Data Driven Failures of Generalization, Seoirse Murray+, arXiv'26, 2026.02
- [Paper Note] Natural Emergent Misalignment from Reward Hacking in Production RL, Monte MacDiarmid+, arXiv'25, 2025.11




Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Alignment #AIAgents #Blog #Safety #LongHorizon #Initial Impression Notes #Author Thread-Post Issue Date: 2026-07-31 Comment

元ポスト:

Loading…

モデル評価のためにサンドボックス環境でnanogpt speedrunを用いてlong-horizonタスクを実施させていたところ、slackにのみ結果を通知するよう指示をしていたが、長時間モデルが稼働するにつれこの指示を無視し、nanogpt speedrunの本来の結果の報告先である公開リポジトリにPRを開くことを試み、そのためにサンドボックスの脆弱性を見つけ、githubへのアップロードを始めた挙動を見せたことを受け、これに対処するためにセーフガードを構築した、という話のようである。

関連する話題としては、割と大騒ぎになった以下もある:
- OpenAI and Hugging Face partner to address security incident during model evaluation, OpenAI, 2026.07




Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Alignment #AIAgents #Evaluation #Blog #Safety #Attack #Video #Selected Papers/Blogs Issue Date: 2026-07-22 Comment

Hugging Face側のブログ:
Security incident disclosure — July 2026
https://huggingface.co/blog/security-incident-july-2026

元ポスト:

Loading…

video: https://youtu.be/87DyyMV0kCY

関連:
- Incident Report: unsanctioned agent behaviour during cyber testing, AISI, 2026.08
- [Paper Note] Chunky Post-Training: Data Driven Failures of Generalization, Seoirse Murray+, arXiv'26, 2026.02
- [Paper Note] Natural Emergent Misalignment from Reward Hacking in Production RL, Monte MacDiarmid+, arXiv'25, 2025.11

所見:

Loading…




Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #One-Line Notes Issue Date: 2025-10-31 Comment

元ポスト:

Loading…

> In benchmark testing on “golden” repositories, Aardvark identified 92% of known and synthetically-introduced vulnerabilities, demonstrating high recall and real-world effectiveness.

合成された脆弱性については92%程度検出できたとのこと。Claudeとかだとこの辺はどの程度の性能なのだろう。