PII
[Paper Note] Stealing Reasoning Traces from Proprietary LLM APIs, Alexander Panfilov+, arXiv'26, 2026.08
Paper/Blog Link My Issue
#NLP #LanguageModel #Chain-of-Thought #Proprietary #API #Attack #read-later #Security #Author Thread-Post Issue Date: 2026-08-14 GPT Summary- 大規模言語モデルの推論過程が隠蔽され、クライアントに暗号化されたテキストブロックが返される中、設計上の脆弱性が明らかになった。これにより、異なるモデル間の暗号化ブロックの互換性を利用した復号ジャイルブレイクが可能となり、推論の抽出やプライベートデータの漏洩が実証された。具体的には、個人情報や資格情報が回収された他、有害情報の露呈や悪意のあるペイロードの埋め込みが可能になる課題が示された。各攻撃に対処するため、クライアント側の推論を保護する具体的な暗号技術やシステム緩和策が提案されている。 Comment
元ポスト:
所見:
-
-
所見:
関連:
- [Paper Note] How to Steal Reasoning Without Reasoning Traces, Tingwei Zhang+, arXiv'26, 2026.03
Introducing Rampart, National Design Studio, 2026.06
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Blog #OpenWeight #Privacy #One-Line Notes #Author Thread-Post Issue Date: 2026-07-08 Comment
HF: https://huggingface.co/nationaldesignstudio/rampart
生成AIに送信されるリクエストを検閲し、プロンプトに含まれる個人情報をマスクするよう訓練された軽量モデルのようである。ブログ下部のデモンストレーションを見るとイメージを掴みやすい。
元ポスト:
privacy-filter, openai, 2026.04
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #OpenWeight #Encoder Issue Date: 2026-04-23 Comment
元ポスト:
LFM2-350M-PII-Extract-JP, LiquidAI, 2025.10
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #SmallModel #OpenWeight #Japanese #RecurrentModels Issue Date: 2025-10-14 Comment
元ポスト:
ポイント解説:
関連:
- Introducing LFM2: The Fastest On-Device Foundation Models on the Market, LiquidAI, 2025.07
