DoubleDescent


Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Grokking #Selected Papers/Blogs #Memorization #reading #One-Line Notes #Author Thread-Post Issue Date: 2025-06-05 GPT Summary- モデルがデータポイントについての知識を推定し、現代の言語モデルの容量を測定する新手法を提案。記憶を意図しない記憶と一般化に分け、一般化を排除することで記憶を計算。GPTモデルの容量はパラメータあたり約3.6ビットと推定。データセットサイズの増加に伴い、記憶が満たされると「グロッキング」が始まり、意図しない記憶が減少。数百のトランスフォーマー言語モデルを訓練し、モデル容量とデータサイズの関係を示すスケーリング則を提示。 Comment

元ポスト:

Loading…

著者ポスト:

Loading…

解説:

Loading…

LLMはまず記憶をし、1パラメータあたり3.6ビットを超えると飽和する。飽和後は圧縮、一般化、Double Decent、Grokkingという経過を辿る、という話が解説ポストに記載されている。

openreview: https://openreview.net/forum?id=NhU661EZ9C