LanguageModel (3311) — 12/17


Paper/Blog Link My Issue
#NLP #Dataset #Evaluation #TMLR #Selected Papers/Blogs #One-Line Notes #needs-revision Issue Date: 2023-07-03 GPT Summary- 言語モデルはスケールの拡大に伴い、新しい定量的・質的能力を示すが、その具体的な特性は未解明である。これを踏まえ、BIG-benchという新たなベンチマークを導入し、204の多様なタスクを評価。モデルの性能と較正は改善するが、絶対的には低く、スパース性の影響を受ける場合もある。特に、複数の手順を要するタスクは臨界規模での“ブレークスルー”を示す傾向があり、社会的バイアスは通常、スケールと共に増加するが、プロンプトによって改善可能である。 Comment

OpenReview: https://openreview.net/forum?id=uyTL5Bvosj

BIG-Bench論文。ワードクラウドとキーワード分布を見ると一つの分野に留まらない非常に多様なタスクが含まれることがわかる。
image
image

BIG-Bench-hardは、2024年にClaude3.5によって、Average Human Scoreが67.7%のところ、93.1%を達成され攻略が完了した。現在は最先端のモデル間の性能を差別化することはできない。

- Killed by LLM, R0bk




Paper/Blog Link My Issue
#Analysis #needs-revision Issue Date: 2023-05-11 GPT Summary- 言語モデルが社会科学研究における特定の人間サブ集団の有効な代理として機能する可能性を検討。バイアスの問題に対し、アルゴリズム的忠実性を提案し、モデルが人口統計に基づく応答分布を正確に模倣できることを示す。GPT-3の性能を実際の人間から得たデータと比較することで、表面的な類似を超えた複雑な相互作用を反映していることを明らかにし、言語モデルが人間と社会の理解を深める強力なツールとなる可能性を示唆する。

Paper/Blog Link My Issue
#NLP #ICLR #KnowledgeEditing #needs-revision Issue Date: 2023-05-04 GPT Summary- 最近の研究は、大規模言語モデルの更新に新たな記憶を利用する可能性を示しているが、主に単一の関連付けに限定されています。我々はMEMITを開発し、複数の記憶を使ってモデルを直接更新する手法を提案します。実験的に、GPT-J(6B)およびGPT-NeoX(20B)に対して多数の関連付けを効果的に処理できることを示し、従来の方法を大幅に上回る成果を達成しました。

Paper/Blog Link My Issue
#NeuralNetwork #NLP #Zero/Few/ManyShotPrompting #Chain-of-Thought #Prompting #NeurIPS #Selected Papers/Blogs #Surface-level Notes Issue Date: 2023-04-27 GPT Summary- 大規模言語モデル(LLMs)は自然言語処理において少数ショット学習の能力が高く、CoT promptingにより複雑な多段階推論を効果的に引き出す。特に「Let's think step by step」の追加で、ゼロショット推論能力が向上し、様々な論理推論タスクで手作りの例を使わずに性能を大幅に向上させた。例えば、InstructGPTモデルでのMultiArithの精度が17.7%から78.7%へ、GSM8Kが10.4%から40.7%と劇的な改善が見られた。この研究はLLMsの潜在的なゼロショット能力を示し、ファインチューニングや少数ショットの前にその知識を探求する重要性が強調されている。 Comment

Zero-Shot CoT (Let's think step-by-step.)論文

image

Zero-Shot-CoTは2つのステップで構成される:

- STEP1: Reasoning Extraction

- 元のquestionをxとし、zero-shot-CoTのtrigger sentenceをtとした時に、テンプレート "Q: [X]. A. [T]" を用いてprompt x'を作成

- このprompt x'によって得られる生成テキストzはreasoningのrationaleとなっている。

- STEP2: Answer Extraction

- STEP1で得られたx'とzを用いて、テンプレート "[X'] [Z] [A]" を用いてpromptを作成し、quiestionに対する回答を得る

- このとき、Aは回答を抽出するためのtrigger sentenceである。

- Aはタスクに応じて変更するのが効果的であり、たとえば、multi-choice QAでは "Therefore, among A through E, the answer is" といったトリガーを用いたり、数学の問題では "Therefore, the answer (arabic numerals) is" といったトリガーを用いる。



image



# 実験結果

表中の性能指標の左側はタスクごとにAnswer Triggerをカスタマイズしたもので、右側はシンプルに"The answer is"をAnswer Triggerとした場合。Zero-shot vs. Zero-shot-CoTでは、Zero-Shot-CoTが多くのb現地マークにおいて高い性能を示している。ただし、commonsense reasoningではperformance gainを得られなかった。これは [Paper Note] Chain-of-Thought Prompting Elicits Reasoning in Large Language Models, Jason Wei+, NeurIPS'22, 2022.01

で報告されている通り、commonsense reasoningタスクでは、Few-Shot CoTでもLambda135Bで性能が向上せず、Palm540Bで性能が向上したように、モデルのparameter数が足りていない可能性がある(本実験では17種類のモデルを用いているが、特に注釈がなければtext-davinci-002を利用した結果)。



image



## 他ベースラインとの比較

他のベースラインとarithmetic reasoning benchmarkで性能比較した結果。Few-Shot-CoTには勝てていないが、standard Few-shot Promptingtを大幅に上回っている。

image



## zero-shot reasoningにおけるモデルサイズの影響

さまざまな言語モデルに対して、zero-shotとzero-shot-CoTを実施した場合の性能比較。[Paper Note] Chain-of-Thought Prompting Elicits Reasoning in Large Language Models, Jason Wei+, NeurIPS'22, 2022.01

と同様にモデルサイズが小さいとZero-shot-CoTによるgainは得られないが、モデルサイズが大きくなると一気にgainが大きくなる。

image



## Zero-shot CoTにおけるpromptの選択による影響

input promptに対するロバスト性を確認した。instructiveカテゴリ(すなわち、CoTを促すトリガーであれば)性能が改善している。特に、どのようなsentenceのトリガーにするかで性能が大きくかわっている。今回の実験では、"Let's think step by step"が最も高い性能を占め最多。

image



## Few-shot CoTのprompt選択における影響

CommonsenseQAのexampleを用いて、AQUA-RAT, MultiArithをFew-shot CoTで解いた場合の性能。どちらのケースもドメインは異なるが、前者は回答のフォーマットは共通である。異なるドメインでも、answer format(multiple choice)の場合、ドメインが異なるにもかかわらず、zero-shotと比較して性能が大幅に向上した。一方、answer formatが異なる場合はperformance gainが小さい。このことから、LLMはtask自体よりも、exampleにおけるrepeated formatを活用していることを示唆している。また、CommonSennseをExamplarとして用いたFew-Shot-CoTでは、どちらのデータセットでもZero-Shot-CoTよりも性能が劣化している。つまり、Few-Shot-CoTでは、タスク特有のサンプルエンジニアリングが必要であることがわかる(一方、Zero-shot CoTではそのようなエンジニアリングは必要ない)。



image




Paper/Blog Link My Issue
#NLP #Zero/Few/ManyShotPrompting #Chain-of-Thought #Prompting #NeurIPS #Selected Papers/Blogs #Surface-level Notes #EmergentAbilities Issue Date: 2023-04-27 GPT Summary- 思考の連鎖によって、大規模言語モデルの推論能力が向上することを探求。チェーン・オブ・ソート思考のプロンプトを用いる事例を示し、3つのモデルでの実験を通じて算術や常識、象徴的推論において性能向上を確認。特に、5400億パラメータのモデルに8つのデモをプロンプトとして与えただけで、数学問題のGSM8Kベンチマークで最先端の精度を達成した。 Comment

Chain-of-Thoughtを提案した論文。CoTをする上でパラメータ数が100B未満のモデルではあまり効果が発揮されないということは念頭に置いた方が良さそう。

image

先行研究では、reasoningが必要なタスクの性能が低い問題をintermediate stepを明示的に作成し、pre-trainedモデルをfinetuningすることで解決していた。しかしこの方法では、finetuning用の高品質なrationaleが記述された大規模データを準備するのに多大なコストがかかるという問題があった。

このため、few-shot promptingによってこの問題を解決することが考えられるが、reasoning能力が必要なタスクでは性能が悪いという問題あがった。そこで、両者の強みを組み合わせた手法として、chain-of-thought promptingは提案された。

# CoTによる実験結果

以下のベンチマークを利用

- math word problem: GSM8K, SVAMP, ASDiv, AQuA, MAWPS

- commonsense reasoning: CSQA, StrategyQA, Big-bench Effort (Date, Sports), SayCan

- Symbolic Reasoning: Last Letter concatenation, Coin Flip

- Last Letter concatnation: 名前の単語のlast wordをconcatするタスク("Amy Brown" -> "yn")

- Coin Flip: コインをひっくり返す、 あるいはひっくり返さない動作の記述の後に、コインが表向きであるかどうかをモデルに回答するよう求めるタスク



## math word problem benchmark

- モデルのサイズが大きくなるにつれ性能が大きく向上(emergent ability)することがあることがわかる

- 言い換えるとCoTは<100Bのモデルではパフォーマンスに対してインパクトを与えない

- モデルサイズが小さいと、誤ったCoTを生成してしまうため

- 複雑な問題になればなるほど、CoTによる恩恵が大きい

- ベースラインの性能が最も低かったGSM8Kでは、パフォーマンスの2倍向上しており、1 stepのreasoningで解決できるSingleOpやMAWPSでは、性能の向上幅が小さい

- Task specificなモデルをfinetuningした以前のSoTAと比較してcomparable, あるいはoutperformしている

- image

## Ablation Study

CoTではなく、他のタイプのpromptingでも同じような効果が得られるのではないか?という疑問に回答するために、3つのpromptingを実施し、CoTと性能比較した:

- Equation Only: 回答するまえに数式を記載するようなprompt

- promptの中に数式が書かれているから性能改善されているのでは?という疑問に対する検証

- => GSM8Kによる結果を見ると、equation onlyでは性能が低かった。これは、これは数式だけでreasoning stepsを表現できないことに起因している

- Variable compute only: dotのsequence (...) のみのprompt

- CoTは難しい問題に対してより多くの計算(intermediate token)をすることができているからでは?という疑問に対する検証

- variable computationとCoTの影響を分離するために、dotのsequence (...) のみでpromptingする方法を検証

- => 結果はbaselineと性能変わらず。このことから、variableの計算自体が性能向上に寄与しているわけではないことがわかる。

- Chain of Thought after answer: 回答の後にCoTを出力するようなprompting

- 単にpretrainingの際のrelevantな知識にアクセスしやすくなっているだけなのでは?という疑問を検証

- => baselineと性能は変わらず、単に知識を活性化させるだけでは性能が向上しないことがわかる。



image



## CoTのロバスト性

人間のAnnotatorにCoTを作成させ、それらを利用したCoTpromptingとexamplarベースな手法によって性能がどれだけ変わるかを検証。standard promptingを全ての場合で上回る性能を獲得した。このことから、linguisticなstyleにCoTは影響を受けていないことがわかる。

image



# commonsense reasoning

全てのデータセットにおいて、CoTがstandard promptingをoutperformした。

image



# Symbolic Reasoning

in-domain test setとout-of-domain test setの2種類を用意した。前者は必要なreasoning stepがfew-shot examplarと同一のもの、後者は必要なreasoning stepがfew-shot examplarよりも多いものである。

CoTがStandard proimptingを上回っている。特に、standard promptingではOOV test setではモデルをスケールさせても性能が向上しなかったのに対し、CoTではより大きなgainを得ている。このことから、CoTにはreasoning stepのlengthに対しても汎化能力があることがわかる。



image




Paper/Blog Link My Issue
#NLP #LongContext #NeurIPS #memory #KeyPoint Notes Issue Date: 2023-04-25 GPT Summary- メモリ機構を持つセグメントレベル再帰型トランスフォーマー(RMT)を提案。局所情報と全体情報を保存・処理し、長いシーケンス間で情報を伝達可能。特別なメモリトークンを追加することでTransformerモデルに変更を加えずに実装。実験結果では、RMTは短いメモリサイズでもTransformer-XLと同等の性能を示し、長いシーケンス処理では優れていることが確認。再帰的メモリトランスフォーマーは長期依存関係の学習に対する有望なアーキテクチャ。 Comment

TransformerはO(N^2)であり、計算量がNに応じて指数関数的に増加してしまう。一方、sequenceの情報を全てN次元ベクトルに集約しなければならず、計算量の制約によって長い系列のRepresentationを獲得できない。

そこで、Transformerの構造は変えず、Inputにメモリtokenを追加することで、メモリ間の関係性を学習できるような手法を提案。長いトークン列に対しても、トークン列をセグメントとゆばれる単位に区切り、セグメントのInputの頭で、前断のセグメントのメモリtokenを入力し、最終的に現在のセグメントのメモリをoutputし、後断のセグメントに入力とする、といったことを繰り返すことで、長い系列も扱えるようにした。

セグメントをまたいでbackpropagationをかけることで、たとえセグメントとしては独立していても、メモリの情報を考慮することでセグメント間の依存関係を学習することが可能だと思われる。



image

openreview: https://openreview.net/forum?id=Uynr3iPhksa




Paper/Blog Link My Issue
#TimeSeriesDataProcessing #MachineLearning #Transformer #One-Line Notes Issue Date: 2022-12-29 GPT Summary- LTSFタスクに対するTransformer解法の妥当性を疑問視し、単純な1層線形モデル(LTSF-Linear)が既存のTransformerモデルを全ケースで上回る結果を示す。時間的関係の抽出における要素の影響を詳細に分析し、新たな研究の方向性を提案。将来的には他の時系列分析にもアプローチを見直すことを提唱。 Comment

Linear Layerに基づくシンプルな手法がTransformerベースの手法に時系列予測で勝ったという話




Paper/Blog Link My Issue
#NeuralNetwork #NLP #MultitaskLearning #PEFT(Adaptor/LoRA) #EMNLP #Encoder-Decoder #Grounding Issue Date: 2022-12-05 GPT Summary- UnifiedSKGフレームワークを提案し、21の構造化知識のグラウンディング(SKG)タスクをテキスト対テキスト形式に統合。これにより、体系的なSKG研究を促進し、異なるサイズのT5で最先端の性能を達成。マルチタスクチューニングが性能向上に寄与し、SKGのゼロショットおよび少数ショット学習における課題を示した。UnifiedSKGは他のタスクへの拡張も可能で、オープンソースとして公開されている。

Paper/Blog Link My Issue
#NLP #One-Line Notes #Scalability Issue Date: 2026-07-09 GPT Summary- 言語モデリングは大規模な知識リポジトリを活用し、世界の理解を深化させる。本研究では、数千万から2,800億パラメータのTransformerベースのモデルGopherの性能を分析し、152の多様なタスクで最先端を達成。特に、読解や事実確認でスケールの利得が大きいが、論理的推論には限界がある。モデルの挙動やばイアス、危害の交差を総合的に評価し、AIの安全性に向けた適用と害の軽減についても考察。 Comment

- [Paper Note] Scaling Language Models: Methods, Analysis & Insights from Training Gopher, Jack W. Rae+, arXiv'21, 2021.12
- 大規模言語モデルの次期バージョンPLaMo 3シリーズにおける120B事前学習モデル、31B蒸留モデルの評価, PFN, 2026.07

で利用されている weight reusingについて、`G3.3 Warm starting` に記載されている。概要としては
- LLMのキャパシティを増大させる際に、幅をスケーリングさせるよりも、深さをスケーリングさせる方が有望な結果となった

### 深さのスケーリング方法のbest practice
- 深さをスケーリングさせる、すなわち、5 layer -> 7 layerに拡張したい、という場合は、元の学習済みレイヤーを以下のルールによって複製することによって、拡張する:
- `round_int(range(num_layers_new)/num_layers_new * num_layers_old)`
- たとえば、`A B C D E` の5つのレイヤーで構成されているモデルがあったときに、これを7 layerに拡張したい場合は、上記indexに従って7つのレイヤーに学習済みレイヤーを割り当てると、`A B B C D D E` となる。

### 幅のスケーリング方法のbest practice
- (widthの拡張方法については正しく読めているかかなり自信がなく、間違っている可能性が非常に高いので注意)
- 幅をスケーリングさせる際は、MHA の weight matrices に対して列方向のコピー→行方向のコピー→ ノイズの注入を行う。
- 前提として以下を考える:
- MHAのQKV, outputのprojectionをそれぞれ、`W_q \in R^{d_model \times d_k}`, `W_k \in R^{d_model \times d_k}`, `W_v \in R^{d_model \times d_v}`, `W_o \in R^{h d_v \times d_model}` とする。
- このとき、オリジナルのtransformer論文では、`d_k = d_v = d_model/h` としている。
- つまり、各headに対応するW_{q, k, v, o}を列方向にconcatした行列 W^concat_{q, k, v, o}を考えると、列方向がh倍されるので、`W^concat_{q, k, v, o} \in R^{d_model \times d_model}` の正方行列で表現できる。ここで、`h * d_v= h * d_k= h * d_model/h = d_model` を用いた。
- この `W^{concat}_{*}` に対する操作を定義することで、multihead attentionが扱う幅を変更することができる。
- 元論文では、weight matricesと一言で言及されているが、これは(おそらく)`W^{concat}_{q, k, v, o}` のことを指していると思われる。実際、説明をする際は正方行列を前提に考えている(attention headごとに独立して考える元論文の数式では正方行列は weight matrices に出現しない)。
- まず `W^{concat}_{*}` において、head sizeをH, head数をnとしたときに、`nH \times nH` の行列を列方向にtilingすることによってattention headの数をmに拡張する。このとき、`d_k`, `d_v` のサイズは固定する。たとえば、head数をnからmに増やす際、最初のm-n個のheadを `W^{concat}_{*}` の右側に複製することによって拡張する、と説明されている。
- これはすなわち、個々のheadが扱う情報量は変化させずに、代わりにhead数を増やすことでスケーリングさせる、ということを指していると考えられる。
- 続いて、head数が増えたことによって `W^{concat}_{*}` が正方行列ではなくなった。これが正方行列になっていないとattentionの前後でbottleneck activation size(元論文ではd_modelのことをbottleneck activation sizeと呼称している)が変化してしまうので、正方行列にしなければならない。
- これを正方行列にするために、列方向に複製した行列の上端から数えて `(m-n) * d_k` 行分を行方向にconcatする。
- 最終的に、新たに初期化された重みに対してノイズを注入する。
- これによって構築された `W^{concat}_{*}` を図示したものが、下記Figure A32 と思われる。
- また、上記ではMHAの説明をしたが、MLPなどのd_modelが関わる各種weight matricesもwidthの拡張に含まれていると考えられる(じゃないとwidthの拡張と呼べないし)。
- optimizerの状態は再初期化して学習を実施する。
- Adam optimizerの状態に対して似たような処理を実施したが性能向上にはつながらなかった

image




Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #Transformer #read-later #Selected Papers/Blogs #LinearAttention Issue Date: 2026-04-22 GPT Summary- 線形化された自己注意機構とファストウェイト・コントローラの等価性を示し、遅いニューラルネットがファストウェイトをプログラムする方法を探る。FWPは有限メモリの操作を学習し、注意機構のメモリ容量限界を改善するために、加法的外積を用いたプログラミング命令を導入。動的学習率の計算も学習し、新しいカーネル関数を提案。合成リトリーバル問題や機械翻訳、言語モデリングタスクにおける利点を実験で示した。 Comment

Linear TransformerにおけるKV^Tを加算する固定された状態更新ではなく、差分だけを更新するDelta Ruleによって更新する Delta Networkを提案。

(まだ全然読めていないのでしっかり読みたい)

DeltaNet図解:

Loading…




Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #Transformer #Architecture #Selected Papers/Blogs #ActivationFunction #One-Line Notes Issue Date: 2026-02-16 GPT Summary- 大規模なTransformerモデルのコスト削減を目指し、プリミティブに基づく低レベルの探索を行い、Primerアーキテクチャを提案。これにより、自己回帰型言語モデリングで訓練コストを大幅に削減。具体的にはReLU活性化関数の二乗化と深さ方向の畳み込み層追加が主な改善点。実験により、計算規模が大きくなるほどPrimerの利得が増加し、特に5億パラメータの設定で元のT5アーキテクチャに対し4分の1のコストで改善を確認。また、19億パラメータ設定でも、訓練資源を大幅に削減しながら同等の性能を実現。再現性を考慮し、モデルをオープンソース化。 Comment

nanochat speedrunを改善させたReLU^2を提案しているとのこと

Loading…


QKV projectionの後にshort convolutionsを導入するアーキテクチャも提案されている
image




Paper/Blog Link My Issue
#EfficiencyImprovement #Pretraining #NLP #Transformer #NeurIPS #read-later #HyperparameterTransfer #One-Line Notes Issue Date: 2025-08-28 GPT Summary- ハイパーパラメータチューニングは高コストであり、特に大規模なニューラルネットワークにおいて負担が大きい。新たに提案するmuTransferは、最大更新パラメータ化(muP)を利用し、小さなモデルでチューニングしたHPをフルサイズモデルにゼロショットで転送する手法である。実験により、1300万パラメータのモデルからBERT-largeを超える性能を達成し、4000万パラメータからはGPT-3を上回る結果を得た。チューニングコストはそれぞれ事前学習コストの同等または7%に抑えられた。 Comment

openreview: https://openreview.net/forum?id=Bx6qKuBM2AD

小規模なモデルに対してハイパーパラメータのチューニングを実施し、同様のベースモデルで、**各layerのwidthが大きいもの**に対しても、小規模モデルで最適であったハイパーパラメータをzero-shotで転移することで near optimalなハイパーパラメータで学習できるmu Transferを提案。

モデルの深さ(以外にも下表中の*印のパラメータ)に対しても限定的に転移可能な模様。Post-Layer NormのTransformerやではあまりうまくいかないことが11節に記述されている(実験はpre-Layer Norm Transformer, ResNetに対して行われている模様)。
また、6.1節では、(実験的に)利用する小規模モデルのスケールとして幅256, 深さ4, バッチサイズ32, sequence長128, 訓練ステップ数5000を最低満たしており、かつスケールさせる幅が妥当な範囲内である必要がある、といった話が記述されている。

前提知識(muP)や条件が多そうな気がするので、しっかり確認した方がよさそう。
たとえば、muPで初期化されている必要があることや、転送可能なハイパーパラメータに限りがある(e.g. 学習率)、異なるデータに対するfinetuningなどは転送できないなど。


image

muP:
- [Paper Note] Feature Learning in Infinite-Width Neural Networks, Greg Yang+, ICML'21




Paper/Blog Link My Issue
#NLP #Dataset #Evaluation #CodeGeneration #Selected Papers/Blogs Issue Date: 2025-08-15 GPT Summary- 本論文では、汎用プログラミング言語におけるプログラム合成の限界を大規模言語モデルを用いて評価します。MBPPとMathQA-Pythonの2つのベンチマークで、モデルサイズに対する合成性能のスケールを調査。最も大きなモデルは、少数ショット学習でMBPPの59.6%の問題を解決可能で、ファインチューニングにより約10%の性能向上が見られました。MathQA-Pythonでは、ファインチューニングされたモデルが83.8%の精度を達成。人間のフィードバックを取り入れることでエラー率が半減し、エラー分析を通じてモデルの弱点を明らかにしました。最終的に、プログラム実行結果の予測能力を探るも、最良のモデルでも特定の入力に対する出力予測が困難であることが示されました。 Comment

代表的なコード生成のベンチマーク。

MBPPデータセットは、promptで指示されたコードをモデルに生成させ、テストコード(assertion)を通過するか否かで評価する。974サンプル存在し、pythonの基礎を持つクラウドワーカーによって生成。クラウドワーカーにタスクdescriptionとタスクを実施する一つの関数(関数のみで実行可能でprintは不可)、3つのテストケースを記述するよう依頼。タスクdescriptionは追加なclarificationなしでコードが記述できるよう十分な情報を含むよう記述するように指示。ground truthの関数を生成する際に、webを閲覧することを許可した。
image

MathQA-Pythonは、MathQAに含まれるQAのうち解答が数値のもののみにフィルタリングしたデータセットで、合計で23914サンプル存在する。pythonコードで与えられた数学に関する問題を解くコードを書き、数値が一致するか否かで評価する、といった感じな模様。斜め読みなので少し読み違えているかもしれない。

image




Paper/Blog Link My Issue
#NLP #Dataset #Evaluation #CodeGeneration #Selected Papers/Blogs Issue Date: 2025-08-15 GPT Summary- CodexはGitHubのコードでファインチューニングされたGPT言語モデルで、Pythonコード生成能力を評価。新しい評価セットHumanEvalでは、Codexが28.8%の問題を解決し、GPT-3は0%、GPT-Jは11.4%だった。繰り返しサンプリングが難しいプロンプトに対しても効果的な戦略を用い、70.2%の問題を解決。モデルの限界として、長い操作の説明や変数へのバインドに苦労する点が明らかに。最後に、コード生成技術の影響について安全性や経済に関する議論を行う。 Comment

HumanEvalデータセット。Killed by LLMによると、GPT4oによりすでに90%程度の性能が達成され飽和している。

164個の人手で記述されたprogrammingの問題で、それぞれはfunction signature, docstring, body, unittestを持つ。unittestは問題当たり約7.7 test存在。handwrittenという点がミソで、コンタミネーションの懸念があるためgithubのような既存ソースからのコピーなどはしていない。pass@k[^1]で評価。

[^1]: k個のサンプルを生成させ、k個のサンプルのうち、サンプルがunittestを一つでも通過する確率。ただ、本研究ではよりバイアスをなくすために、kよりも大きいn個のサンプルを生成し、その中からランダムにk個を選択して確率を推定するようなアプローチを実施している。2.1節を参照のこと。

image




Paper/Blog Link My Issue
#NLP #EMNLP #KnowledgeEditing Issue Date: 2025-06-18 GPT Summary- KnowledgeEditorは、事前学習された言語モデルの知識を編集し、再学習なしで誤った事実や予測を修正する手法です。制約最適化を用いてハイパーネットワークを訓練し、他の知識に影響を与えずに事実を修正します。BERTとBARTのモデルでその有効性を示し、特定のクエリに基づく予測変更がパラフレーズにも一貫して影響を与えることを確認しました。ハイパーネットワークは、知識操作に必要なコンポーネントを特定する「プローブ」として機能します。

Paper/Blog Link My Issue
#NLP #Dataset #Supervised-FineTuning (SFT) #Mathematics #Selected Papers/Blogs #Verification #needs-revision Issue Date: 2024-12-27 GPT Summary- 最先端の言語モデルは数学的推論に課題があり、GSM8Kという8,500件の小学生向け数学問題データセットを導入してその失敗を診断。特に、最大規模のトランスフォーマーモデルでも性能向上が難しいことを示す。モデルの補完の正しさを評価する検証器を訓練し、候補解を生成して最も高く評価されたものを選択する方法を提案。検証がGSM8Kの性能を大幅に向上させ、ファインチューニングよりも効果的にスケールすることを実証。 Comment

## 気持ち

- 当時の最も大きいレベルのモデルでも multi-stepのreasoningが必要な問題は失敗する

- モデルをFinetuningをしても致命的なミスが含まれる

- 特に、数学は個々のミスに対して非常にsensitiveであり、一回ミスをして異なる解法のパスに入ってしまうと、self-correctionするメカニズムがauto-regressiveなモデルではうまくいかない

- 純粋なテキスト生成の枠組みでそれなりの性能に到達しようとすると、とんでもないパラメータ数が必要になり、より良いscaling lawを示す手法を模索する必要がある

## Contribution

論文の貢献は

- GSM8Kを提案し、

- verifierを活用しモデルの複数の候補の中から良い候補を選ぶフレームワークによって、モデルのパラメータを30倍にしたのと同等のパフォーマンスを達成し、データを増やすとverifierを導入するとよりよく性能がスケールすることを示した。

- また、dropoutが非常に強い正則化作用を促し、finetuningとverificationの双方を大きく改善することを示した。

Todo: 続きをまとめる




Paper/Blog Link My Issue
#Analysis #NLP #Supervised-FineTuning (SFT) #PEFT(Adaptor/LoRA) #ACL #PostTraining #One-Line Notes Issue Date: 2024-10-01 GPT Summary- 事前学習された言語モデルのファインチューニングのダイナミクスを内因次元の観点から分析し、少ないデータでも効果的に調整できる理由を説明。一般的なモデルは低い内因次元を持ち、フルパラメータ空間と同等の効果を持つ低次元の再パラメータ化が可能であることを示す。特に、RoBERTaモデルを用いて、少数のパラメータの最適化で高いパフォーマンスを達成できることを実証。また、事前学習が内因次元を最小化し、大きなモデルが低い内因次元を持つ傾向があることを示し、内因次元に基づく一般化境界を提案。 Comment

ACL ver: https://aclanthology.org/2021.acl-long.568.pdf

下記の元ポストを拝読の上論文を斜め読み。モデルサイズが大きいほど、特定の性能(論文中では2種類のデータセットでの90%のsentence prediction性能)をfinetuningで達成するために必要なパラメータ数は、モデルサイズが大きくなればなるほど小さくなっている。

LoRAとの関係性についても元ポスト中で言及されており、論文の中身も見て後で確認する。
おそらく、LLMはBERTなどと比較して遥かにパラメータ数が大きいため、finetuningに要するパラメータ数はさらに小さくなっていることが想像され、LoRAのような少量のパラメータをconcatするだけでうまくいく、というような話だと思われる。興味深い。

image
元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #Transformer #PositionalEncoding #Selected Papers/Blogs #KeyPoint Notes Issue Date: 2024-05-24 GPT Summary- 位置エンコーディングはトランスフォーマーにおいて重要な役割を果たし、依存関係をモデル化するための監督信号を提供する。本研究では、トランスフォーマーに位置情報を組み込む手法を検討し、新たに提案するロータリーポジションエンベディング(RoPE)が絶対位置を回転行列でエンコードして相対位置依存性を取り入れることを示す。RoPEはシーケンス長の柔軟性や相対距離の増加に伴う依存性の減衰などの特性を持ち、強化済みトランスフォーマー(RoFormer)の評価は他の手法を一貫して上回ることを示している。RoFormerはHuggingfaceに統合済み。 Comment

RoPEを提案した論文

# Absolute Position Embedding と Relative Position Embedding

## TransformerにおけるQKVベクトルの計算方法

一般に、Transformerにおける Query (Q), Key (K), Value (V) は以下の式で定式化される:

image

m, nはそれぞれ位置を表す整数。Absolute Position Embeddingと、Relative Position Embeddingは、関数fの設計がそれぞれ異なっている:



## Absolute Position Embedding

absolute position embeddingは、固定されたposition ベクトル、あるいはtrainableなposition ベクトルpを、入力ベクトルに対して足し合わせる:

image



## Relative Position Embedding

一方、Relative Position Embeddingは、Queryの位置に対する、Key, Valueの相対位置(つまり、mとnの差)に対して、trainableなベクトル \tilde{p}_r をKey, Valueおよび相対距離rごとに用意し、そのベクトルを入力に足し合わせる、という定式化となっている:


image


ここで、r = clip(m-n, r_max, r_min)であり、r_max, r_minは考慮する相対距離の最大値と最小値である。

他にも様々な定式化が提案されているがたいてい定式化の中に相対位置m-nが出現する。


## RoPE

RoPEでは、入力Query, Keyベクトル(Q,K)に対して回転行列を適用することで、回転に対して位置情報を保持させる。具体的には、異なる位置m, nに対するq_m^T k_nを計算すると、回転行列をRとした場合式16に示されているように回転行列Rに相対位置m-nが現れ(るように設計されており)、相対位置を考慮したqkの計算になっている。[^1]


image

image


[^1]: (R_mq_m)^T R_nK_n = q_m^T (R_m^T R_n) k_n = q_m^T (R_{-m}R_n) k_n = q_m^T R_{n-m} k_n. ここで、R_m^T = R_{-m}であり、R_m R_n = R_{m+n}の性質を使っている。


RoPEは下記のような性質を持つ:

- long-term decay: θi = 10000−2i/d と設定することにより、相対位置が離れているトークンのベクトルとのinner productの値が小さくなる。すなわち、位置が離れているトークン間の依存関係が小さくなる。

- Linear-Attention: RoPEは回転行列であり、乗算後のベクトルのノルムを変化させない。このため、Linear Attentionの式の中に回転行列を組み込むことで、Linear Attentionと簡単に組み合わせることが可能



Absolute Position Embedding, Relative Position Embeddingでは、ベクトルに対して位置情報を加算する定式化で K, Vの計算時に位置情報を考慮していたため、Linear Attentionの計算そのものに位置情報を組み込んだ定式化とはなっていなかった。

が、RoPEでは回転行列を乗算する定式化であり、ノルムを変化させないのでLinear Attentionの定式化に組み込むことができる。このため、モデルのアーキテクチャを大きく変更しなくとも組み込める。

RoPE自体は実装にパラメータを必要としないが、モデルのその他のパラメータがRoPEに適用できるように学習されていないと適用できないであろう点には注意(事前学習時にRoPEが使われていれば話は別)。

- 国産生成AI PLaMoを支える事後学習と推論最適化, PFN, 2026.04


pp.22--23がRoPEを簡潔に説明しており分かりやすい




Paper/Blog Link My Issue
#ComputerVision #EfficiencyImprovement #Pretraining #NLP #Transformer #MultiModal Issue Date: 2023-08-22 GPT Summary- VLP(Vision-and-Language Pre-training)のアプローチは、ビジョンと言語のタスクでのパフォーマンスを向上させているが、現在の方法は効率性と表現力の面で問題がある。そこで、本研究では畳み込みフリーのビジョンと言語のトランスフォーマ(ViLT)モデルを提案する。ViLTは高速でありながら競争力のあるパフォーマンスを示し、コードと事前学習済みの重みはGitHubで利用可能である。 Comment

日本語解説: https://tech.fusic.co.jp/posts/2021-12-29-vilt/




Paper/Blog Link My Issue
#Sentence #Embeddings #NLP #RepresentationLearning #ContrastiveLearning #Catastrophic Forgetting #EMNLP #Selected Papers/Blogs #Surface-level Notes Issue Date: 2023-07-27 GPT Summary- SimCSEは、文の埋め込み表現を向上させる単純な対照学習フレームワークです。教師なしアプローチでは、入力文が自身を予測し、ドロップアウトがノイズとして機能します。この手法は従来の教師あり方法と同等の成果を上げ、ドロップアウトを除去すると表現の質が低下することが分かりました。また、教師付きアプローチでは、自然言語推論データセットからの注釈付きペアを活用し、対照学習に組み込みます。評価結果では、教師なしモデルが76.3%、教師ありモデルが81.6%のSpearmanの相関を達成し、既存のベスト結果をそれぞれ改善しました。対照学習の目的が埋め込みの空間の正則化に貢献することも示されました。 Comment

[Paper Note] Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks, Nils Reimers+, arXiv'19, 2019.08 よりも性能良く、unsupervisedでも学習できる。STSタスクのベースラインにだいたい入ってる

# 手法概要

Contrastive Learningを活用して、unsupervised/supervisedに学習を実施する。

Unsupervised SimCSEでは、あるsentenceをencoderに2回入力し、それぞれにdropoutを適用させることで、positive pairを作成する。dropoutによって共通のembeddingから異なる要素がマスクされた(noiseが混ざった状態とみなせる)類似したembeddingが作成され、ある種のdata augmentationによって正例を作成しているともいえる。負例はnegative samplingする。(非常にsimpleだが、next sentence predictionで学習するより性能が良くなる)

Supervised SimCSEでは、アノテーションされたsentence pairに基づいて、正例・負例を決定する。本研究では、NLIのデータセットにおいて、entailment関係にあるものは正例として扱う。contradictions(矛盾)関係にあるものは負例として扱う。

image



# Siamese Networkで用いられるmeans-squared errrorとContrastiveObjectiveの違い

どちらもペアワイズで比較するという点では一緒だが、ContrastiveObjectiveは正例と近づいたとき、負例と遠ざかったときにlossが小さくなるような定式化がされている点が異なる。

image

(画像はこのブログから引用。ありがとうございます。 https://techblog.cccmk.co.jp/entry/2022/08/30/163625)



# Unsupervised SimCSEの実験

異なるdata augmentation手法と比較した結果、dropoutを適用する手法の方が性能が高かった。MLMや, deletion, 類義語への置き換え等よりも高い性能を獲得しているのは興味深い。また、Next Sentence Predictionと比較しても、高い性能を達成。Next Sentence Predictionは、word deletion等のほぼ類似したテキストから直接的に類似関係にあるペアから学習するというより、Sentenceの意味内容のつながりに基づいてモデルの言語理解能力を向上させ、そのうえで類似度を測るという間接的な手法だが、word deletionに負けている。一方、dropoutを適用するだけの(直接的に類似ペアから学習する)本手法はより高い性能を示している。

[image](https://github.com/AkihikoWatanabe/paper_notes/assets/12249301/0ea3549e-3363-4857-94e6-a1ef474aa191)



なぜうまくいくかを分析するために、異なる設定で実験し、alignment(正例との近さ)とuniformity(どれだけembeddingが一様に分布しているか)を、10 stepごとにplotした結果が以下。dropoutを適用しない場合と、常に同じ部分をマスクする方法(つまり、全く同じembeddingから学習する)設定を見ると、学習が進むにつれuniformityは改善するが、alignmentが悪くなっていっている。一方、SimCSEはalignmentを維持しつつ、uniformityもよくなっていっていることがわかる。

image

image



# Supervised SimCSEの実験

アノテーションデータを用いてContrastiveLearningするにあたり、どういったデータを正例としてみなすと良いかを検証するために様々なデータセットで学習し性能を検証した。



- QQP4: Quora question pairs

- Flickr30k (Young et al., 2014): 同じ画像に対して、5つの異なる人間が記述したキャプションが存在

- ParaNMT (Wieting and Gimpel, 2018): back-translationによるparaphraseのデータセットa

- NLI datasets: SNLIとMNLI



実験の結果、NLI datasetsが最も高い性能を示した。この理由としては、NLIデータセットは、crowd sourcingタスクで人手で作成された高品質なデータセットであることと、lexical overlapが小さくなるようにsentenceのペアが作成されていることが起因している。実際、NLI datsetのlexical overlapは39%だったのに対し、ほかのデータセットでは60%であった。



また、condunctionsとなるペアを明示的に負例として与えることで、より性能が向上した(普通はnegative samplingする、というかバッチ内の正例以外のものを強制的に負例とする。こうすると、意味が同じでも負例になってしまう事例が出てくることになる)。より難しいNLIタスクを含むANLIデータセットを追加した場合は、性能が改善しなかった。この理由については考察されていない。性能向上しそうな気がするのに。

image

# 他手法との比較結果

SimCSEがよい。

image



# Ablation Studies

異なるpooling方法で、どのようにsentence embeddingを作成するかで性能の違いを見た。originalのBERTの実装では、CLS token のembeddingの上にMLP layerがのっかっている。これの有無などと比較。

Unsupervised SimCSEでは、training時だけMLP layerをのっけて、test時はMLPを除いた方が良かった。一方、Supervised SimCSEでは、 MLP layerをのっけたまんまで良かったとのこと。

image

また、SimCSEで学習したsentence embeddingを別タスクにtransferして活用する際には、SimCSEのobjectiveにMLMを入れた方が、catastrophic forgettingを防げて性能が高かったとのこと。



image

ablation studiesのhard negativesのところと、どのようにミニバッチを構成するか、それぞれのtransferしたタスクがどのようなものがしっかり読めていない。あとでよむ。




Paper/Blog Link My Issue
#PersonalizedDocumentSummarization #NLP #Dataset #PersonalizedGeneration #Personalization #PersonalizedHeadlineGeneration #ACL #Surface-level Notes Issue Date: 2023-05-31 GPT Summary- この論文では、ユーザーの興味とニュース本文に基づいて、ユーザー固有のタイトルを生成するパーソナライズされたニュース見出し生成の問題を解決するためのフレームワークを提案します。また、この問題のための大規模なデータセットであるPENSを公開し、ベンチマークスコアを示します。データセットはhttps://msnews.github.io/pens.htmlで入手可能です。 Comment

# 概要

ニュース記事に対するPersonalizedなHeadlineの正解データを生成。103名のvolunteerの最低でも50件のクリックログと、200件に対する正解タイトルを生成した。正解タイトルを生成する際は、各ドキュメントごとに4名異なるユーザが正解タイトルを生成するようにした。これらを、Microsoft Newsの大規模ユーザ行動ログデータと、ニュース記事本文、タイトル、impressionログと組み合わせてPENSデータを構成した。



# データセット生成手順

103名のenglish-native [speakerの学生に対して、1000件のニュースヘッドラインの中から最低50件興味のあるヘッドラインを選択してもらう。続いて、200件のニュース記事に対して、正解ヘッドラインを生成したもらうことでデータを生成した。正解ヘッドラインを生成する際は、同一のニュースに対して4人がヘッドラインを生成するように調整した。生成されたヘッドラインは専門家によってqualityをチェックされ、factual informationにエラーがあるものや、極端に長い・短いものなどは除外された。



# データセット統計量

image

image



# 手法概要

Transformer Encoder + Pointer GeneratorによってPersonalizedなヘッドラインを生成する。

Transformer Encoderでは、ニュースの本文情報をエンコードし、attention distributionを生成する。Decoder側では、User Embeddingを組み合わせて、テキストをPointer Generatorの枠組みでデコーディングしていき、ヘッドラインを生成する。

User Embeddingをどのようにinjectするかで、3種類の方法を提案しており、1つ目は、Decoderの初期状態に設定する方法、2つ目は、ニュース本文のattention distributionの計算に利用する方法、3つ目はデコーディング時に、ソースからvocabをコピーするか、生成するかを選択する際に利用する方法。1つ目は一番シンプルな方法、2つ目は、ユーザによって記事で着目する部分が違うからattention distributionも変えましょう、そしてこれを変えたらcontext vectorも変わるからデコーディング時の挙動も変わるよねというモチベーション、3つ目は、選択するvocabを嗜好に合わせて変えましょう、という方向性だと思われる。最終的に、2つ目の方法が最も性能が良いことが示された。

image



# 訓練手法

まずニュース記事推薦システムを訓練し、user embeddingを取得できるようにする。続いて、genericなheadline generationモデルを訓練する。最後に両者を組み合わせて、Reinforcement LearningでPersonalized Headeline Generationモデルを訓練する。Rewardとして、

1. Personalization: ヘッドラインとuser embeddingのdot productで報酬とする

2. Fluency: two-layer LSTMを訓練し、生成されたヘッドラインのprobabilityを推定することで報酬とする

3. Factual Consistency: 生成されたヘッドラインと本文の各文とのROUGEを測りtop-3 scoreの平均を報酬とする

とした。

1,2,3の平均を最終的なRewardとする。



# 実験結果

Genericな手法と比較して、全てPersonalizedな手法が良かった。また、手法としては②のattention distributionに対してuser informationを注入する方法が良かった。News Recommendationの性能が高いほど、生成されるヘッドラインの性能も良かった。

image



# Case Study

ある記事に対するヘッドラインの一覧。Pointer-Genでは、重要な情報が抜け落ちてしまっているが、提案手法では抜け落ちていない。これはRLの報酬のfluencyによるものだと考えられる。また、異なるユーザには異なるヘッドラインが生成されていることが分かる。

image




Paper/Blog Link My Issue
#NeuralNetwork #NLP #Supervised-FineTuning (SFT) #PEFT(Adaptor/LoRA) #EMNLP #PostTraining #Selected Papers/Blogs #KeyPoint Notes #SoftPrompt Issue Date: 2022-08-19 GPT Summary- 本研究では、凍結された言語モデルを特定のタスクに適応させるための「ソフトプロンプト」を学習するプロンプトチューニング手法を提案。逆伝播を通じて学習されるソフトプロンプトは、GPT-3の少数ショット学習を上回る性能を示し、モデルサイズが大きくなるほど競争力が増すことが確認された。特に、数十億のパラメータを持つモデルにおいて、全ての重みを調整するモデルチューニングに匹敵する性能を発揮。これにより、1つの凍結モデルを複数のタスクに再利用できる可能性が示唆され、ドメイン転送に対するロバスト性も向上することが明らかとなった。 Comment

日本語解説: https://qiita.com/kts_plea/items/79ffbef685d362a7b6ce

T5のような大規模言語モデルに対してfinetuningをかける際に、大規模言語モデルのパラメータは凍結し、promptをembeddingするパラメータを独立して学習する手法

言語モデルのパラメータ数が増加するにつれ、言語モデルそのものをfinetuningした場合(Model Tuning)と同等の性能を示した。

いわゆる(Softな) Prompt Tuning




Paper/Blog Link My Issue
#DocumentSummarization #NeuralNetwork #NaturalLanguageGeneration #NLP #Supervised-FineTuning (SFT) #PEFT(Adaptor/LoRA) #ACL #PostTraining #Selected Papers/Blogs #KeyPoint Notes Issue Date: 2021-09-09 GPT Summary- プレフィックスチューニングは、ファインチューニングの軽量な代替手段であり、言語モデルのパラメータを固定しつつ、タスク特有の小さなベクトルを最適化する手法です。これにより、少ないパラメータで同等のパフォーマンスを達成し、低データ設定でもファインチューニングを上回る結果を示しました。 Comment

言語モデルをfine-tuningする際,エンコード時に「接頭辞」を潜在表現として与え,「接頭辞」部分のみをfine-tuningすることで(他パラメータは固定),より少量のパラメータでfine-tuningを実現する方法を提案.接頭辞を潜在表現で与えるこの方法は,GPT-3のpromptingに着想を得ている.fine-tuningされた接頭辞の潜在表現のみを配布すれば良いので,非常に少量なパラメータでfine-tuningができる.



table-to-text, summarizationタスクで,一般的なfine-tuningやAdapter(レイヤーの間にアダプターを挿入しそのパラメータだけをチューニングする手法)といった効率的なfine-tuning手法と比較.table-to-textでは、250k (元のモデルの 0.1%) ほどの数のパラメータを微調整するだけで、全パラメータをfine-tuningするのに匹敵もしくはそれ以上の性能を達成.



image

Hugging Faceの実装を利用したと論文中では記載されているが,fine-tuningする前の元の言語モデル(GPT-2)はどのように準備したのだろうか.Hugging Faceのpretrained済みのGPT-2を使用したのだろうか.

autoregressive LM (GPT-2)と,encoder-decoderモデル(BART)へPrefix Tuningを適用する場合の模式図

image




Paper/Blog Link My Issue
#NLP #MultiModal #Scaling Laws #read-later #Selected Papers/Blogs #CrossDomain Issue Date: 2025-05-31 GPT Summary- 生成画像、ビデオ、マルチモーダルモデル、数学的問題解決の4領域におけるクロスエントロピー損失のスケーリング法則を特定。自己回帰型トランスフォーマーはモデルサイズと計算予算の増加に伴い性能が向上し、べき法則に従う。特に、10億パラメータのトランスフォーマーはYFCC100M画像分布をほぼ完璧にモデル化できることが示された。さらに、マルチモーダルモデルの相互情報量や数学的問題解決における外挿時の性能に関する追加のスケーリング法則も発見。これにより、スケーリング法則がニューラルネットワークの性能に与える影響が強調された。 Comment

Kaplan Law




Paper/Blog Link My Issue
#NLP #ICLR #Decoding #Diversity #Selected Papers/Blogs Issue Date: 2025-04-14 GPT Summary- 深層ニューラル言語モデルは高品質なテキスト生成において課題が残る。尤度の使用がモデルの性能に影響を与え、人間のテキストと機械のテキストの間に分布の違いがあることを示す。デコーディング戦略が生成テキストの質に大きな影響を与えることが明らかになり、ニュークリアスsamplingを提案。これにより、多様性を保ちながら信頼性の低い部分を排除し、人間のテキストに近い質を実現する。 Comment

現在のLLMで主流なNucleus (top-p) Samplingを提案した研究




Paper/Blog Link My Issue
#MachineLearning #NLP #Scaling Laws #Selected Papers/Blogs Issue Date: 2025-03-23 GPT Summary- 言語モデルの性能に関するスケーリング法則を研究し、損失がモデルサイズ、データセットサイズ、計算量に対して冪則的にスケールすることを示す。アーキテクチャの詳細は影響が少なく、過学習やトレーニング速度は単純な方程式で説明される。これにより、計算予算の最適な配分が可能となり、大きなモデルはサンプル効率が高く、少量のデータで早期に収束することが示された。 Comment

日本語解説: https://www.slideshare.net/slideshow/dlscaling-laws-for-neural-language-models/243005067




Paper/Blog Link My Issue
#NeuralNetwork #NLP #Transformer #Selected Papers/Blogs #ActivationFunction #KeyPoint Notes Issue Date: 2024-05-24 GPT Summary- GLUの変種は非線形関数を用いて二つの線形射影を組み合わせ、Transformerモデルでテストした結果、従来の活性化関数ReLUやGELUよりも性能を向上させることが確認された。 Comment

一般的なFFNでは、linear layerをかけた後に、何らかの活性化関数をかませる方法が主流である。
最近FFNで利用される活性化関数として入力をsigmoid gateにlinear layerで変換して、同じくlinear layerで入力ベクトルを変換したベクトルとの要素積をとるGLUがあるが、これには改良の余地があり、様々なvariantが考えられるため、色々試しました(以下の8種類のvariantが提案されている)、というはなし。

image
image

オリジナルのGLUと比較して、T5と同じ事前学習タスクを実施したところ、perplexityが改善
image

また、finetuningをした場合の性能も、多くの場合オリジナルのGLUよりも高い性能を示した。
image
image
image





Paper/Blog Link My Issue
#InformationRetrieval #NLP #RAG(RetrievalAugmentedGeneration) #NeurIPS #Selected Papers/Blogs #Encoder-Decoder #ContextEngineering Issue Date: 2023-12-01 GPT Summary- 大規模な事前学習言語モデルを使用した検索強化生成(RAG)の微調整手法を提案しました。RAGモデルは、パラメトリックメモリと非パラメトリックメモリを組み合わせた言語生成モデルであり、幅広い知識集約的な自然言語処理タスクで最先端の性能を発揮しました。特に、QAタスクでは他のモデルを上回り、言語生成タスクでは具体的で多様な言語を生成することができました。 Comment

RAGを提案した研究

image

Retrieverとして利用されているDense Passage Retrieval (DPR)はこちら:
- [Paper Note] Dense Passage Retrieval for Open-Domain Question Answering, Vladimir Karpukhin+, EMNLP'20, 2020.04

所見:

Loading…




Paper/Blog Link My Issue
#NLP #Dataset #Evaluation #ICLR #Selected Papers/Blogs #One-Line Notes #needs-revision Issue Date: 2023-07-24 GPT Summary- 新しいテストを提案し、57のマルチタスクを用いてテキストモデルの正確度を測定。高い正確度には広範な世界知識と問題解決能力が必要である。GPT-3モデルはランダム推測を約20ポイント上回るが、専門家レベルには遠く、多くのタスクで偏った性能を示す。特に道徳や法に関してはほぼランダムに近い正確度を記録。このテストはモデルの理解力を評価し、重要な欠点を明らかにすることを目的とする。 Comment

OpenReview: https://openreview.net/forum?id=d7KBjmI3GmQ

MMLU論文

- [Paper Note] Are We Done with MMLU?, Aryo Pradipta Gema+, NAACL'25

において、多くのエラーが含まれることが指摘され、再アノテーションが実施されている。




Paper/Blog Link My Issue
#NeuralNetwork #NLP #Zero/Few/ManyShotPrompting #In-ContextLearning #NeurIPS #Selected Papers/Blogs Issue Date: 2023-04-27 GPT Summary- GPT-3は1750億パラメータの自己回帰型モデルで、タスク非依存のFew-shot学習を改善。ファインチューニングなしで多様なNLPタスクで高い性能を示し、人間と区別しにくい文を生成可能。訓練の課題も明らかに。 Comment

In-Context Learningを提案した論文

論文に記載されているIn-Context Learningの定義は、しっかり押さえておいた方が良い。

下図はmeta-learningの観点から見たときの、in-contextの位置付け。事前学習時にSGDでパラメータをupdateするのをouter loopとし、そこで広いスキルとパターン認識の能力を身につける。一方で、in-context learningは、Inference時に事前学習時に得たそれらのスキルを用いて、求めるタスクを認識、あるいは適応するInner loopのことを指す。
image

この上で、論文中では In-Context Learningについて:
> Recent work [RWC+19] attempts to do this via what we call “in-context learning”, using the text input of a pretrained language model as a form of task specification: the model is conditioned on a natural language instruction and/or a few demonstrations of the task and is then expected to complete further instances of the task simply by predicting what comes next.

と定義している。




Paper/Blog Link My Issue
#NeuralNetwork #NaturalLanguageGeneration #NLP #DataToTextGeneration #pretrained-LM #Zero/FewShotLearning #Surface-level Notes Issue Date: 2022-12-01 Comment

# 概要

Neural basedなend-to-endなNLGアプローチはdata-hungryなので、Few Shotな設定で高い性能ができる手法を提案(Few shot NLG)

Table-to-Textタスク(WikiBIOデータ, 追加で収集したBook, SongドメインのWikipediaデータ)において、200程度の学習サンプル数でstrong baselineに対して8.0 point程度のBLEUスコアの向上を達成



# 手法

TabularデータのDescriptionを作成するには大きく分けて2つのスキルが必要

1. factualな情報を持つcontentをselectし、copyするスキル

2. factualな情報のコピーを含めながら、文法的に正しいテキストを生成するスキル

提案手法では、1を少量のサンプル(< 500)から学習し、2については事前学習済みの言語モデルを活用する。



image



encoderからコピーする確率をpcopyとし、下記式で算出する:

image

すなわち、encoderのcontext vectorと、decoderのinputとstateから求められる。

encoderとencoder側へのattentionはscratchから学習しなければならず、うまくコピーできるようにしっかりと”teach”しなければならないため、lossに以下を追加する:

image

すなわち、コピーすべき単語がちゃんとコピーできてる場合にlossが小さくなる項を追加している。

また、decoder側では、最初にTable情報のEmbeddingを入力するようにしている。

また、学習できるデータ量が限られているため、pre-trainingモデルのEmbeddingは事前学習時点のものに固定した(ただしく読解できているか不安)



# 実験

WikiBIOと、独自に収集したBook, Songに関するWikipediaデータのTable-to-Textデータを用いて実験。

このとき、Training instanceを50~500まで変化させた。

image



WikiBIOデータセットに対してSoTAを記録しているBase-originalを大きくoutperform(Few shot settingでは全然うまくいかない)。



inputとoutput例と、コピーに関するlossを入れた場合の効果。

image



人手評価の結果、Factual informationの正しさ(#Supp)、誤り(#Cont)ともに提案手法が良い。また、文法的な正しさ(Lan. Score)もコピーがない場合とcomparable

image






Paper/Blog Link My Issue
#Pretraining #Tools #NLP #Supervised-FineTuning (SFT) #ReinforcementLearning #PostTraining #Selected Papers/Blogs #Parallelism #One-Line Notes #DistributedLearning #TrainingFramework Issue Date: 2026-09-29 GPT Summary- 大規模Transformerモデルを学習するため、ネイティブPyTorchに少数の通信操作を追加する層内モデル並列化手法を提案。パイプライン型並列化と併用可能で、512 GPU上で最大83億パラメータのモデルを学習し、15.1ペタFLOPSと76%のスケーリング効率を達成。GPT-2型・BERT型モデルで既存のSOTAを上回り、WikiText103、LAMBADA、RACEで高い性能を実現。 Comment

Megatron-LMがメモされていなかったので追加。代表的なLLM・マルチモーダルモデル学習のためのフレームワーク

事前学習、継続事前学習だけでなく
- Swallow: LLaMA-2 日本語継続事前学習モデル, Kazuki Fujii, 2023.12

以下のような事後学習フレームワークのバックエンドとしても利用される:
- Nemo-RL, Nvidia, 2025.05
- verl: Volcano Engine Reinforcement Learning for LLMs, ByteDance Seed Team, 2025.04
- slime, THUDM & Zhihu, 2025.09
- ms-swiftによるMegatron-LMベースのQwen3のファインチューニング, Aratako, 2025.05




Paper/Blog Link My Issue
#NeuralNetwork #MachineLearning #NLP #Transformer #Architecture #NeurIPS #memory Issue Date: 2026-08-09 GPT Summary- ニューラルネットワークに統合可能な構造化メモリを提案し、アーキテクチャの容量を最大10億パラメータまで増加。プロダクトキーに基づく設計で、高速な最近傍探索を実現。パラメータ数の増加により、予測精度と計算効率のトレードオフを最適化。12層のメモリ拡張モデルが24層のベースラインを上回り、推論速度は2倍に。コードは公開。 Comment

パラメータ数と計算量を分離する手法の一つ。

slide: https://neurips.cc/media/neurips-2019/Slides/15837.pdf




Paper/Blog Link My Issue
#NaturalLanguageGeneration #Controllable #NLP #Transformer #Selected Papers/Blogs #Decoder Issue Date: 2026-01-16 GPT Summary- CTRLは、スタイルや内容、タスク特有の振る舞いを制御するコードに基づいて訓練された条件付きトランスフォーマー言語モデルで、1.63億パラメータを持つ。このモデルは、無監督学習の利点を生かしつつ、テキスト生成に対する明示的な制御を提供。CTRLは与えられたシーケンスに基づいて最も可能性のあるトレーニングデータを予測でき、データ分析の新たなアプローチを提示する。また、複数の事前訓練済みバージョンが公開されている。 Comment

Control Code(いわゆるタグ)によって条件付けることで生成されるテキストのスタイルや内容等をcontrollableにする研究の先駆け




Paper/Blog Link My Issue
#NeuralNetwork #MachineLearning #NLP #NeurIPS Issue Date: 2025-08-05 GPT Summary- 深い平衡モデル(DEQ)を提案し、逐次データのモデル化において平衡点を直接見つけるアプローチを示す。DEQは無限の深さのフィードフォワードネットワークを解析的に逆伝播可能にし、定数メモリでトレーニングと予測を行える。自己注意トランスフォーマーやトレリスネットワークに適用し、WikiText-103ベンチマークでパフォーマンス向上、計算要件の維持、メモリ消費の最大88%削減を実証。

Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #Transformer #Attention #KeyPoint Notes Issue Date: 2024-04-07 GPT Summary- マルチクエリ・アテンションを提案し、アテンション・ヘッド間でキーと値を共有することで、逐次推論時のメモリ帯域幅を削減。これにより、デコード速度が向上し、品質低下は最小限に抑えられたことを実験で確認。 Comment

**※ 以前のメモでは "Queryを単一にする" と記述していましたが、完全に誤りでした。**

Multi Query Attention論文。Multi-Head Attentionにおける **KVを全てのhead間で共有する(つまりKV Cacheの量が1/num_headになる)** することで代替する。劇的にDecoderのInferenceが早くなりメモリ使用量が減る。論文中では言及されていない?ようだが、後続の研究で性能と学習の安定性が課題が指摘されているようである。

image




Paper/Blog Link My Issue
#RecommenderSystems #NeuralNetwork #CIKM #SequentialRecommendation #One-Line Notes #Initial Impression Notes Issue Date: 2021-05-25 GPT Summary- ユーザーの動的嗜好をモデル化するために、BERT4RecというTransformerに基づく双方向エンコーダを導入。従来の順序型モデルの限界を克服し、Clozeタスクを用いて左側と右側の文脈を共同で条件付けしてアイテムを予測。さまざまなベンチマークデータセットにおいて、提案モデルが最先端の逐次モデルを一貫して上回る結果を示す。 Comment

BERTをrecsysのsequential recommendationタスクに転用してSoTA。
しっかり読んで無いけどモデル構造はほぼBERTと一緒。
異なる点は、Training時にNext Sentence Predictionは行わずClozeのみ行なっているという点。Clozeとは、実質Masked Language Modelであり、sequenceの一部を[mask]に置き換え、置き換えられたアイテムを左右のコンテキストから予測するタスク。異なる点としては、sequential recommendationタスクでは、次のアイテムを予測したいので、マスクするアイテムの中に、sequenceの最後のアイテムをマスクして予測する事例も混ぜた点。

もう一個異なる点として、BERT4Recはend-to-endなモデルで、BERTはpretraining modelだ、みたいなこと言ってるけど、まあ確かに形式的にはそういう違いはあるけど、なんかその違いを主張するのは違和感を覚える…。
sequential recommendationで使うuser behaviorデータでNext item predictionで学習したいことが、MLMと単に一致していただけ、なのでは…。

BERT4Recのモデル構造。next item predictionしたいsessionの末尾に [mask] をconcatし、[MASK]部分のアイテムを予測する構造っぽい?

image

オリジナルはtensorflow実装

pytorchの実装はこちら: https://github.com/jaywonchung/BERT4Rec-VAE-Pytorch/tree/master/models




Paper/Blog Link My Issue
#Pretraining #NLP #Optimizer #ICML #read-later #Selected Papers/Blogs Issue Date: 2026-08-06 GPT Summary- Shampooは、テンソル空間における確率的最適化のための新しい前処理アルゴリズムで、次元を縮約する行列の集合を保持し、収束保証を提供。実験により、Shampooが一般の最適化手法より速く収束し、実行時間は他の単純な手法と同等であることを示した。 Comment

次:
- [Paper Note] SOAP: Improving and Stabilizing Shampoo using Adam, Nikhil Vyas+, ICLR'25




Paper/Blog Link My Issue
#NeuralNetwork #Sentence #NLP #ACL #Surface-level Notes Issue Date: 2017-12-28 Comment

## 概要

通常のNeural Language Modelはsentence間に独立性の仮定を置きモデル化されているが、この独立性を排除し、preceding sentencesに依存するようにモデル化することで、言語モデルのコーパスレベルでのPerplexityが改善したという話。提案した言語モデルは、contextを考慮することで特に名詞や動詞、形容詞の予測性能が向上。Late-Fusion methodと呼ばれるRNNのoutputの計算にcontext vectorを組み込む手法が、Perplexityの改善にもっとも寄与していた。



## 手法

image



sentence間の独立性を排除し、Corpusレベルのprobabilityを下図のように定義。(普通はP(Slが条件付けされていない))

image



preceding sentence (context)をモデル化するために、3種類の手法を提案。



[1. bag-of-words context]

 ナイーブに、contextに現れた単語の(単一の)bag-of-wordsベクトルを作り、linear layerをかませてcontext vectorを生成する手法。



[2. context recurrent neural network]

 preceding sentencesをbag-of-wordsベクトルの系列で表現し、これらのベクトルをsequentialにRNN-LSTMに読み込ませ、最後のhidden stateをcontext vectorとする手法。これにより、sentenceが出現した順番が考慮される。



[3. attention based context representation]

 Attentionを用いる手法も提案されており、context recurrent neural networkと同様にRNNにbag-of-wordsのsequenceを食わせるが、各時点におけるcontext sentenceのベクトルを、bi-directionalなRNNのforward, backward stateをconcatしたもので表現し、attention weightの計算に用いる。context vectorは1, 2ではcurrent sentence中では共通のものを用いるが、attention basedな場合はcurrent sentenceの単語ごとに異なるcontext vectorを生成して用いる。



生成したcontext vectorをsentence-levelのRNN言語モデルに組み合わせる際に、二種類のFusion Methodを提案している。



[1. Early Fusion]

 ナイーブに、RNNLMの各時点でのinputにcontext vectorの情報を組み込む方法。

[2. Late Fusion]

 よりうまくcontext vectorの情報を組み込むために、current sentence内の単語のdependency(intra-sentence dependency)と、current sentenceとcontextの関係を別々に考慮する。context vectorとmemory cellの情報から、context vector中の不要箇所をフィルタリングしたcontrolled context vectorを生成し、LSTMのoutputの計算に用いる。Later Fusionはシンプルだが、corpusレベルのlanguage modelingの勾配消失問題を緩和することもできる。



image



## 評価

IMDB, BBC, PennTreebank, Fil9 (cleaned wikipedia corpus)の4種類のデータで学習し、corpus levelでPerplexityを測った。

image



Late FusionがPerplexityの減少に大きく寄与している。



image



PoSタグごとのperplexityを測った結果、contextを考慮した場合に名詞や形容詞、動詞のPerplexityに改善が見られた。一方、Coordinate Conjungtion (And, Or, So, Forなど)や限定詞、Personal Pronouns (I, You, It, Heなど)のPerplexityは劣化した。前者はopen-classな内容語であり、後者はclosed-classな機能語である。機能語はgrammaticalなroleを決めるのに対し、内容語はその名の通り、sentenceやdiscourseの内容を決めるものなので、文書の内容をより捉えることができると考察している。




Paper/Blog Link My Issue
#MachineLearning #Transformer #ICML #Normalization #Selected Papers/Blogs #Reference Collection Issue Date: 2025-04-02 GPT Summary- バッチ正規化を用いることで、深層ニューラルネットワークのトレーニングにおける内部共変量シフトの問題を解決し、高い学習率を可能にし、初期化の注意を軽減。これにより、同じ精度を14倍少ないトレーニングステップで達成し、ImageNet分類で最良の公表結果を4.9%改善。 Comment

メモってなかったので今更ながら追加した

共変量シフトやBatch Normalizationの説明は
- [Paper Note] Layer Normalization, Ba+, arXiv'16, 2016.07

記載のスライドが分かりやすい。




Paper/Blog Link My Issue
#NLP #ACL #IJCNLP #Selected Papers/Blogs #One-Line Notes #Reference Collection Issue Date: 2018-03-30 Comment

文のacceptability(容認度)論文。

文のacceptabilityとは、native speakerがある文を読んだときに、その文を正しい文として容認できる度合いのこと。

acceptabilityスコアが低いと、Readabilityが低いと判断できる。

言語モデルをトレーニングし、トレーニングした言語モデルに様々な正規化を施すことで、acceptabilityスコアを算出する。

日本語解説: http://www.lr.pi.titech.ac.jp/~sasano/acl2015suzukake/slides/01.pdf




Paper/Blog Link My Issue
#MachineTranslation #NLP #Selected Papers/Blogs #One-Line Notes Issue Date: 2024-12-24 GPT Summary- 本論文では、機械翻訳における大規模な統計的言語モデルの利点を報告し、最大2兆トークンでトレーニングした3000億n-gramのモデルを提案。新しいスムージング手法「Stupid Backoff」を導入し、大規模データセットでのトレーニングが安価で、Kneser-Neyスムージングに近づくことを示す。 Comment

N-gram言語モデル+スムージングの手法において、学習データを増やして扱えるngramのタイプ数(今で言うところのvocab数に近い)を増やしていったら、perplexityは改善するし、MTにおけるBLEUスコアも改善するよ(BLEUはサチってるかも?)という考察がされている

image

元ポスト:

Loading…

Large Language Modelsという用語が利用されたのはこの研究が初めてなのかも…?




Paper/Blog Link My Issue
#Article #ComputerVision #EfficiencyImprovement #NLP #MultiModal #Blog #PEFT(Adaptor/LoRA) #OpenWeight #Selected Papers/Blogs #Encoder #KeyPoint Notes #SystemOneModel Issue Date: 2026-10-02 Comment

元ポスト:

Loading…

概要しかブログ中には書いていないが、よさげに見える。

Qwen-3.8-27Bをバックボーンとし、Qwenのパラメータはフリーズした上で軽量なアダプタを学習し、ルーティングヘッドなるcross-attentionに基づいた各選択肢のスコアを出力するヘッドによって予測が実施されるようである。

これらは、内部で作成された合成データを用いて事後学習されたとのことである。lossはlabel smoothed cross entropy(正解、不正解ラベルを0/1としてクロスエントロピーを計算するのではなく、ハイパーパラメータεでスムージングしてlossを計算するものらしい)とBrier Loss(実際に予測された確率値と正解、不正解を1/0としたときの平均二乗誤差)なるものによって、正則化によって過学習を防止し、出力される確率値がでたらめにならないように学習することを目指しているように見える。

その後RLCDと呼ばれる、選択肢間の順序関係に基づいて、正解と隣接するラベルにも部分的に報酬を与えるようなrewardを持つ(オリジナルのポリシーから分布が大きくシフトしないようなペナルティ付き)RLによって学習をしているようである。これにより、より高いAccuracyと汎化性能が得られた、と一言記述されている。

Qwenが持つVision Encoderによって画像もエンコードでき(Jevは画像は不可と述べられている)、
context長が64kとJevの2倍で
Jevよりもlatencyが良く、
様々なベンチマークスコアで高いスコアを獲得としている、と報告している。

latencyはflashモデルであれば、DiffusionGemma-as-Jevを上回る。

HF: https://huggingface.co/Cloudflare/clef




Paper/Blog Link My Issue
#Article #NLP #MultiModal #Blog #LLMServing #VisionLanguageModel #One-Line Notes #Reading Reflections #SystemOneModel Issue Date: 2026-09-30 Comment

元ポスト:

Loading…

SGLangにおいて、Qwen3.8-27B、およびQwen3.5-35B-A3Bを、chat modelからdecision model(System Oneな分類モデル)として利用するためのエンドポイントが追加されたようである。

ドキュメントを読むと、要は既存のLLMに対してリクエストをreasoning modeをオフでprefillし、応答のトークン位置でのスコアリング、選択肢、yes/noのトークンのlogprobを取得し、たとえばyes/noトークンのprobabilityを計算する場合はyes/noの2 vocabularyのsoftmaxを計算する。つまり、単に通常のLLMの応答の開始位置でのラベルのlogprobを取得して、最もlogprobが高いラベルを返し上述の確率を返すというシンプルな実装に見える。

System Oneモデル向けの追加のチューニングや、分類headなどが学習されているわけではない(SGLangはLLM Servingエンジンでありモデルの学習そのものはしないだろうから、そりゃそうだ、という話だった)点に注意。シンプルに、LLMのデコード開始位置でのlogprobを用いた分類器であり、これを念頭におけば、このエンドポイントを利用した場合のおおよその性能の見当はつく(性能が悪いと言いたいわけではなく、これまでのLLM利用の経験からあたりをつけやすいという意図である)。

System One系の話は実装の中身を確認して、どのような原理の元駆動するかを確認しないと、足元をすくわれる気がする。外から見た時の挙動は同じでも、アーキテクチャが結構異なる気がする。あと、アーキテクチャだけでなく、System Oneモデル向けのデータや最適化がされているかによって、そもそもの予測性能やzero-shotでの汎化性能にかなり差が生まれるのではないか、と思っている。しかし、まあ結局自分たちのユースケースに対して必要な性能が出ていて、latencyが必要な水準に達しているかを確認すれば良いだけではある。




Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #Library #AIAgents #GPUKernel #Author Thread-Post Issue Date: 2026-09-30 Comment

元ポスト:

Loading…

所見:

Loading…

DeepSeekGEMMと呼ばれる、NVIDIA GPU向けに構築されたGPUカーネルライブラリをHuawei Ascend NPU向けに移植したもので、APIがDeepSeekGEMMと互換性があるため、同じpythonコードから動作させることができるようである。

一言解決:

Loading…




Paper/Blog Link My Issue
#Article #NLP #AIAgents #Blog #Test-Time Scaling #Selected Papers/Blogs #DeepResearch #Compression #Reading Reflections #autoresearch/RSI Issue Date: 2026-09-29 Comment

元ポスト:

Loading…

前半にオープンソースにするエコシステムとして
- エージェントのcontextの自動圧縮技術
- autonomous research
- 効率的なtest time scaling手法
- Deep Research

などの開発中におけるエピソードや、その性能の高さについて述べられている。

一方、記事全体で述べられている気持ちは博士課程在籍者(やアカデミアにいる研究者に)対するメッセージである。個人的に印象深かったのは、研究のunitが論文ではなく一貫性のあるエコシステムを構築することになる、という主張と、博士課程において容易に解決することができない課題に粘り強く取り組む力を身につけることは投資をする価値がある、という部分で、第一線の研究者の方がAI Agentによる研究環境の変化をどう捉えているかが少し垣間見えるのと、(現在の悲観的な博士課程の学生に対して)博士課程で学ぶことの価値やアカデミアだからこそなし得ることがメッセージングされており、非常に興味深く拝読した。

要約を読んだりするよりも、原文から伝わる気持ちを汲み取った方が良いと思う(という意味で原文全文を読んだ方が良いと思う)。




Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #Blog #Tokenizer #read-later #Initial Impression Notes Issue Date: 2026-09-28 Comment

元ポスト:

Loading…

関連:
- {G}igatoken: SIMD and Cache Hierarchies for 1000x Faster Byte-Pair Encoding Tokenization on Modern CPUs, Marcel R{\o}d, 2026.07

Gigatokenは、著者ポストを読む限り、そもそも今のtokenizerが1秒単位に処理できるデータ量(データレート)が、同様の規模感のデータを処理する際の他の実装、たとえばsimdjsonがGB/sなのに比べて遅すぎるという気持ちから端を発しているように思われる。

一方、tokenizersでは、イントロに膨大なデータセットでの学習、同時リクエストの処理、long contextでの処理等において、モデルへのデータ供給が追いつかず、tokenizerが新たなボトルネック(GPUを待たせるという意味で)になりつつあり、それを解決したいという気持ちが記述されている。




Paper/Blog Link My Issue
#Article #Analysis #NLP #GenerativeAI #Post #One-Line Notes Issue Date: 2026-09-28 Comment

主要なクローズドモデル、オープンモデルを提供する企業の(おそらくLLM周りの)ARRを比較したところ、オープンモデルのARRはクローズドモデルのARRの10%程度と推察される、という話に見える。

が、オープンモデルのプロバイダーに対して、古いデータが使われている(プロバイダーによっては、usageが数倍〜10倍になっている)という指摘と、Googleの売上に対するAIの間接的な貢献「軽視しすぎている、という指摘がある。

Loading…


あと、一部からClaudeに作成させ、検証をせずに読者側に検証の手間を委ねるのはいかがなものか、という趣旨の批判がある。




Paper/Blog Link My Issue
#Article #NLP #Supervised-FineTuning (SFT) #ReinforcementLearning #Blog #Distillation #PostTraining #read-later #One-Line Notes #Author Thread-Post Issue Date: 2026-09-25 Comment

元ポスト:

Loading…

RL前にSFTを通じてオフポリシー蒸留をすることが、どれだけ後段のRL後のパフォーマンスに影響するかを調査したようで、
- 小規模モデルには効果的だが大規模なモデルには効果が薄く
- ベースモデルに存在しない慣習や理解を必要とするタスクに対して効果的で
- 副作用としてポリシーのエントロピーが低減する、すなわちRL中の探索が抑制される

といった知見が得られたようである。

一見すると、SLMに関しては

- [Paper Note] A Sober Look at Progress in Language Model Reasoning: Pitfalls and Paths to Reproducibility, Andreas Hochlehnert+, COLM'25

と対立する知見に見えるが、前提として何が違うだろうか。

SLMに対しては同様の知見が示されている:
- [Paper Note] AceReason-Nemotron 1.1: Advancing Math and Code Reasoning through SFT and RL Synergy, Zihan Liu+, arXiv'25, 2025.06




Paper/Blog Link My Issue
#Article #NLP #Dataset #ReinforcementLearning #Repository #SmallModel #PostTraining #One-Line Notes #Environment Issue Date: 2026-09-25 Comment

元ポスト:

Loading…

SLMのcoding, datascience向けの
(いわゆるSmolな)RL学習用の5k+のverifiableなタスクデータ、Environment、評価、学習のコードを提供。

従来の初心者向けのチュートリアルでは、GSM8Kのような既に飽和したデータセットが主なデータであり、より実用的なデータに基づいたRLVRのための環境を整えた、という感じに見える。




Paper/Blog Link My Issue
#Article #NLP #ReinforcementLearning #Blog #PostTraining #Selected Papers/Blogs #One-Line Notes #CriticalBatchSize Issue Date: 2026-09-24 Comment

元ポスト:

Loading…

目標性能まで到達するまでに必要なwall-clock timeとLLMでのオンポリシーRLのバッチサイズの関係性を明らかにしているようである。

LLMのオンポリシーRLでは、生成と学習においてバッチサイズの大きさが非対称に働く(すなわち、生成側の並列数を増やすとモデルの重み転送をより多く共有できるため処理に要する時間が短縮されるが、学習側でバッチサイズが増えると処理時間は増加する)ため、生成側の並列数の変化によるスループットの向上と、学習側のバッチサイズによる更新に必要なサンプル数の両方を考える必要がある。

このとき、目標性能に到達するまでに必要な累積応答数N(学習側)、エンドツーエンドのスループットq(生成側だけではなくシステム全体)を考える。

これにより、バッチサイズを変化させた時に必要なサンプル数の変化の比率r_N (=N/N_pivot, r_Nが1より大きい場合は、新たなバッチサイズが基準となるバッチサイズよりも、ある性能に到達するまでより多くの応答を必要とする)、

スループットの変化の比率r_q(=q/q_pivot, r_q>1の場合は、1秒あたりにより多くの応答を処理できる)を定義でき、

r_q > r_Nの場合、すなわち、バッチサイズを大きくしたことによる、システムのエンドツーエンドのスループット向上による恩恵が、学習側のサンプルコストの悪化を上回った場合に、バッチサイズを大きくすることで学習が高速化される、このときの改善の度合いは r_N/r_q で測ることができる。例えば、r_N/r_q=0.8の場合、学習時間が20%削減されることを意味する、といったフレームワークを定義でき (The criterion部分を参照)、

実践的には、
- 候補となるバッチサイズについて、学習率や関連するハイパーパラメータを調整し、学習に利用される応答単位での学習に対する寄与を揃え、累積応答数が等しい点での学習曲線を比較することで、r_Nを推定し
- 与えられたバッチサイズにおいてシステムのスループットを最大化する設定を探索し、r_qを測定する
- その上で、r_N/r_qを測定し、最も学習時間が短縮されるバッチサイズを採用する

というプロセスにおとしこむことができる(conclusionを参照)

という感じの話のようにみえる。




Paper/Blog Link My Issue
#Article #Pretraining #NLP #Dataset #MoE(Mixture-of-Experts) #Selected Papers/Blogs #DataMixture #One-Line Notes #Reading Reflections #Author Thread-Post Issue Date: 2026-09-24 Comment

元ポスト:

Loading…

Marinの535B級のMoEモデルを学習した際のデータであり、利用されたツール(クラスタリングに利用されたモデル)も公開されている。

元ポスト中にデータ構築の手順が紹介されており、
- 学習が許可された152の公開データから、25Tトークンを利用
- deduplicationによる2.13T tokensを除外し
- 評価データとの重複を避けるために13-gramによるフィルタリングを実施し
- 特定の分野のデータ等をサンプリングしたいが、その際にソースではなくドキュメントの内容でグルーピングしたいので、embeddingに基づいてクラスタリングを実施し、200のクラスタを形成した

といった話が紹介されている。

LLM-jpではOpenSourceであるために、徹底的にデータセット内部まで精査をして、問題のあるインスタンスの修正等が実施されていたが、Marinではこのような取り組みは行われているのだろうか。特に、データセットに付与されているライセンスがオープンソースである場合でも、データセット、あるいはデータセット中のサンプルの出自を辿るとオープンソースとは呼べないものが存在するという話がある。

- 約12兆トークンの良質なコーパスで学習した新たな国産LLM「LLM-jp-4 8Bモデル」「LLM-jp-4 32B-A3Bモデル」をオープンソースライセンスで公開 ~一部ベンチマークでGPT-4oやQwen3-8Bを上回る性能を達成~, NII, 2026.04
- LLM-jp-4-VL 9Bリリース, LLM-jp, 2026.09

Marinコミュニティにおける"Open"の意味を読むと、Open Sourceの定義を満たすことを目指しているというより、weightを公開するだけではなく、その他の構築に関わる全ての情報を公開する、たとえば学習データであれば全データのソースを開示する、という開発プロセス全体を公開しますよ、という意味に見えるため、ライセンス的に問題のあるインスタンスの削除などは行われていないのかもしれない、が、Marinプロジェクトの公開されている全ての議論の中にそういった話題は存在するかもしれないので実際のところは一次ソースを当たらないとよくわからない。

https://marin.community




Paper/Blog Link My Issue
#Article #NLP #AIAgents #Blog #Proprietary #Selected Papers/Blogs #VisionLanguageModel #Reference Collection Issue Date: 2026-09-23 Comment

元ポスト:

Loading…

KernelBench-MegaのRTX PRO 6000向けにKimi Linearのデコード向けのメガカーネルを記述するベンチマークでAstraを超えてSoTAを達成したようである:

Loading…

所見:

Loading…

所見:

Loading…


GPTはeffortの増加に従い単調増加だが、Claude系はそうならない




Paper/Blog Link My Issue
#Article #NLP #AIAgents #read-later #Selected Papers/Blogs #Reference Collection #Author Thread-Post Issue Date: 2026-09-23 Comment

HF: https://huggingface.co/collections/XiaomiMiMo/mimo-v26

元ポスト:

Loading…

所見:

Loading…


Mimo-2.6はSWA+GQAのシンプルなアーキテクチャであり、それでOpenWeightモデルでSoTAを達成しており、進歩の多くはデータと事後学習のレシピの改善によってもたらされているという主張。

DeepSeekでも同じような報告がされている:
- DeepSeek-V4.1-Flash, DeepSeek AI, 2026.09

事前学習でも以下のような話はある:
- Pretraining progress is mostly coming from data, DWARKESH PATEL AND JERRY HAN, 2026.09

関連:
- We are streaming our RL big runs. The mimo-v2.6 series is coming soon, Xiaomi Mimo Team, 2026.09

開発者の方のポスト:

Loading…

所見:

Loading…


AA IndexでGPT-5.6-Solと同等性能を達成し、7kのRL dataとフレームワークをオープンにする予定とのこと。

所見:

Loading…

解説:

Loading…

- MAI-Thinking-1: Building a Hill-Climbing Machine, Microsoft, 2026.06

もあわせて読みたい




Paper/Blog Link My Issue
#Article #NLP #SmallModel #OpenWeight #reading #One-Line Notes #Reading Reflections #SystemOneModel Issue Date: 2026-09-20 Comment

元ポスト:

Loading…

こちらはJev系のモデルを謳うものと比較して、Qwenをベースにしており、かつ広範なタスクで評価がされているため、ある程度のzeroshotでの汎用モデルとは言えそうである。が、結局のところどこまで汎用的に使えるかはよくわからない。

関連:
- Needle 3 Automation Foundation Model For Tiny Devices, Cactus, 2026.09
- Introducing System One Models & Jev, TypeSafe AI, 2026.09




Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #Transformer #Blog #SmallModel #Proprietary #Architecture #Selected Papers/Blogs #One-Line Notes #ToolUse #Author Thread-Post #SystemOneModel Issue Date: 2026-09-19 Comment

元ポスト:

Loading…

チャットをせず、各ターンごとに関数呼び出しに特化したedge向け小型モデルとのこと。アプリが利用するツール群を渡し、ユーザの発言に基づいて全ての引数を埋めて関数を呼び出す、あるいはスキーマを与えればそのスキーマに則った出力を返し(構造化出力)、推測はしない(関数の範囲外のものは空出力)というもののようである。

これらは、simple attention networkと呼ばれるもので実現される。simple attention networkはtransformerからFFN Layerをを無くし軽量なHadarmard MLPというlayerに置き換え、FFNが従来保持していた知識に関する情報はengramによって、n-gram embedding側に持たせることによって高速、軽量化がじつげんされているようである。residual streamとしては、mHCが用いられているようである。
また、デプロイ時にモデルの深さを指定することで、20個あるうちのどのlayerを利用するかが決まり、性能とコストを調整できるようである。これを公式ポストではIntelligence Laddersと呼称している。

関連:
- [Paper Note] Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models, Xin Cheng+, arXiv'26, 2026.01
- [Paper Note] mHC: Manifold-Constrained Hyper-Connections, Zhenda Xie+, arXiv'25, 2025.12

関連:
- Introducing System One Models & Jev, TypeSafe AI, 2026.09

と思想が似ている。




Paper/Blog Link My Issue
#Article #NLP #AIAgents #Quantization #Blog #OpenWeight #ComputerUse #Selected Papers/Blogs #reading #One-Line Notes #Author Thread-Post Issue Date: 2026-09-18 Comment

元ポスト:

Loading…

HF: https://huggingface.co/collections/prism-ml/bonsai-2

関連:
- Announcing Bonsai 27B: The First 27B-Class Model to Run on a Phone, PrismRL, 2026.07

ternary weight (1bit)の重みで動作するBonsaiシリーズのメジャーアップデートで、Qwen-3.8-27Bをベースにしており、ベンチマークスコアの98.2パーセントを保持しつつ、1/9程度に利用メモリが節約されるようである。Computer Useも可能で、ローカルのRTX 5090でBrowser Useするデモが掲載されている。




Paper/Blog Link My Issue
#Article #ComputerVision #NLP #Alignment #AIAgents #GenerativeAI #FoundationModel #Safety #Video #Selected Papers/Blogs #VisionLanguageModel #Robotics #WorldModels #VisionLanguageActionModel #EmbodiedAI #Reading Reflections #WorldActionModel Issue Date: 2026-09-18 Comment

非常におもしろかった...色々と考えさせられるなあ。

特にフィジカルAIにおいて、中国は人海戦術で、(簡単な動作を学習できたら複雑な動作を実現することにつながるという仮説の元)非専門家の簡単な動作に関するデータを大量に収集し、最近では仮想環境でデータを合成し活用する動きがある(Sim-to-Real)に対して、日本の場合は、特定の企業の現場のデータを収集しようとする動きがある。(このような文脈において、日本の政策として考えた場合に)特定の企業が有する現場のデータは、その現場特有の特徴が入り込むから実はロボットの学習データに向いていない、という話は、なるほど、と思うなどした。

たとえば、
- [Paper Note] Open X-Embodiment: Robotic Learning Datasets and RT-X Models, Open X-Embodiment Collaboration+, arXiv'23, 2023.10
- [Paper Note] LeRobot: An Open-Source Library for End-to-End Robot Learning, Remi Cadene+, ICLR'26, 2026.02

のように、多様なデータを統一された枠組みで学習をすることで汎化することを狙うという戦略の場合は、現場データの現場特有のバイアス問題はどの程度緩和されるのだろうか。

- Superposition, Memorization, and Double Descent, Transformer Circuits Thread, 2023.01

のDouble Decentのような議論を考えると、同じ種別のデータで、きちんと多様なデータが集まっていれば、現場固有のバイアスが含まれていても汎用的な特徴量としては学習されずらい、という現象は起こるように思える。

また、仮想空間と実世界のgapもあるようで、視覚的なgapは合成データ等で埋め合わせがある程度できそうな一方で、触覚や力感のような繊細な部分や、物理的なセンサーのノイズや、実際のデバイスの物理的な個体差のようなものは、仮想空間上では再現しづらいという話もあるようである。

ただ、なんとなーく、まず汎用的なモデルを学習して基礎的な動作(LLMで言うところのatomic skill)を満足にできる基盤モデルを用意し(これはおそらく仮想空間や非専門家データで足りる)、その基盤モデルはin-context learning能力を備えていて、現場のロボットに適用する際にはfew-shotのdemonstrationや、ルーブリックのようなものを与えて制御する、というのでうまくいくシナリオは起きそうな気がしており、そうなると大量の現場データは必ずしも必要ではなさそうだよね、という気はする。

ただし、日本が人海戦術をとれないのであれば、汎用基盤モデル→現場での適用、というレールの上に乗るのであれば、直接的に汎化させるには専門的すぎる現場のデータが与えられたときに、そこからどのようにして汎用的な基盤モデルを学習できるのか、というところがうまくいけば、ある程度形になるのではなかろうか、と思うなどした。




Paper/Blog Link My Issue
#Article #NLP #ReinforcementLearning #AIAgents #Blog #PostTraining #Selected Papers/Blogs #One-Line Notes #Reading Reflections #Author Thread-Post Issue Date: 2026-09-17 Comment

元ポスト:

Loading…

リアルタイムでMimoのRLの学習の経過が公開されている。おもしろい

コストの試算:

Loading…


Mimo, 1T-A42Bの場合、RL 1stepあたり1000万円程度かかっているようだ。
おそらくインフラは高度に最適化されている。

現時点で2モデル合計でコストが約300万ドルに到達し、日本円にして約4.7億円(ドル円157円換算, pro 68B / flash 81B Tokens)🙄DeepSWEやコーディング系のベンチは順調にスコアが向上している。また、noticesに記載されているインシデントの報告が興味深く、インフラ周りのエラーや、学習に悪影響を与えるタスクやデータセット単位での除去なども情報共有されており大変興味深い。PostTrainingデータセットなどMixtureも公開されている。




Paper/Blog Link My Issue
#Article #Tutorial #NLP #AIAgents #Blog #SelfImprovement #KeyPoint Notes #autoresearch/RSI Issue Date: 2026-09-14 Comment

元ポスト:

Loading…

中国語が読めないので、LLMの力を借りながら読んでいるが、RSIについての定義と、RSIに関する研究を整理、分類するためのTaxonomyを複数の軸から整理しているようである。以下LLMの力を借りて読んだ内容を自分の言葉も交えてメモとして残す。

---

RSIとは、Agentが環境との相互作用から得たタスク軌跡とフィードバックを利用して、自身の状態を更新し、更新後の状態を後続タスクに活用すること、と定義しているようである。
かなり広めの定義に見えるが、ざっくり言うとこのような定義になるのは、管理人の理解でもそうだと思う。

Agent = Model + Harness と捉え、RSIの何を変えるのか、という部分について以下の分類を用いて整理をしているようである:
- Parameter: 経験をモデルの重みに内在化する
- 一例: [Paper Note] Self-Adapting Language Models, Adam Zweiger+, arXiv'25
- Context: LLMへのInputに反映させる
- 一例: [Paper Note] Prime Agent: A Self-Improving RLM Harness, Seth Karten+, arXiv'26, 2026.08
- Memory: 外部に保存された経験や情報として蓄積し、必要に応じて利用する
- 一例: [Paper Note] ReasoningBank: Scaling Agent Self-Evolving with Reasoning Memory, Siru Ouyang+, ICLR'26, 2025.09
- Skill: 次に同じ状況が起きたらどうすべきかをskillとして定義する。Memoryは過去の経験を蓄積するものであり、Skillは次どうするかを定義するという棲み分けをしている
- 以下は参考として管理人がピックしたもの
- [Paper Note] SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learning, Peng Xia+, arXiv'26, 2026.02 (パラメータも最適化しているがSKILLBANKが該当すると思われる)
- [Paper Note] SkillOpt: Executive Strategy for Self-Evolving Agent Skills, Yifan Yang+, arXiv'26, 2026.05
- Harness Code: Agentを動作させるプログラム(Scaffolding)を変更する
- 一例: [Paper Note] SkillSmith: Learning to Compose Parametric Skills and Textual Knowledge, Lucio M. Dery+, arXiv'26, 2026.07
- 元ブログ中では↑が挙げられているが、Darwin Godel Machineの方が近いのでは?[Paper Note] Darwin Godel Machine: Open-Ended Evolution of Self-Improving Agents, Jenny Zhang+, ICLR'26, 2025.05

また、進化を構造化(バージョン管理)する際の分類軸として
- chain: A->B->Cのように進化させ常に最新版を利用する
- tree: 木構造でバージョンを管理する。ある1つの親ノードから子ノードが構成される親子関係で管理
- 一例: [Paper Note] Darwin Godel Machine: Open-Ended Evolution of Self-Improving Agents, Jenny Zhang+, ICLR'26, 2025.05
- graph: グラフ構造でバージョン管理する。すなわち、複数のノードに基づいて新たなノードを構成できる。ノードはバージョンだけでなく、タスク、trajectoryなども該当すると読める。

と整理しているようである。

誰がAgentを更新するかという軸の整理では
- self (student): (生徒)自身が更新する
- Teacher: trajectoryをteacherが分析しteacherが更新する
- Student + Teacher: 上記の両方で、生徒がまずtrajectoryを整理し必要な項目の候補を挙げ、Teacherが精査をし反映させる

いつ進化するのか、という軸では
- offline: 経験を蓄積し一括で更新する
- online: タスク実行ごとに動的に更新する
- hybrid: オフラインで更新した後にデプロイ。デプロイ後もオンラインで新たな経験等を追加し動的に更新するような方式

と定義しているようである。

そのほかにも、補足的な分類軸として、
- acceptance criteria: 更新したものを反映する基準
- feedback source: feedbackの出自(ベンチマーク, 環境, verifier, LLM, 人間など)
- feedback type: score, non-score,
- update frequency: 更新頻度
- scope of experience: 経験がどのスコープまで利用可能なのか(generickに使えるのか、特定ドメインのみなのか等)




Paper/Blog Link My Issue
#Article #NLP #AIAgents #Evaluation #Blog #One-Line Notes #ContinualLearning Issue Date: 2026-09-13 Comment

元ポスト:

Loading…

Computer Use + Continual Learningに関するベンチマークで、仮想的な建設会社の経理担当として入社し、一定の見習い期間(7ヶ月)を経て、その期間に企業のハンドブックやERPシステムチュートリアル、過去の請求書などで学習をする想定。その実際の請求書処理をこなしていくが、そこには実務上の罠が多く意図的に仕掛けられているようで、Human Baselineでも成功率は51%。最終的にHuman Baselineを上回ったのはAstra, Fable 5.1のようである。モデル間の傾向の違いなども考察されているようである。




Paper/Blog Link My Issue
#Article #Pretraining #NLP #SyntheticData #Post #One-Line Notes Issue Date: 2026-09-11 Comment

Phi, Nemotron, Qwenは事前学習における合成データを非常に重視している一方、Kimi, Olmoは徐々に合成データの取り入れを強めてきているが、DeepSeek, MAIは利用していない、という戦略の違いがあるようだ。




Paper/Blog Link My Issue
#Article #NLP #OpenWeight #read-later #Selected Papers/Blogs #VisionLanguageModel #Reference Collection #Author Thread-Post #Decoder-Decoder Issue Date: 2026-09-10 Comment

元ポスト:

Loading…

Loading…

所見:

Loading…


え?もしかしてEncoder-Decoder???

Causal Encoder-Decoderという名称なので、seq2seqのようなBidirectionalなエンコーダを用いたものではなく、

エンコーダー、デコーダー共にautoregressiveモデルだが、エンコード用途とデコード用途でアーキテクチャやactivation paramなどに違いを持たせた、という感じだろうか。

デコーダ-デコーダアーキテクチャと呼ぶらしい:
Loading…


関連:
- [Paper Note] You Only Cache Once: Decoder-Decoder Architectures for Language Models, Yutao Sun+, NeurIPS'24, 2024.05

公式ポスト:

Loading…


ベンチマークスコアはfrontierモデルに匹敵する

HBMの使用量はV4-Flashから1/4, SSD使用量は1/8

合成データはいまだに利用していない:

Loading…

事後学習のデータ品質改善のROIがアルゴリズム改善のROIを上回る:

Loading…


関連(こちらは事前学習だが):
- Pretraining progress is mostly coming from data, DWARKESH PATEL AND JERRY HAN, 2026.09

解説:

Loading…

Artificial Analysisによる評価:

Loading…


とそれらに対する所見:
Loading…

Loading…

所見:

Loading…

v4.1 flashをhostingするためのコードリポジトリがいくつか新たに公開されたようである:

Loading…

所見:

Loading…




Paper/Blog Link My Issue
#Article #Analysis #Pretraining #NLP #Architecture #One-Line Notes #Data #Author Thread-Post Issue Date: 2026-09-09 Comment

元ポスト:

Loading…

2019--2025年までの代表的なデータとモデルアーキテクチャの組み合わせによる小規模実験を通じて、事前学習に対するデータ由来の改善とアーキテクチャ由来の改善を分離したところ、データはモデルの改善と比較して3倍以上寄与しているという結論を得た、という話のようである。

ただし、下記ポストのようにMoEが試されていないことや、評価タスクがPPLのようなcompletionベースなではなく、Multiple Choice Questionを用いているためデータが追加されることでbenchmaxingされやすい点が指摘されている。

Loading…




Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #Blog #LLMServing #One-Line Notes #GPUKernel #Author Thread-Post Issue Date: 2026-09-09 Comment

github: https://github.com/cohere-ai/cohere-megakernel

バッチサイズ1, 256k context、単一H100利用の条件下において、vLLM v0.24+FlashAttention3+Triton MoE backendよりも最大1.58倍デコーディングが高速(合成されたKV Cacheによる実験、実プロンプト+バッチサイズ8でも1.25--1.41倍高速)な実験的なLLM Servingエンジンのようである。
LLMのデコードを単一のカーネルに集約し、デコーディングのために必要な様々なステップごとの同期のオーバヘッドを削減したのだとか。

元ポスト:

Loading…




Paper/Blog Link My Issue
#Article #NLP #AIAgents #GenerativeAI #Blog #Mathematics #Selected Papers/Blogs #Proofs #Initial Impression Notes #Author Thread-Post Issue Date: 2026-09-09 Comment

あのペレルマン氏が証明したポアンカレ予想と並ぶミレニアム懸賞問題の一つである、ナビエストークス方程式の解の存在と滑らかさ、とやらがOpenAIが保有する未公開モデルによって証明されたかもしれないらしい。10000の協調エージェントによって88時間, トークン量は1300億トークンで解に到達したのだとか。

元ポスト:

Loading…

解説:

Loading…




Paper/Blog Link My Issue
#Article #NLP #AIAgents #Proprietary #Initial Impression Notes Issue Date: 2026-09-06 Comment

元ポスト:

Loading…

コストパフォーマンスは良さそうに見えるが、GPT-5.6-lunaが比較の表に記載されておらず、GPT-5.6-lunaのコストパフォーマンスに勝てるのだろうか?Artificial Analysisによる評価を待ちたい。

と思ったら以下ポストを見つけたが、DeepSWEにおいてはパレート最適な模様。GPT-5.6-lunaよりもコストは高いがその分性能も高い、ように見える。

Loading…


- DeepSWE: Measuring frontier coding agents on original, long-horizon engineering tasks, DeepSWE, 2026.05

高いように見えるなあ、と思ったらこのような話もある、ようである:
Loading…

CursorBenchでも似たような傾向:

Loading…


- Composer 2 のご紹介, Cursor, 2026.03

Terminal Bench 2.1→Terminal Bench 4.0のスコアの減少幅が大きいと言う指摘:

Loading…

task単位のstep数がかなり異なる:

Loading…




Paper/Blog Link My Issue
#Article #NLP #ReinforcementLearning #AIAgents #Blog #PostTraining #read-later #Selected Papers/Blogs #Initial Impression Notes Issue Date: 2026-09-06 Comment

元ポスト:

Loading…

397Bモデルに対するDPPOによる事後学習によってAPEX-Agentsのスコアを+11.2%を実現するための取り組みと地検が共有されているようである。

関連:
- [Paper Note] APEX-Agents, Bertie Vidgen+, arXiv'26, 2026.01
- [Paper Note] Rethinking the Trust Region in LLM Reinforcement Learning, Penghui Qi+, arXiv'26, 2026.02




Paper/Blog Link My Issue
#Article #NLP #AIAgents #Evaluation #Blog #Live #Initial Impression Notes Issue Date: 2026-09-05 Comment

元ポスト:

Loading…

関連:
- [Paper Note] Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces, Mike A. Merrill+, arXiv'26, 2026.01

新しいタスクを追加する方向性ではなく、既存のタスクで課題(拒否、正解が公開、品質面等)があるものや飽和したものを改善、評価実行時のタイムアウトやエラーなどのリソース面の改善をし測定誤差の低減なども実施しているようである

所見:

Loading…




Paper/Blog Link My Issue
#Article #NLP #AIAgents #Blog #Proprietary #Selected Papers/Blogs #Initial Impression Notes Issue Date: 2026-09-04 Comment

元ポスト:

Loading…

早くもGPT-5.6-Solと同等以上の性能に到達した模様

long context性能が良さそうに見える:

Loading…


と思いきや、(Museに限らないが)MRCRのスコアにはコンタミネーションの疑いがある。
Loading…

Artificial Analysisによる評価:

Loading…

Terminal Bench 2.1→Terminal Bench 4.0のスコアの減少幅が大きいと言う指摘:

Loading…




Paper/Blog Link My Issue
#Article #ComputerVision #NLP #AIAgents #Blog #Proprietary #Selected Papers/Blogs #VisionLanguageModel #Initial Impression Notes #Author Thread-Post Issue Date: 2026-09-04 Comment

元ポスト:

Loading…

GPT-5.6 Solから大幅に性能向上。scaling lawはいつまで続くのだろうか

ベンチマーク上は
- Claude: Fable 5.1 and Mythos 5.1, Anthropic, 2026.09

を超えている。

所見:

Loading…

アーキテクチャに関する所見:

Loading…


- [Paper Note] Nanbeige4.2-3B: Unlocking Agentic Capabilities in a Compact Model, Nanbeige Lab+, arXiv'26, 2026.07
- [Paper Note] Mixture-of-Recursions: Learning Dynamic Recursive Depths for Adaptive Token-Level Computation, Sangmin Bae+, NeurIPS'25

より注意深く指示に従い、CUAの能力も大幅に向上しているようである:

Loading…


CUAによってBlenderで作成されたhouseの例がなかなかすごい

Artificial Analysisによる評価によると、Artificial Analysis Indexでは5.6-Solと同等、Coding IndexでもFable 5と同等であり、OpenAIによるベンチマークスコアとかなり乖離があるように見える。パブリックなベンチマークに対して過剰に適合しているのか。それともArtificial Analysisのベンチマーク群とその重みづけにより算出されるスコアの相性が悪いのか。(まあこれを考えても不毛だけど)

Loading…

SRE-Benchと呼ばれるモデルがコンパイル済みのバイナリからソフトウェアをリバースエンジニアリングできるかを測定するベンチマークが飽和したとのこと:

Loading…


SRE-Bench:
https://benchlm.ai/benchmarks/srebench

所見:

Loading…

Artificial Analysis Indexのスコアが更新されてFable 5.1とAstraのスコアが同じになったようである😅:

Loading…




Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #Blog #OpenWeight #Selected Papers/Blogs #Initial Impression Notes #Author Thread-Post Issue Date: 2026-08-30 Comment

HF: https://huggingface.co/zai-org/GLM-5.3-Flash

320B-A18BでOpus 4.8相当のベンチマークスコアを達成

アーキテクチャ解説:

Loading…


- KDA
- FlashKDA: Flash Kimi Delta Attention — high-performance KDA kernels built on CUTLASS, MoonshotAI, 2026.04
- MLA
- [Paper Note] DeepSeek-V3 Technical Report, DeepSeek-AI+, arXiv'24, 2024.12
- DSA
- [Paper Note] DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models, DeepSeek-AI+, arXiv'25, 2025.12
- mHC
- [Paper Note] mHC: Manifold-Constrained Hyper-Connections, Zhenda Xie+, arXiv'25, 2025.12

所見:

Loading…


本ポストにある通り、中国系のOpenWeightモデルは
- linear attention
- sparse attention
- mHCのようなResidual Streamに対する工夫
- Muon

などを採用するのがデファクトとなっているように思われる。

所見:

Loading…




Paper/Blog Link My Issue
#Article #ComputerVision #NLP #OpenWeight #Selected Papers/Blogs #VisionLanguageModel #Initial Impression Notes #Author Thread-Post Issue Date: 2026-08-30 Comment

ベンチマークスコアはOpus 4.6超え。パラメータは125B-A6B、51Bの N-gram Embeddings。Gated Delta Net layerとQwen Sparse Attention と呼ばれる Layerを3:1の比率で積み上げていっているようである。N-gram Embedding、MTPも導入されている。また、Gated Residualと呼ばれる技術により、Residual Streamからの読み込み/書き込みを制御している。

- 関連:
- [Paper Note] Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models, Xin Cheng+, arXiv'26, 2026.01

HF: https://huggingface.co/Qwen/Qwen3.8-Flash-Next?spm=a2ty_o06.30285417.0.0.1d73c921FsyOPe&file=Qwen3.8-Flash-Next
technical report: https://github.com/QwenLM/Qwen3.8-Flash-Next/blob/main/tech_report.pdf

解説:

Loading…

所見:

Loading…




Paper/Blog Link My Issue
#Article #Analysis #Pretraining #NLP #Blog #MoE(Mixture-of-Experts) #One-Line Notes #Author Thread-Post Issue Date: 2026-08-30 Comment

元ポスト:

Loading…

sparse MoEモデルを学習する際に、浅い層のexpertが機能しなくなっていく(重みのノルムが非常に小さくなり学習シグナルも消失し回復しない)にもかかわらず、ロードバランシングは正常なままという現象を観測し(Silent Expert Death)、公開されているMoEモデルでも同様の現象が生じていることを確認。LM Loss as Auxiliary Loss (LLAL)と呼ばれる、最初の数千ステップで浅いMoE Layerを一時的に言語モデルのheadに接続し、その後その接続を削除するような方法を用いると、loss・downstream task性能が改善し silent expert collapseも防止することができた、という話のようである。

LLALの気持ちとしては、非常にSparseなMoEの学習では、浅い層を学習するためのpressureが小さいことが問題であることが前提のもと、これを解決するために、まず浅い層のexpert数を削減する、あるいは異なる学習率やweight decayをチューニングするなどの方法も検討している。しかしこれらの方法は結局ハイパーパラメータ探索の沼に学習をするたびにはまってしまい嬉しくない。そのため、よりgenericに適用可能な学習方法として、安定していて、モデルの本来の学習目的と整合していて、expertの差別化を促すような性質のものが求められ、これを満たすものとしてnext-token-predictionを活用することを提案している。
浅い層のexpertが何を学習することを求められるかというと、一般的にはlexical-levelな情報を学習していることを求められるが、現状ではSilnet Expert Deathによってこれがうまく進んでいないことが懸念される。これを是正するために、シンプルに浅いMoE LayerをLM headに接続し、next-token-predictionのlossをより直接供給することで学習を促す、という気持ちのようである。

image




Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #Blog #SmallModel #OpenWeight #SpeculativeDecoding #Author Thread-Post Issue Date: 2026-08-22 Comment

HF: https://huggingface.co/LiquidAI/LFM2.5-1.2B-Instruct-DSpark

他のLFM用のDraftモデルもある。

様々なLFM用のDraft Model

関連:
- [Paper Note] DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation, Xin Cheng+, arXiv'26, 2026.07




Paper/Blog Link My Issue
#Article #NLP #ReinforcementLearning #AIAgents #Blog #OpenWeight #SelfImprovement #reading Issue Date: 2026-08-20 Comment

HF: https://huggingface.co/collections/ornith-ai/ornith-15

元ポスト:

Loading…

関連:
- Ornith-1.0: Self-Scaffolding LLMs for Agentic Coding, Ornith, 2026.06

モデルを学習するためのタスク生成、scaffolding(e.g.,ヒントなどのタスクを適切な難易度に調整する足場を作ること)生成、解答の生成(ロールアウト)それぞれをself-improvementさせながら学習されたモデルとのこと。




Paper/Blog Link My Issue
#Article #NLP #OpenWeight #Japanese #OpenSource #Author Thread-Post Issue Date: 2026-08-19 Comment

元ポスト:

Loading…

関連:
- 約12兆トークンの良質なコーパスで学習した新たな国産LLM「LLM-jp-4 8Bモデル」「LLM-jp-4 32B-A3Bモデル」をオープンソースライセンスで公開 ~一部ベンチマークでGPT-4oやQwen3-8Bを上回る性能を達成~, NII, 2026.04




Paper/Blog Link My Issue
#Article #AIAgents #SyntheticData #Blog #SelfImprovement #One-Line Notes #Reading Reflections #Data #autoresearch/RSI #Author Thread-Post #AgentHarness #Creativity Issue Date: 2026-08-19 Comment

元ポスト:

Loading…

Data researchを自動的に実施することに特化したAgentHarness。端的に言うと、あるデータをキュレーション/合成し、decontaminationを実施した上でモデルを学習、評価、実験結果に基づいて改善を繰り返す。これによりClaude Codeを上回る性能を実現している。

image

興味深いのはClaude Codeと比較して、DataSmithを使うと2.6倍思考(reasoning tokenを生成)し、6.6倍のデータセットを試し、48.4倍のsubagent callを1回のsessionで実現する。そして、45倍のコードを記述し、1.8倍の研究アイデアを創出する。
image

decontaminationがどれだけ正確にできているかが鍵になりそうだなと思ったが、本ブログには具体的なアルゴリズムの記述はないように見えた。

が、以下のページには一言記載があり、どうならN-gramベースのmatchingでdecontaminationを実施しているようである。
https://www.datologyai.com/product?utm_source=chatgpt.com

- [Paper Note] Soft Contamination Means Benchmarks Test Shallow Generalization, Ari Spiesberger+, arXiv'26, 2026.02

で指摘されているように、表層ベースのマッチングアルゴリズムだけではSoft Contamination(意味的には重複しているが表層が異なるもの)は無くせない点で、limitationがあると考えられる(ただしこれは本ハーネスだけの問題というより評価全体の問題ではある)。




Paper/Blog Link My Issue
#Article #NLP #AIAgents #Evaluation #Blog #SelfImprovement #Initial Impression Notes #autoresearch/RSI #Author Thread-Post Issue Date: 2026-08-17 Comment

元ポスト:

Loading…

所見:

Loading…

18のフロンティアモデルでnanogpt speedrunに対してautoresearchを実施し、結果的に合計153回のrunを実施され、Fable 5が人間のレコードに対して83%まで迫ることができたが、新規のアイデアを創出する能力が欠如してあることが示唆された、と言う話に見える。




Paper/Blog Link My Issue
#Article #NLP #Search #AIAgents #Blog #One-Line Notes #Author Thread-Post Issue Date: 2026-08-15 Comment

GPT 5.6 Sol, Opus 5と同等以上の性能をもち、10倍安く、12倍高速なsearch agentとのこと。技術的な詳細は書かれていないように見え、ベンチマークの話が記述されている。

元ポスト:

Loading…

Prime Intellectによるポスト:

Loading…


Prime Intellectを通じて学習されたということは、大規模なAgentic RLを大規模なEnvironmentに対して実行したことが示唆される。




Paper/Blog Link My Issue
#Article #NLP #Blog #MoE(Mixture-of-Experts) #reading #One-Line Notes #GPUKernel #Author Thread-Post Issue Date: 2026-08-15 Comment

元ポスト:

Loading…

4k--128kのコンテキストに対して最大2.4倍高速なMoE向けCUDAカーネル。メモリ書き出しのトラフィックを大幅に削減することで実現。

参考:
- CUDA Programming Guide Part 1, Kazuki Fujii, 2026.06




Paper/Blog Link My Issue
#Article #NLP #OpenWeight #Selected Papers/Blogs #One-Line Notes Issue Date: 2026-08-15 Comment

GDPValでGPT-5.6-Sol, Fable5超え。ベンチマークスコアだけ見ると、フロンティアモデルにほぼ追いついたと言って良さそうに見える。残る砦はOpus 5

所見:

Loading…

所見:

Loading…


スケーリング則に関するLiterature、考察、GLM-5.3のその中での位置付けについて述べられている。ポスト中で言及されている Roberts et al. (2025)は以下

関連:
- [Paper Note] Compute Optimal Scaling of Skills: Knowledge vs Reasoning, Nicholas Roberts+, ACL'25 Findings, 2025.03
- Deconstructing Scaling Laws: The Triad of Optimization, Architecture, and Data, 苏剑林, 2026.07

weightが公開: https://huggingface.co/zai-org/GLM-5.3

Loading…




Paper/Blog Link My Issue
#Article #Tools #NLP #AIAgents #Coding #SelfImprovement #SoftwareEngineering #Selected Papers/Blogs #One-Line Notes #Reading Reflections #Author Thread-Post #AgentHarness Issue Date: 2026-08-14 Comment

元ポスト:

Loading…


モデル、ツール、スキル、セッション、sandbox、ファイルシステム、ループ、オーケストレーション、UI、全てがPluginとして実装されたpluggableなハーネスとのこと。

元ポスト:

Loading…

高い拡張性を持つため、self-improveするハーネスと相性が良さそう。

所見:

Loading…




Paper/Blog Link My Issue
#Article #NLP #Proprietary #Selected Papers/Blogs #One-Line Notes #Author Thread-Post Issue Date: 2026-08-14 Comment

元ポスト:

Loading…

GPT-5.6-Sol, Fable5等のフロンティアモデルと同等のベンチマークスコア

CursorBench 3.2において、パレート最適:

Loading…

Model Card: https://media.x.ai/v1/website/card-4p6-4cd2dc57.pdf

1.5T級のモデルで、1.2節にモデル学習の概要が記述されているが、極めてgenericな内容である。他はベンチマークの評価結果やjailbreakに対する堅牢性などの話がメイン。




Paper/Blog Link My Issue
#Article #NLP #AIAgents #OpenWeight #Selected Papers/Blogs #Initial Impression Notes #Author Thread-Post Issue Date: 2026-08-10 Comment

HF: https://huggingface.co/meta-models/Muse-Glimmer-30B

Museシリーズから初のOpenWeightモデルがリリースされ、ライセンスはApache 2.0

所見:

Loading…

Alexandr Wang氏によるポスト:

Loading…

ザッカーバーグ氏によるポスト:

Loading…


Muse Spark 1.2もオープンになるとのこと。

所見:

Loading…

アーキテクチャ解説:

Loading…




Paper/Blog Link My Issue
#Article #NLP #ReinforcementLearning #Blog #PostTraining #read-later #Selected Papers/Blogs #train-inference-mismatch #Initial Impression Notes #Asynchronous Issue Date: 2026-08-10 Comment

元ポスト:

Loading…

linear attentionモデルにおいて、初めてRLにおけるtrain-inference mismatchを完全に解消した実装とのことで、非常にインパクトが大きそうに見える。




Paper/Blog Link My Issue
#Article #Tutorial #NLP #Attention #Blog #MoE(Mixture-of-Experts) #read-later #Routing #Initial Impression Notes #LinearAttention #Author Thread-Post Issue Date: 2026-08-10 Comment

関連:
- Kimi K3: Open Frontier Intelligence, Moonshot AI, 2026.07

元ポスト:

Loading…

以下のようなKimi K3で利用されている技術の解説:
- linear attention
- DeltaNet
- GatedDeltaNet
- FlashKDA
- Kimi Linear
- MLA
- Attention Residuals
- LatentMoE
- Quantile load balancing (QB)
- KVCache Efficiency

関連:
- [Paper Note] Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention, Angelos Katharopoulos+, ICML'20
- [Paper Note] Linear Transformers Are Secretly Fast Weight Programmers, Imanol Schlag+, arXiv'21, 2021.02
- [Paper Note] Parallelizing Linear Transformers with the Delta Rule over Sequence Length, Songlin Yang+, NeurIPS'24, 2024.06
- FlashKDA: Flash Kimi Delta Attention — high-performance KDA kernels built on CUTLASS, MoonshotAI, 2026.04
- [Paper Note] Kimi Linear: An Expressive, Efficient Attention Architecture, Kimi Team+, arXiv'25, 2025.10
- [Paper Note] DeepSeek-V3 Technical Report, DeepSeek-AI+, arXiv'24, 2024.12
- [Paper Note] Attention Residuals, Kimi Team+, arXiv'26, 2026.03
- [Paper Note] LatentMoE: Toward Optimal Accuracy per FLOP and Parameter in Mixture of Experts, Venmugil Elango+, arXiv'26, 2026.01

QBをチェックしたい




Paper/Blog Link My Issue
#Article #NLP #Proprietary #Selected Papers/Blogs #VisionLanguageModel #Author Thread-Post Issue Date: 2026-08-09 Comment

2.4T-A95B モデルが翌週にopenになるとのこと。

元ポスト:

Loading…

言語モデル/coding agentとしては、Opus4.8と同等以上のスコアに見え、VLMとしては、ほとんどのベンチマークでFrontier Model(Fable5, GPT5.6-sol)を上回るスコアを示しているようである。

Loading…

object detectionでSoTA:

Loading…




Paper/Blog Link My Issue
#Article #Analysis #NLP #Blog #read-later #RecurrentModels #RecursiveModels #Author Thread-Post Issue Date: 2026-08-09 Comment

元ポスト:

Loading…

関連:
- [Paper Note] Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach, Jonas Geiping+, NeurIPS'25
- [Paper Note] Scaling Latent Reasoning via Looped Language Models, Rui-Jie Zhu+, arXiv'25, 2025.10

代表的なLooped Modelsアーキテクチャに対して、apple-to-appleな比較実験を実施し結果を考察しているようである。




Paper/Blog Link My Issue
#Article #NLP #Supervised-FineTuning (SFT) #ReinforcementLearning #SpeechProcessing #Japanese #TTS #One-Line Notes #train-inference-mismatch #Author Thread-Post Issue Date: 2026-08-09 Comment

元ポスト:

Loading…

以下記事を読んでおもしろかったポイントの要約

- 学習エンジン: FSDP + Transformer, 推論エンジン: vLLM
- LLMでのRLでは生成結果をルーブリックやReward Modelで評価できるが、音声の場合は音声トークン列だけを見ても評価できないため、波形へ複合し音声認識モデルで評価
- 報酬計算はTTS学習とは異なる依存関係が必要なので学習と報酬のサーバを分離することで柔軟性を高める
- 報酬にNLLを加えると、発話長が長くなる現象が発生し、Length Penaltyを加えることで改善される
- 実際の音声をきいてみると、発話がとても間延びしていて非常に興味深かった。
- 報酬設計と話者性の関係性を分析すると、Correct Error Rateによる報酬のみの場合は女性話者(のようにきこえる)割合が減り、+NLL, +Length Penaltyの場合は、女性話者(のようにきこえる)音声の割合が大幅に増加し、学習に何らかのバイアスが加わっている可能性が示唆された。
- これはCER, NLLの計算にWhisperを用いており、Whisperのベースモデルに対する音声合成結果において、女性話者の候補が報酬を得やすい状態であったことに起因することを分析(一般的なな女性音声において有利になっているわけではない)
- RLにおけるtrain-inference mismatchに関しても分析し
- FP16/BF16、エンジン(Transformer, vLLM)において、ミスマッチが存在し、エンジンよりも数値精度の変更の影響が大きく
- BF16にすると、FP16と比較して1位, 2位の出力候補のlogitが同値となる割合が増加し、音声トークンを生成するモデルのベースとなったLLMとlogitの同値率を比較すると、音声トークン生成の方が同値率が大幅に高い結果となった
- BF16/FP16の間の学習-生成の間での対数確率の差は、BF16の場合はFP16の約8倍となった(が、学習後のCERで見ると大きな差は生じなかった)。
- TTSモデルを評価する際には、モデルと音声コーデック符号化/復号の影響を分離して考える必要がある
- 人間がきいて同じ音声にきこえる場合でも、埋め込みを用いた類似度ではあまり高くないことがある

関連:
- Your Efficient RL Framework Secretly Brings You Off-Policy RL Training, Yao+, 2025.08
- [Paper Note] Defeating the Training-Inference Mismatch via FP16, Penghui Qi+, arXiv'25, 2025.10




Paper/Blog Link My Issue
#Article #ComputerVision #NLP #AIAgents #ComputerUse #VisionLanguageModel #Initial Impression Notes #GUI Issue Date: 2026-08-09 Comment

pj page: https://tongyi-mai.github.io/Qwen-UI-Agent/

多くのベンチマークでFrontier Modelを上回る性能を示すGUI Agent。デモを見るとなかなかインパクトがある。

image

元ポスト:

Loading…




Paper/Blog Link My Issue
#Article #NLP #Alignment #AIAgents #PostTraining #One-Line Notes #Rubric-based #Author Thread-Post Issue Date: 2026-08-09 Comment

元ポスト:

Loading…

Constitutional AIのようなルーブリックに基づいてモデルの振る舞いを調整する方法では、ルールの捉え方がモデルに応じて異なることで幅広い解釈が存在することが問題となることを指摘。モデル間での解釈を一致させるために、
- Interpretive Constraints: 法解釈の原理に基づいたPromptingによって、モデル側の解釈の裁量を制限し
- Iterative Refinement: 曖昧性のある記述をiterativeに洗練させる

ことによって緩和する。

関連:
- [Paper Note] Constitutional AI: Harmlessness from AI Feedback, Yuntao Bai+, arXiv'22




Paper/Blog Link My Issue
#Article #ComputerVision #NLP #OpenWeight #VisionLanguageModel #UMM #One-Line Notes #Author Thread-Post Issue Date: 2026-08-09 Comment

HF: https://huggingface.co/thinkingmachines/Inkling-Small

関連:
- Inkling: Our open-weights model, THINKING MACHINES, 2026.07

- 276B-A12B
- NVFP4
- 小規模なモデルだが、Inklingと同等以上の性能を達成(ただし、一般的な知識や事実性に関してはInklingの方が上)
- 事前学習データのDataMixtureや学習レシピにいくつかの改良
- Inklingを教師モデルとしたOPD
- codingに特化したagentic RLをスケールアップ

元ポスト:

Loading…




Paper/Blog Link My Issue
#Article #Pretraining #NLP #Blog #One-Line Notes #ResidualStream #LowPrecision #Author Thread-Post Issue Date: 2026-08-09 Comment

元ポスト:

Loading…

残差ストリームの精度はbf16で保存されるのが一般的で、70層以上の大きなモデルの場合、140回の累積演算を行うため、フル精度を保たないと誤差が蓄積し、学習に影響を与える可能性がある。実際に、bf16, fp32での残差ストリームのフル精度との差分や符号の反転を比較すると、fp32よりもbf16の方が誤差や符号反転の回数が、layerが深くなるにつれ顕著に大きくなった。

しかし、実際に3種類の幅・高さのバリエーションを持ったLlama3 1Bのバリエーションに対して、fp32、bf16の2種類の精度(つまり合計6種類のモデル・精度)で、FineWebから0.1Tトークンをバッチサイズ0.5M tokenで事前学習したところ、loss, downstreamタスクの性能共にほとんど差が見受けられなかった(唯一winograndeだけは差があった)、といった実験結果が記載されている。

筆者も示唆している通り、モデルのサイズや事前学習の学習トークン数の規模感が小さいので、より大きくしたら何か差は生まれるのだろうか。




Paper/Blog Link My Issue
#Article #Tutorial #Embeddings #NLP #Blog #Optimizer #Architecture #MoE(Mixture-of-Experts) #Scaling Laws #Selected Papers/Blogs #memory #reading #Data #needs-revision Issue Date: 2026-08-08 Comment

元ポスト:

Loading…

以下読んだ内容の個人的な理解の要約。誤りを含む可能性があるので元文献を読むことをおすすめします。めちゃめちゃ勉強になります。

- モデルの学習プロセスを与えられたデータD, アーキテクチャA, optimizer Oの下で、損失関数を最小化するプロセスとして定式化し、整理すると以下の3つの観点に分離できる
- L(E | D, A, O) = データ誤差 + 最適化誤差 + アーキテクチャ誤差 + 最適なアーキテクチャ・optimizerで学習したときにデータDが到達しうるloss
- ここで、Eはある理想的な分布(i.e., 無限に巨大なテストセット)であり、DはEのサンプリング結果にすぎない。
- L(E | D, A, O) は与えられたD, A, Oの下でモデルが理想分布E上で到達できる損失値を表している。
- 式(1)で示された不等式によって、ある制約のもとで、べき乗則の組み合わせの最小値を求めることができる。
- この不等式を用いて、L(E | D, A, O)に基づいて表現される Scaling Law(機械学習が持つ合理的な仮定に基づいて、学習に伴う様々な変数と最終的に到達しうるlossの関係性を表現した式)を整理していくことで、変数間の関係性を整理することができる。

- 記事中では、最適化誤差、アーキテクチャ誤差、データ誤差について、様々な合理的な仮定に基づいて Scaling Law をボトムアップに構築し、その際の考え方や、導き出した Scaling Law に実際の値をあてはめることで、既に文献で報告されている Scaling Lawと紐づけた考察が実施されている。
- 最適化誤差(学習率η、バッチサイズB、学習ステップ数Tの間の関係性):
- まず最適化誤差について着目し、合理的な仮定として「学習するほど効果が良くなる」という仮定のもと、ステップ数T, 学習率η, バッチサイズBを導入し、その関係性を記述する際の考え方を述べている(ステップ数が多いほど良い、学習率が大きいほどよい、学習はノイズの影響を受け、バッチサイズが小さいほどノイズは大きく、学習率が大きいほどノイズも大きい)。値が大きければプラスの効果をもたらすものはlossが下がると考えられるので負の指数を仮定し、値が大きいほどlossが増大すると考えられるものは正の指数を仮定し、その関係性を記述できる(式10)。
- これは式(1)で与えられた形と同じ形をしており、不等式の性質を用いて最適化誤差を最小化する最適な学習率、最適なバッチサイズ等を求めていくと、最適な学習率が与えられた上での、あるいは最適な学習率・最適なバッチサイズが与えられた上での Scaling Lawの式の形式が得られ、実際に理論的な解析から導かれた指数を代入し、下記研究で実験的に得られたScaling Lawとの比較を通じて考察をしている(たとえば、最適なバッチサイズは学習サンプル数Kの1以下のいあるべき乗に比例する、等)。
- Microsoft Law
- [Paper Note] Scaling Optimal LR Across Token Horizons, Johan Bjorck+, arXiv'24, 2024.09
- Step Law
- [Paper Note] Predictable Scale: Part I, Step Law -- Optimal Hyperparameter Scaling Law in Large Language Model Pretraining, Houyi Li+, arXiv'25, 2025.03
- アーキテクチャ差(パラメータ数N, 幅W, 深さHの間の関係性)
- 続いてアーキテクチャ差についても同様に合理的な仮定からスタートし(パラメータ数Nが大きいほどlossは小さくなる等)、同様に合理的な仮定のもと、式(1)を用いて関係性を整理していくことで、既存のScaling Lawとの関係性が考察されている。
- Kaplan Law
- [Paper Note] Scaling Laws for Autoregressive Generative Modeling, Tom Henighan+, arXiv'20, 2020.10
- Chinchilla Law
- [Paper Note] Training Compute-Optimal Large Language Models, Jordan Hoffmann+, NeurIPS'22, 2022.03
- 最適化誤差とアーキテクチャ誤差を統合した際の議論
- DeepSeek Law
- [Paper Note] DeepSeek LLM: Scaling Open-Source Language Models with Longtermism, DeepSeek-AI+, arXiv'24, 2024.01
- スパース性 / Memory:
- MoEやMemory (Embedding)等の、モデルの計算量とパラメータ数を分離する方法に関する Scaling Lawについても考え方が述べられている。
- たとえば、Denseモデルに対するScaling Lawでは計算量はおおむねパラメータ数Nに比例するという仮定があるが、MoEではそれに対して、総パラメータ数と活性化パラメータ数の比(スパース度S)を新たに導入し、計算量をおおむね活性化パラメータ数のみに依存するものと仮定する。
- スパース度Sを増やしても計算量は増えないが、損失は減るためスパース度を増やすことは(理論上は)基本的に有利に働く。
- 活性化パラメータ数N_act, 総パラメータ数N_totalを導入した過程からアーキテクチャに関するScaling Lawの式を整理すると、最終的にDenseの場合と同じ形式が現れ、N_act, N_totalから導き出される有効パラメータカウント N_eff のパラメータ数を持つDenseモデルと等価である、という見方もできる、などである。
- Ling Law
- [Paper Note] Towards Greater Leverage: Scaling Laws for Efficient Mixture-of-Experts Language Models, Changxin Tian+, arXiv'25
- データ誤差
- 最後にデータ誤差に関する Scaling Lawについても考察されている。
- ただし、データに関しては様々な要因から影響を受けるだけでなく、かつデータそのものを表現する際に、他のものと比較して境界があいまいで、明確に単一のスカラーで定量化可能な変数を持ちずらく、統一された形式を得ることが難しい、ということも説明されている。
- [Paper Note] Prescriptive Scaling Laws for Data Constrained Training, Justin Lovelace+, arXiv'26, 2026.05
- [Paper Note] Scaling Data-Constrained Language Models, Niklas Muennighoff+, NeurIPS'23

下記ポストも非常に勉強になる:

Loading…




Paper/Blog Link My Issue
#Article #NLP #AIAgents #Selected Papers/Blogs #One-Line Notes #Compression #Reading Reflections #Author Thread-Post #AgentHarness Issue Date: 2026-08-08 Comment

元ポスト:

Loading…

ARC-AGI-3のベンチマークを測定する際に、ARC-AGI-3が提供いているオフィシャルのシンプルなハーネスではなく、Response APIで実施されているような reasoningの保持と圧縮をするようなハーネスに変更したら、スコアが3倍以上になったよ、という話のようである。

それはそう、という感じではあるのだが、シンプルなハーネスでそのモデルが持つ強みを発揮しきれないのであれば、公平な比較になっていないよね?という話でもある。モデルの能力を測定するための変数が増えすぎて、公平な比較をするのがどんどん難しくなってきている。




Paper/Blog Link My Issue
#Article #Pretraining #NLP #OpenWeight #DataMixture #Korean Issue Date: 2026-08-06 Comment

テクニカルレポート: https://github.com/SKT-AI/A.X-K2/blob/main/A_X_K2_Tech_Report.pdf

- 8.2Tトークンで事前学習
- DataMixや学習ドメインの変遷などデータに関するレシピも記述されている(英語72.7%に対し、韓国語15.4%, コード8.3%, 日本語、スペイン語、中国語がそれぞれ約1%ずつ)

元ポスト:

Loading…

関連:
- A.X-K1, SK Telecom, 2026.01




Paper/Blog Link My Issue
#Article #Pretraining #NLP #Optimizer #read-later Issue Date: 2026-08-06 Comment

元ポスト:

Loading…

Muonよりもさらに高性能なoptimiserのようである。

関連:
- [Paper Note] Shampoo: Preconditioned Stochastic Tensor Optimization, Vineet Gupta+, ICML'18, 2018.02
- [Paper Note] Muon is Scalable for LLM Training, Jingyuan Liu+, arXiv'25, 2025.02
- [Paper Note] SOAP: Improving and Stabilizing Shampoo using Adam, Nikhil Vyas+, ICLR'25
- Fantastic Pretraining Optimizers and Where to Find Them 2.1: Hyperball Optimization, Wen+, 2026.01




Paper/Blog Link My Issue
#Article #Analysis #NLP #AIAgents #GenerativeAI #Blog #One-Line Notes #Reading Reflections #Author Thread-Post Issue Date: 2026-08-05 Comment

元ポスト:

Loading…

ChatGPTに送られるメッセージと、ユーザの職種に基づいて、特定の職種の人間が、自身の職種外のタスクに関するクエリをどれだけChatGPTに送付しているかを分析。これにより、職種外のタスクが多く投げられていることが定量的に示され、タスクの分担範囲がシフトしてきていることが分析されている。職種によって、度合いが異なり、たとえばカスタマーエクスペリエンスでは、職種固有のメッセージ(汎用的なメッセージではなくその職種特有のもの)のうち77%職種外タスクに関するもので、エンジニアの場合は28%であったりするのは興味深い。

このブログの分析対象はChatGPTだけだと思うが、生成AIを用いたSaaS系のサービスまで含めたら、かなり元々のスコープを広げて色々なことに取り組んでいる人はいるのではなかろうか?




Paper/Blog Link My Issue
#Article #EfficiencyImprovement #Blog #MoE(Mixture-of-Experts) #read-later #Selected Papers/Blogs #Initial Impression Notes #Author Thread-Post Issue Date: 2026-08-05 Comment

元ポスト:

Loading…

主要なOpenWeight LLM(アーキテクチャ)のスループットが軒並み2倍以上になっているので、これはかなりインパクトがでかい話に見える

関連:
- DeepEP: an efficient expert-parallel communication library, Zhao+, DeepseekAI, 2025.09
- MoonEP, MoonshotAI, 2026.07

ポイント解説:

Loading…

所見:

Loading…

著者ポスト:

Loading…




Paper/Blog Link My Issue
#Article #NLP #OpenWeight #One-Line Notes Issue Date: 2026-08-04 Comment

元ポスト:

Loading…

アーキテクチャ解説:

Loading…

所見:

Loading…


DeepSeek-V4 Pro, MiniMax M3等のモデルと同等程度のスコアの314B-A13Bモデル。
Grouped Differential Latent Attention (GDLA), Grouped PolyNorm activation と呼ばれる(おそらく本モデル独自の)技術を利用している。




Paper/Blog Link My Issue
#Article #NLP #Blog #One-Line Notes #Author Thread-Post Issue Date: 2026-08-04 Comment

元ポスト:

Loading…

GEPA, AutoResearch, MetaHarnessなどのLLMベースの最適化アルゴリズムを適用した時に、タスクの性能を平均すると特定のアルゴリズムが強いが、個々のインスタンスレベルで見ると必ずしも特定のアルゴリズムが支配的とはならないこと、および、あるアルゴリズムで性能向上がサチったインスタンスも、異なるアルゴリズム、初期化した同じアルゴリズムを継続的に適用することで、異なるアプローチが探索されさらなる性能向上が見込める、という2つの洞察から、

Phase1
固定された予算の元、タスクに対して様々なLLMベースの最適化アルゴリズムをまず走らせ候補を作成。その中から最も良い候補を選び、

Phase2
初期化した最適化アルゴリズムで継続的に最適化することで、単一の最適化アルゴリズムを用いた場合よりも性能が改善

このようなパイプラインを実現するmeta optimiser-omniを実装している。

関連:
- [Paper Note] GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning, Lakshya A Agrawal+, ICLR'26, 2025.07
- [Paper Note] Meta-Harness: End-to-End Optimization of Model Harnesses, Yoonho Lee+, arXiv'26, 2026.03
- autoresearch, karpathy, 2026.03




Paper/Blog Link My Issue
#Article #NLP #Evaluation #Post #read-later #Initial Impression Notes #RewardSeeking Issue Date: 2026-08-03 Comment

元ポスト:

Loading…

関連:
- Kimi K3: Open Frontier Intelligence, Moonshot AI, 2026.07

Kimi K3における、評価されていると認識した上で評価作成者の意図の検討や、reference solutionに関する検討をするなど、ベンチマークに過度に最適化されているような挙動を示す現象に関する検討な模様。

関連:
- [Paper Note] Measuring Reward-Seeking via Contrastive Belief Updates, Axel Højmark+, arXiv'26, 2026.07




Paper/Blog Link My Issue
#Article #NLP #AIAgents #Evaluation #Selected Papers/Blogs #reading #One-Line Notes #Author Thread-Post Issue Date: 2026-08-03 Comment

元ポスト:

Loading…

費用対効果を人間とAI Agentそれぞれでplotすることで、人間とAI Agentが同じ支出で出せるパフォーマンスを出せる点(expenditure horizon)を見つけるというのがアイデアで、これにより低予算下ではAIの方が効果的で、高予算下では人間の方が効果的といった分析が可能となる。

nanogpt speedrunを通じた分析結果なども載っている。




Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #AIAgents #OpenWeight #Selected Papers/Blogs Issue Date: 2026-08-02 Comment

Artiflcial Analysisによる評価:

Loading…


GLM-5.2, Muse Spark 1.1, Gemini3.6-Flash, GPT-5.6-lunaと同等程度のスコアにもかかわらず、スコアに対するパラメータ比率で圧倒的にパレート最適に位置付けられる。

関連:
- [Paper Note] DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence, DeepSeek-AI+, arXiv'26, 2026.04

Epoch Capabilities IndexでOpenWeightモデルでKimi K3に次ぐ2位、全体でOpus 4.6に次ぐ7位

Loading…




Paper/Blog Link My Issue
#Article #NLP #Alignment #AIAgents #Blog #Safety #LongHorizon #Security #Initial Impression Notes #Author Thread-Post Issue Date: 2026-07-31 Comment

元ポスト:

Loading…

モデル評価のためにサンドボックス環境でnanogpt speedrunを用いてlong-horizonタスクを実施させていたところ、slackにのみ結果を通知するよう指示をしていたが、長時間モデルが稼働するにつれこの指示を無視し、nanogpt speedrunの本来の結果の報告先である公開リポジトリにPRを開くことを試み、そのためにサンドボックスの脆弱性を見つけ、githubへのアップロードを始めた挙動を見せたことを受け、これに対処するためにセーフガードを構築した、という話のようである。

関連する話題としては、割と大騒ぎになった以下もある:
- OpenAI and Hugging Face partner to address security incident during model evaluation, OpenAI, 2026.07




Paper/Blog Link My Issue
#Article #Survey #NLP #AIAgents #LongHorizon #Author Thread-Post Issue Date: 2026-07-31 Comment

pj page: https://long-horizon-agents.github.io/

元ポスト:

Loading…

とても良さそう。とんでもない量だ。。。Open Problemsのところは非常にコンパクトで明快

github: https://github.com/RUC-NLPIR/Awesome-Long-Horizon-Agents




Paper/Blog Link My Issue
#Article #Infrastructure #Post #read-later Issue Date: 2026-07-31 Comment

エネルギー効率の良いデータセンターを構築するにはどうすれば良いのか?といった話題のようで、とてもおもしろそうなので読みたい。

※ issueのタイトルは、ポストにタイトルがなかったため、私がポスト中の文言から切り出したもので、公式のタイトルではありません。




Paper/Blog Link My Issue
#Article #Embeddings #InformationRetrieval #NLP #RepresentationLearning #RAG(RetrievalAugmentedGeneration) #MultiLingual #OpenWeight #Selected Papers/Blogs #One-Line Notes Issue Date: 2026-07-31 Comment

元ポスト:

Loading…

HF: https://huggingface.co/collections/nvidia/nemotron-3-embed

LLMベースのretrieval, STSタスク特化のembeddingモデルで、最大32k contextをサポート。多言語対応している。

RTEB Multilingualと呼ばれるベンチマークでSoTA:
https://mteb-leaderboard.hf.space/benchmark/RTEB(beta)

- Introducing RTEB: A New Standard for Retrieval Evaluation, Liu+, 2025.10

解説:

Loading…


Autoregressiveなモデルをbidirectionalなattentionに変換した上で、contrastive learning+高品質データでFinutuning。小規模モデルの作成には、pruning, NAS, 蒸留を2回繰り返すことで実現。