One-Line Notes (1219) — 4/7


Paper/Blog Link My Issue
#NLP #Dataset #QuestionAnswering Issue Date: 2022-02-07 GPT Summary- 日本語の質問応答データセットJaQuADを提案。39,696の質問-回答ペアを含み、テストセットでF1スコア78.92%、EMスコア63.38%を達成したベースラインモデルをファインチューニング。データセットは公開中。 Comment

SQuAD likeな日本語のQAデータセット

https://github.com/SkelterLabsInc/JaQuAD




Paper/Blog Link My Issue
#NLP #LanguageModel #Scalability Issue Date: 2026-07-09 GPT Summary- 言語モデリングは大規模な知識リポジトリを活用し、世界の理解を深化させる。本研究では、数千万から2,800億パラメータのTransformerベースのモデルGopherの性能を分析し、152の多様なタスクで最先端を達成。特に、読解や事実確認でスケールの利得が大きいが、論理的推論には限界がある。モデルの挙動やばイアス、危害の交差を総合的に評価し、AIの安全性に向けた適用と害の軽減についても考察。 Comment

- [Paper Note] Scaling Language Models: Methods, Analysis & Insights from Training Gopher, Jack W. Rae+, arXiv'21, 2021.12
- 大規模言語モデルの次期バージョンPLaMo 3シリーズにおける120B事前学習モデル、31B蒸留モデルの評価, PFN, 2026.07

で利用されている weight reusingについて、`G3.3 Warm starting` に記載されている。概要としては
- LLMのキャパシティを増大させる際に、幅をスケーリングさせるよりも、深さをスケーリングさせる方が有望な結果となった

### 深さのスケーリング方法のbest practice
- 深さをスケーリングさせる、すなわち、5 layer -> 7 layerに拡張したい、という場合は、元の学習済みレイヤーを以下のルールによって複製することによって、拡張する:
- `round_int(range(num_layers_new)/num_layers_new * num_layers_old)`
- たとえば、`A B C D E` の5つのレイヤーで構成されているモデルがあったときに、これを7 layerに拡張したい場合は、上記indexに従って7つのレイヤーに学習済みレイヤーを割り当てると、`A B B C D D E` となる。

### 幅のスケーリング方法のbest practice
- (widthの拡張方法については正しく読めているかかなり自信がなく、間違っている可能性が非常に高いので注意)
- 幅をスケーリングさせる際は、MHA の weight matrices に対して列方向のコピー→行方向のコピー→ ノイズの注入を行う。
- 前提として以下を考える:
- MHAのQKV, outputのprojectionをそれぞれ、`W_q \in R^{d_model \times d_k}`, `W_k \in R^{d_model \times d_k}`, `W_v \in R^{d_model \times d_v}`, `W_o \in R^{h d_v \times d_model}` とする。
- このとき、オリジナルのtransformer論文では、`d_k = d_v = d_model/h` としている。
- つまり、各headに対応するW_{q, k, v, o}を列方向にconcatした行列 W^concat_{q, k, v, o}を考えると、列方向がh倍されるので、`W^concat_{q, k, v, o} \in R^{d_model \times d_model}` の正方行列で表現できる。ここで、`h * d_v= h * d_k= h * d_model/h = d_model` を用いた。
- この `W^{concat}_{*}` に対する操作を定義することで、multihead attentionが扱う幅を変更することができる。
- 元論文では、weight matricesと一言で言及されているが、これは(おそらく)`W^{concat}_{q, k, v, o}` のことを指していると思われる。実際、説明をする際は正方行列を前提に考えている(attention headごとに独立して考える元論文の数式では正方行列は weight matrices に出現しない)。
- まず `W^{concat}_{*}` において、head sizeをH, head数をnとしたときに、`nH \times nH` の行列を列方向にtilingすることによってattention headの数をmに拡張する。このとき、`d_k`, `d_v` のサイズは固定する。たとえば、head数をnからmに増やす際、最初のm-n個のheadを `W^{concat}_{*}` の右側に複製することによって拡張する、と説明されている。
- これはすなわち、個々のheadが扱う情報量は変化させずに、代わりにhead数を増やすことでスケーリングさせる、ということを指していると考えられる。
- 続いて、head数が増えたことによって `W^{concat}_{*}` が正方行列ではなくなった。これが正方行列になっていないとattentionの前後でbottleneck activation size(元論文ではd_modelのことをbottleneck activation sizeと呼称している)が変化してしまうので、正方行列にしなければならない。
- これを正方行列にするために、列方向に複製した行列の上端から数えて `(m-n) * d_k` 行分を行方向にconcatする。
- 最終的に、新たに初期化された重みに対してノイズを注入する。
- これによって構築された `W^{concat}_{*}` を図示したものが、下記Figure A32 と思われる。
- また、上記ではMHAの説明をしたが、MLPなどのd_modelが関わる各種weight matricesもwidthの拡張に含まれていると考えられる(じゃないとwidthの拡張と呼べないし)。
- optimizerの状態は再初期化して学習を実施する。
- Adam optimizerの状態に対して似たような処理を実施したが性能向上にはつながらなかった

image




Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #LanguageModel #Transformer #Architecture #Selected Papers/Blogs #ActivationFunction Issue Date: 2026-02-16 GPT Summary- 大規模なTransformerモデルのコスト削減を目指し、プリミティブに基づく低レベルの探索を行い、Primerアーキテクチャを提案。これにより、自己回帰型言語モデリングで訓練コストを大幅に削減。具体的にはReLU活性化関数の二乗化と深さ方向の畳み込み層追加が主な改善点。実験により、計算規模が大きくなるほどPrimerの利得が増加し、特に5億パラメータの設定で元のT5アーキテクチャに対し4分の1のコストで改善を確認。また、19億パラメータ設定でも、訓練資源を大幅に削減しながら同等の性能を実現。再現性を考慮し、モデルをオープンソース化。 Comment

nanochat speedrunを改善させたReLU^2を提案しているとのこと

Loading…


QKV projectionの後にshort convolutionsを導入するアーキテクチャも提案されている
image




Paper/Blog Link My Issue
#Dataset #SpeechProcessing #AutomaticSpeechRecognition(ASR) Issue Date: 2025-11-21 GPT Summary- 本論文では、107言語のYouTube動画から自動収集した音声データを用いて音声言語認識を調査。半ランダムな検索フレーズを用いて音声セグメントを抽出し、ポストフィルタリングにより98%の正確なラベル付けを実現。得られたトレーニングセットは6628時間、評価セットは1609の発話から構成され、実験により自動取得データが手動ラベル付けデータと同等の結果を示すことが確認された。このデータセットは公開されている。 Comment

dataset: https://cs.taltech.ee/staff/tanel.alumae/data/voxlingua107/

Whisperでも活用されているLanguage Identifucation用のdataset
- [Paper Note] Robust Speech Recognition via Large-Scale Weak Supervision, Alec Radford+, ICML'23, 2022.12




Paper/Blog Link My Issue
#EfficiencyImprovement #Pretraining #NLP #LanguageModel #Transformer #NeurIPS #read-later #HyperparameterTransfer Issue Date: 2025-08-28 GPT Summary- ハイパーパラメータチューニングは高コストであり、特に大規模なニューラルネットワークにおいて負担が大きい。新たに提案するmuTransferは、最大更新パラメータ化(muP)を利用し、小さなモデルでチューニングしたHPをフルサイズモデルにゼロショットで転送する手法である。実験により、1300万パラメータのモデルからBERT-largeを超える性能を達成し、4000万パラメータからはGPT-3を上回る結果を得た。チューニングコストはそれぞれ事前学習コストの同等または7%に抑えられた。 Comment

openreview: https://openreview.net/forum?id=Bx6qKuBM2AD

小規模なモデルに対してハイパーパラメータのチューニングを実施し、同様のベースモデルで、**各layerのwidthが大きいもの**に対しても、小規模モデルで最適であったハイパーパラメータをzero-shotで転移することで near optimalなハイパーパラメータで学習できるmu Transferを提案。

モデルの深さ(以外にも下表中の*印のパラメータ)に対しても限定的に転移可能な模様。Post-Layer NormのTransformerやではあまりうまくいかないことが11節に記述されている(実験はpre-Layer Norm Transformer, ResNetに対して行われている模様)。
また、6.1節では、(実験的に)利用する小規模モデルのスケールとして幅256, 深さ4, バッチサイズ32, sequence長128, 訓練ステップ数5000を最低満たしており、かつスケールさせる幅が妥当な範囲内である必要がある、といった話が記述されている。

前提知識(muP)や条件が多そうな気がするので、しっかり確認した方がよさそう。
たとえば、muPで初期化されている必要があることや、転送可能なハイパーパラメータに限りがある(e.g. 学習率)、異なるデータに対するfinetuningなどは転送できないなど。


image

muP:
- [Paper Note] Feature Learning in Infinite-Width Neural Networks, Greg Yang+, ICML'21




Paper/Blog Link My Issue
#ComputerVision #Transformer #Attention #Architecture #Selected Papers/Blogs #ICCV #Backbone Issue Date: 2025-07-19 GPT Summary- Swin Transformerは、コンピュータビジョンの新しいバックボーンとして機能する階層的トランスフォーマーを提案。シフトウィンドウ方式により、効率的な自己注意計算を実現し、さまざまなスケールでのモデリングが可能。画像分類や物体検出、セマンティックセグメンテーションなどで従来の最先端を上回る性能を示し、トランスフォーマーのビジョンバックボーンとしての可能性を示唆。コードは公開されている。 Comment

日本語解説: https://qiita.com/m_sugimura/items/139b182ee7c19c83e70a

画像処理において、物体の異なるスケールや、解像度に対処するために、PatchMergeと呼ばれるプーリングのような処理 (Figure1) と、固定サイズのローカルなwindowに分割してSelf-Attentionを実施し、layerごとに通常のwindowとシフトされたwindowを適用することで、window間を跨いだ関係性も考慮できるようにする機構(Figure2)を導入したモデル。

image

image




Paper/Blog Link My Issue
#Analysis #NLP #LanguageModel #Supervised-FineTuning (SFT) #PEFT(Adaptor/LoRA) #ACL #PostTraining Issue Date: 2024-10-01 GPT Summary- 事前学習された言語モデルのファインチューニングのダイナミクスを内因次元の観点から分析し、少ないデータでも効果的に調整できる理由を説明。一般的なモデルは低い内因次元を持ち、フルパラメータ空間と同等の効果を持つ低次元の再パラメータ化が可能であることを示す。特に、RoBERTaモデルを用いて、少数のパラメータの最適化で高いパフォーマンスを達成できることを実証。また、事前学習が内因次元を最小化し、大きなモデルが低い内因次元を持つ傾向があることを示し、内因次元に基づく一般化境界を提案。 Comment

ACL ver: https://aclanthology.org/2021.acl-long.568.pdf

下記の元ポストを拝読の上論文を斜め読み。モデルサイズが大きいほど、特定の性能(論文中では2種類のデータセットでの90%のsentence prediction性能)をfinetuningで達成するために必要なパラメータ数は、モデルサイズが大きくなればなるほど小さくなっている。

LoRAとの関係性についても元ポスト中で言及されており、論文の中身も見て後で確認する。
おそらく、LLMはBERTなどと比較して遥かにパラメータ数が大きいため、finetuningに要するパラメータ数はさらに小さくなっていることが想像され、LoRAのような少量のパラメータをconcatするだけでうまくいく、というような話だと思われる。興味深い。

image
元ポスト:

Loading…




Paper/Blog Link My Issue
#Analysis #NLP #Transformer Issue Date: 2024-07-11 GPT Summary- トランスフォーマーモデルのフィードフォワード層は、キー・バリューメモリとして機能し、学習されたパターンが人間に解釈可能であることや、上位層がより意味のあるパターンを学習することが示されました。さらに、出力分布を誘導する役割も持ちます。フィードフォワード層の出力はそのメモリの合成であり、残差接続を介してモデルの層を通じて洗練され、最終的な出力分布を生成します。 Comment

関連:
- 大規模言語モデルにおいて、「知識は全結合層に蓄積される」という仮説についての文献調査, Kan Hatakeyama, 2023.10

FF layerがKey-Valueストアとして機能する仕組みの概略図
image

実際に特定のKeyと最も関連度が高い訓練事例(input)を抽出し、人間がinputのパターンを分類した結果
image




Paper/Blog Link My Issue
#MachineTranslation #Analysis #NaturalLanguageGeneration #Metrics #NLP #Evaluation Issue Date: 2024-01-25 GPT Summary- 機械翻訳の人間評価は難しく、標準的な手法が不足している。そこで、誤り分析に基づく評価方法論を提案し、MQMフレームワークを用いてWMT 2020の上位システム出力をプロの翻訳者による注釈で評価。分析の結果、WMTクラウドワーカーのランキングと異なる結果が得られ、人間が機械出力よりも人間の出力を好む傾向を示した。さらに、自動指標がクラウドワーカーよりも優れたことも判明し、研究用コーパスを公開。 Comment

embedding basedなNLGの性能指標が、意味の等価性や流暢性を評価できる一方、適用範囲が限定的で柔軟性に欠けることを示した研究




Paper/Blog Link My Issue
#PersonalizedDocumentSummarization #NLP #review #SIGIR Issue Date: 2023-05-06 Comment

先行研究は、review summarizationにおいて生成されるsummaryは、過去にユーザが作成したsummaryのwriting styleやproductに非常に関係しているのに、これらを活用してこなかったので、活用しました(=personalized)という話っぽい




Paper/Blog Link My Issue
#NaturalLanguageGeneration #NLP #Personalization #EMNLP Issue Date: 2023-04-26 Comment

従来のNLGはソーステキストに焦点を当て、ターゲットを生成することに注力してきた。が、ユーザの意図やcontextがソーステキストだけに基づいて復元できない場合、このアプローチでは不十分であることを指摘。

この研究ではNLGシステムが追加のcontextを利用することに大きな重点をおくべきであり、IR等で活用されているrelevancyをユーザ指向のテキスト生成タスクを設計するための重要な指標として考えることを提案している。




Paper/Blog Link My Issue
#NeuralNetwork #MachineLearning #Grokking #ICLR #Workshop Issue Date: 2023-04-25 GPT Summary- 小規模データセットにおけるニューラルネットワークの一般化を探求。データ効率、記憶、一般化、学習速度に関する問題を分析し、学習過程の「グロッキング」を通じて一般化性能の改善を示す。特に、小さなデータセットではより多くの最適化が必要であることが明らかにされ、過剰パラメータ化されたネットワークの一般化メカニズムを理解するための重要な知見を提供。 Comment

学習後すぐに学習データをmemorizeして、汎化能力が無くなったと思いきや、10^3ステップ後に突然汎化するという現象(Grokking)を報告



image

学習データが小さければ小さいほど汎化能力を獲得するのに時間がかかる模様




Paper/Blog Link My Issue
#AdaptiveLearning #KnowledgeTracing #ICCE Issue Date: 2022-08-31 Comment

- いまだにほとんどの商用のAdaptive LearningシステムではBKTが使われている。その理由について概要が書いてある。

- BKTについて実アプ李ケーションに応用した際にどういう性質があるかを検証した文献へのリファレンスが存在する




Paper/Blog Link My Issue
#NeuralNetwork #NaturalLanguageGeneration #NLP #Dataset #DataToTextGeneration #ACL #INLG Issue Date: 2022-08-18 GPT Summary- バイオメディカル分野におけるD2T生成の研究を行い、医薬品のパッケージリーフレットを用いた実世界のデータセットに対してファインチューニングされたトランスフォーマーを適用。現実的な複数文のテキスト生成が可能であることを示す一方で、重要な制限も存在。新たにバイオメディカル分野のD2T生成モデルのベンチマーク用データセット(BioLeaflets)を公開。 Comment

biomedical domainの新たなdata2textデータセットを提供。事前学習済みのBART, T5等をfinetuningすることで高精度にテキストが生成できることを示した。




Paper/Blog Link My Issue
#NeuralNetwork #AdaptiveLearning #EducationalDataMining #LearningAnalytics #KnowledgeTracing #ICCE Issue Date: 2022-04-28 Comment

KTにBERTを利用した研究

Empirical Evaluation of Deep Learning Models for Knowledge Tracing: Of Hyperparameters and Metrics on Performance and Replicability, Sami+, Aalto University, JEDM'22 などでDeepLearningBasedなモデル間であまり差がないことが示されているので、本研究が実際どれだけ強いのかは気になるところ。




Paper/Blog Link My Issue
#NeuralNetwork #AdaptiveLearning #EducationalDataMining #LearningAnalytics #KnowledgeTracing #AAAI #Workshop Issue Date: 2022-04-28 GPT Summary- インタラクティブ教育システム(IES)を用いて学生の知識を追跡し、パフォーマンスモデルを開発する研究が進展。深層学習モデルが従来のモデルを上回るかは未検証であり、EdNetデータセットを用いてその精度を比較。結果、ロジスティック回帰モデルが深層モデルを上回ることが確認され、LIMEを用いて予測に対する特徴の影響を解釈する研究を行った。 Comment

データ量が小さいとSAKTはDKTはcomparableだが、データ量が大きくなるとSAKTがDKTを上回る。



image




Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #Transformer #Attention #Sparse #SparseAttention Issue Date: 2025-08-09 GPT Summary- Longformerは、長いシーケンスを線形に処理できる注意機構を持つTransformerベースのモデルで、数千トークンの文書を扱える。局所的なウィンドウ注意とタスクに基づくグローバル注意を組み合わせ、文字レベルの言語モデリングで最先端の結果を達成。事前学習とファインチューニングを行い、長文タスクでRoBERTaを上回る性能を示した。また、Longformer-Encoder-Decoder(LED)を導入し、長文生成タスクにおける効果を確認した。 Comment

(固定された小さめのwindowsサイズの中でのみattentionを計算する)sliding window attentionを提案。Figure2を見ると、通常のAttentionと比較して、現在のトークンの周辺のトークンにしか注目しない特性が図示されており、イメージが掴みやすい。

image

OpenLLMの文脈だと、Mistralに採用されて話題になったかも?
- Mistral 7B, Albert Q. Jiang+, N/A, arXiv'23




Paper/Blog Link My Issue
#EfficiencyImprovement #NLP #Transformer #Attention #ICML #Selected Papers/Blogs #reading #RecurrentModels #LinearAttention Issue Date: 2025-08-05 GPT Summary- 自己注意をカーネル特徴マップの線形ドット積として表現することで、Transformersの複雑性を$\mathcal{O}\left(N^2\right)$から$\mathcal{O}\left(N\right)$に削減。これにより、自己回帰型Transformersの速度が最大4000倍向上し、従来のパフォーマンスを維持。 Comment

関連:
- Transformers are Multi-State RNNs, Matanel Oren+, N/A, EMNLP'24

pj page: https://linear-transformers.com

Linear Attention(Linear Transformer)を提案した研究。Softmaxが利用されるFull Attentionのsimilarity部分をfeature map φを持つカーネルk(x, y)で一般化し、(3)--(6)の流れでfeature map φ同士は内積が使える性質と、行列積の結合法則を用いて式変換する。
式変換によって、従来のSoftmax Attentionでは、全てのトークンNに対してQ_i * K_j * V_jのメモリが必要だったものを(O(N^2))、各Queryごとに利用される、KVを用いた情報が共通化され(現在のqueryまでのφ(K)とφ(K)V^Tを逐次的に加算して保持するだけで良い)、再利用が可能となりメモリに関するオーダーがO(N)となる。

これらの話は実際にどのような カーネルを利用するかを無視した話だが、たとえばsoftmaxを表現するために必要な指数カーネルの場合はfeature mapが無限次元となるため有限次元のベクトルでは表現できず、厳密に線形化することができない。このため、有限次元かつ厳密なfeature mapを持つ多公式カーネルを用いて近似する。この場合、計算量のオーダーがO(ND^2M)となり(Nがsequence length, Dがqueryとkeyの次元数, Mがvalueの次元数)、softmax attentionの計算量がO(N^2 max(D,M))であることと比較すると、N > D^2である場合に計算効率が改善される。

学習時は並列に学習が可能で、推論時はφ(K_j)V_j^Tを内部状態とみなすと、各タイムステップでRNNのように状態を更新して保持するだけで良い。

(続きはさらに後で読む)

次: DeltaNet
- [Paper Note] Linear Transformers Are Secretly Fast Weight Programmers, Imanol Schlag+, arXiv'21, 2021.02
- [Paper Note] Parallelizing Linear Transformers with the Delta Rule over Sequence Length, Songlin Yang+, NeurIPS'24, 2024.06

次の次: Gated DeltaNet
- [Paper Note] Gated Delta Networks: Improving Mamba2 with Delta Rule, Songlin Yang+, ICLR'25, 2024.12

次の次の次: Kimi Delta Attention (KDA)
- [Paper Note] Kimi Linear: An Expressive, Efficient Attention Architecture, Kimi Team+, arXiv'25, 2025.10




Paper/Blog Link My Issue
#Analysis #NLP #Transformer #Architecture #Normalization Issue Date: 2025-07-05 GPT Summary- Transformerの学習で必要とされる学習率ウォームアップについて、Layer Normalizationの位置に着目して理論的に分析。 従来のPost-LN Transformerでは出力層付近の勾配が大きくなり学習が不安定になるため、ウォームアップが有効である。 一方、Pre-LN Transformerでは初期勾配が適切に保たれるため、ウォームアップなしでも同等の性能を達成し、学習時間とハイパーパラメータ調整を削減できる。 Comment

OpenReview: https://openreview.net/forum?id=B1x8anVFPr

Encoder-DecoderのTransformerにおいて、Post-LNの場合は、Warmupを無くすと最終的な性能が悪化し、またWarmUpステップの値によって(500 vs. 4000で実験)も最終的な性能が変化する。これには学習時にハイパーパラメータをしっかり探索しなければならず、WarmUPを大きくすると学習効率が落ちるというデメリットがある。
image

Post-LNの場合は、Pre-LNと比較して勾配が大きく、Warmupのスケジュールをしっかり設計しないと大きな勾配に対して大きな学習率が適用され学習が不安定になる。これは学習率を非常に小さくし、固定値を使うことで解決できるが、収束が非常に遅くなるというデメリットがある。
image

一方、Pre-LNはWarmup無しでも、高い性能が達成でき、上記のようなチューニングの手間や学習効率の観点から利点がある、みたいな話の模様。
image




Paper/Blog Link My Issue
#DocumentSummarization #NeuralNetwork #NLP #ICML #Selected Papers/Blogs Issue Date: 2025-05-13 GPT Summary- 大規模なテキストコーパスに対して新しい自己教師ありの目的でトランスフォーマーを事前学習し、抽象的なテキスト要約に特化したモデルPEGASUSを提案。重要な文を削除またはマスクし、残りの文から要約を生成。12の下流要約タスクで最先端のROUGEスコアを達成し、限られたリソースでも優れたパフォーマンスを示す。人間評価でも複数のデータセットで人間のパフォーマンスに達したことを確認。 Comment

PEGASUSもなかったので追加。BARTと共に文書要約のBackboneとして今でも研究で利用される模様。

関連:
- SummEval: Re-evaluating Summarization Evaluation, Fabbri+, TACL'21




Paper/Blog Link My Issue
#NeuralNetwork #Pretraining #NLP #TransferLearning #PostTraining #Selected Papers/Blogs Issue Date: 2025-05-12 GPT Summary- 転移学習はNLPにおいて強力な技術であり、本論文ではテキストをテキストに変換する統一フレームワークを提案。事前学習の目的やアーキテクチャを比較し、最先端の結果を達成。データセットやモデル、コードを公開し、今後の研究を促進する。 Comment

T5もメモっていなかったので今更ながら追加。全てのNLPタスクをテキスト系列からテキスト系列へ変換するタスクとみなし、Encoder-DecoderのTransformerを大規模コーパスを用いて事前学習をし、downstreamタスクにfinetuningを通じて転移する。

個人的に、Transformer-decoderのスケーラビリティのみならず、T5全てのタスクをテキスト系列の変換とみなす考え方が、現在のLLMの基盤となっていると感じている。




Paper/Blog Link My Issue
#NeuralNetwork #ComputerVision #MachineLearning #NLP #ICLR #KnowledgeEditing #read-later Issue Date: 2025-05-07 GPT Summary- 深層ニューラルネットワークの誤りを迅速に修正するために、Editable Trainingというモデル非依存の訓練手法を提案。これにより、特定のサンプルの誤りを効率的に修正し、他のサンプルへの影響を避けることができる。大規模な画像分類と機械翻訳タスクでその有効性を実証。 Comment

(おそらく)Knowledge Editingを初めて提案した研究

OpenReview: https://openreview.net/forum?id=HJedXaEtvS




Paper/Blog Link My Issue
#Metrics #NLP #Evaluation #SpeechProcessing #AutomaticSpeechRecognition(ASR) #AACL #SimulST(SimultaneousSpeechTranslation) Issue Date: 2025-04-30 GPT Summary- 同時テキスト翻訳手法をエンドツーエンドの同時音声翻訳に適応させる研究を行い、事前決定モジュールを導入。レイテンシと品質のトレードオフを分析し、新しいレイテンシメトリックを設計。 Comment

同時翻訳研究で主要なmetricの一つ
関連:
- [Paper Note] Over-Generation Cannot Be Rewarded: Length-Adaptive Average Lagging for Simultaneous Speech Translation, Sara Papi+, NAACL'22




Paper/Blog Link My Issue
#MachineTranslation #Metrics #NLP #Evaluation #EMNLP #Selected Papers/Blogs Issue Date: 2024-05-26 GPT Summary- COMETは、多言語機械翻訳評価モデルを訓練するためのニューラルフレームワークであり、人間の判断との新しい最先端の相関レベルを達成します。クロスリンガル事前学習言語モデリングの進展を活用し、高度に多言語対応かつ適応可能なMT評価モデルを実現します。WMT 2019 Metrics shared taskで新たな最先端のパフォーマンスを達成し、高性能システムに対する堅牢性を示しています。 Comment

Better/Worseなhypothesisを利用してpair-wiseにランキング関数を学習する
![Image](https://github.com/user-attachments/assets/a1fd6f36-48e8-44fc-8fcb-0900a51759b3)

![Image](https://github.com/user-attachments/assets/19ad7a57-7de3-4255-afde-4a1fde41587d)

Inference時は単一のhypothesisしかinputされないので、sourceとreferenceに対してそれぞれhypothesisの距離をはかり、その調和平均でスコアリングする

![Image](https://github.com/user-attachments/assets/21642c70-a7fd-4c0e-8678-6125fdbfefce)

ACL2024, EMNLP2024あたりのMT研究のmetricをざーっと見る限り、BLEU/COMETの双方で評価する研究が多そう




Paper/Blog Link My Issue
#MachineTranslation #Analysis #NaturalLanguageGeneration #Metrics #NLP #Evaluation Issue Date: 2024-01-25 GPT Summary- 機械翻訳の自動評価指標の質を検証し、参照データの性質が重要であることを示す。さまざまな参照収集方法を検討し、人間評価との相関を報告。典型的な参照の偏りを打ち消すために、言語学者によるパラフレージング課題を開発。WMT 2019のデータにおいて、標準参照との相関が低い出力でも人間判断との相関が向上することを示す。また、埋め込みベースの手法を含む評価指標で相関が改善されることも明らかにし、マルチ参照BLEUの限界と新たな定式化を提示。 Comment

surface levelのNLGの性能指標がsemanticを評価できないことを示した研究




Paper/Blog Link My Issue
#DocumentSummarization #NLP #Hallucination #EMNLP #numeric #needs-revision Issue Date: 2023-08-16 GPT Summary- Hermanシステムは、抽象的な要約において幻覚を回避するために、数量エンティティを認識し、元のテキストでサポートされている数量用語を持つ要約を上位にランク付けするアプローチを提案しています。実験結果は、このアプローチが高い適合率と再現率を持ち、F$_1$スコアが向上することを示しています。また、上位にランク付けされた要約が元の要約よりも好まれることも示されています。 Comment

数量に関するhallucinationを緩和する要約手法




Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #Evaluation #ICLR #Selected Papers/Blogs #needs-revision Issue Date: 2023-07-24 GPT Summary- 新しいテストを提案し、57のマルチタスクを用いてテキストモデルの正確度を測定。高い正確度には広範な世界知識と問題解決能力が必要である。GPT-3モデルはランダム推測を約20ポイント上回るが、専門家レベルには遠く、多くのタスクで偏った性能を示す。特に道徳や法に関してはほぼランダムに近い正確度を記録。このテストはモデルの理解力を評価し、重要な欠点を明らかにすることを目的とする。 Comment

OpenReview: https://openreview.net/forum?id=d7KBjmI3GmQ

MMLU論文

- [Paper Note] Are We Done with MMLU?, Aryo Pradipta Gema+, NAACL'25

において、多くのエラーが含まれることが指摘され、再アノテーションが実施されている。




Paper/Blog Link My Issue
#Survey #NLP #Personalization #ACL Issue Date: 2023-04-26 Comment

NLPのけるPersonalized Classificationモデルのliteratureを振り返る論文




Paper/Blog Link My Issue
#Pretraining #Tools #NLP #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #PostTraining #Selected Papers/Blogs #Parallelism #DistributedLearning #TrainingFramework Issue Date: 2026-09-29 GPT Summary- 大規模Transformerモデルを学習するため、ネイティブPyTorchに少数の通信操作を追加する層内モデル並列化手法を提案。パイプライン型並列化と併用可能で、512 GPU上で最大83億パラメータのモデルを学習し、15.1ペタFLOPSと76%のスケーリング効率を達成。GPT-2型・BERT型モデルで既存のSOTAを上回り、WikiText103、LAMBADA、RACEで高い性能を実現。 Comment

Megatron-LMがメモされていなかったので追加。代表的なLLM・マルチモーダルモデル学習のためのフレームワーク

事前学習、継続事前学習だけでなく
- Swallow: LLaMA-2 日本語継続事前学習モデル, Kazuki Fujii, 2023.12

以下のような事後学習フレームワークのバックエンドとしても利用される:
- Nemo-RL, Nvidia, 2025.05
- verl: Volcano Engine Reinforcement Learning for LLMs, ByteDance Seed Team, 2025.04
- slime, THUDM & Zhihu, 2025.09
- ms-swiftによるMegatron-LMベースのQwen3のファインチューニング, Aratako, 2025.05




Paper/Blog Link My Issue
#ComputerVision #Transformer #LongContext #Selected Papers/Blogs #SparseAttention Issue Date: 2025-11-30 GPT Summary- スパース因子分解を用いてトランスフォーマーの注意行列を$O(n \sqrt{n})$に削減し、深いネットワークの訓練やメモリ節約のための手法を導入。スパーストランスフォーマーは数百層で数万タイムステップのシーケンスをモデル化し、Enwik8、CIFAR-10、ImageNet-64で新たな最先端を達成。自己注意を用いて100万以上の長さのシーケンスをモデル化する可能性を示す。 Comment

Sparse Attentionの概念を提案した研究。以下Surveyより
- [Paper Note] Generating Long Sequences with Sparse Transformers, Rewon Child+, arXiv'19, 2019.04




Paper/Blog Link My Issue
#EfficiencyImprovement #Transformer #Attention #LongContext #PositionalEncoding #ACL Issue Date: 2025-08-05 GPT Summary- Transformer-XLは、固定長のコンテキストを超えた長期的な依存関係を学習する新しいニューラルアーキテクチャで、セグメントレベルの再帰メカニズムと新しい位置エンコーディングを採用。これにより、RNNより80%、従来のTransformersより450%長い依存関係を学習し、評価時には最大1,800倍の速度向上を実現。enwiki8やWikiText-103などで最先端のパフォーマンスを達成し、数千トークンの一貫したテキスト生成も可能。コードとモデルはTensorflowとPyTorchで利用可能。 Comment

日本語解説:
- 事前学習言語モデルの動向 / Survey of Pretrained Language Models, Kyosuke Nishida, 2019

3.2節の定式化を見ると、一つ前のセグメントのトークン・layerごとのhidden stateを、現在のセグメントの対応するトークンとlayerのhidden stateにconcatし(過去のセグメントに影響を与えないように勾配を伝搬させないStop-Gradientを適用する)、QKVのうち、KVの計算に活用している。また、絶対位置エンコーディングを利用するとモデルがセグメント間の時系列的な関係を認識できなくなるため、位置エンコーディングには相対位置エンコーディングを利用する。これにより、現在のセグメントのKVが一つ前のセグメントによって条件づけられ、contextとして考慮することが可能となり、セグメント間を跨いだ依存関係の考慮が実現される。




Paper/Blog Link My Issue
#NeuralNetwork #NLP #Library #RepresentationLearning #EMNLP #Selected Papers/Blogs #Encoder Issue Date: 2022-07-29 GPT Summary- BERTとRoBERTaは文ペア回帰タスクで優れた性能を示す一方で、計算負荷が高いため意味的類似度検索には適していない。本研究では、コサイン類似度を用いた文の埋め込みを得るために、シアミーズネットワークとトリプレットネットワークを用いたSentence-BERT(SBERT)を提案。これにより、類似ペアの検索時間が65時間から約5秒に短縮され、精度はBERTに匹敵。SBERTは一般的なSTSタスクや転移学習タスクで最先端の性能を示した。 Comment

BERTでトークンをembeddingし、mean poolingすることで生成される文ベクトルを、Siamese Networkを使い距離学習(finetune)させたモデル。

image



文/文章のベクトルを事前学習済みのモデルを使って簡単に求められる。

モデルの一覧は下記: https://www.sbert.net/docs/pretrained_models.html




Paper/Blog Link My Issue
#RecommenderSystems #CollaborativeFiltering #FactorizationMachines Issue Date: 2021-07-02 GPT Summary- 深層学習に基づく推薦モデル(DLRM)を開発し、PyTorchとCaffe2で実装。埋め込みテーブルのモデル並列性を活用し、メモリ制約を軽減しつつ計算をスケールアウト。DLRMの性能を既存モデルと比較し、Big Basin AIプラットフォームでの有用性を示す。 Comment

Facebookが開発したopen sourceのDeepな推薦モデル(MIT Licence)。

モデル自体はシンプルで、continuousなfeatureをMLPで線形変換、categoricalなfeatureはembeddingをlook upし、それぞれfeatureのrepresentationを獲得。
その上で、それらをFactorization Machines layer(second-order)にぶちこむ。すなわち、Feature間の2次の交互作用をembedding間のdot productで獲得し、これを1次項のrepresentationとconcatしMLPにぶちこむ。最後にシグモイド噛ませてCTRの予測値とする。

実装: https://github.com/facebookresearch/dlrm

Parallelism以後のセクションはあとで読む




Paper/Blog Link My Issue
#NeuralNetwork #NaturalLanguageGeneration #NLP #DataToTextGeneration #AAAI Issue Date: 2021-06-26 Comment

Rotowire Datasetに対するData2Text研究において代表的な論文の一つ。Wisemanモデル [Paper Note] Challenges in Data-to-Document Generation, Sam Wiseman+, EMNLP'17, 2017.07 と共にベースラインとして利用されることが多い。

実装: https://github.com/ratishsp/data2text-plan-py




Paper/Blog Link My Issue
#NeuralNetwork #ComputerVision #NLP Issue Date: 2021-06-15 GPT Summary- 深層学習のオプティマイザの比較は重要であり、ハイパーパラメータの探索空間が性能に影響することが示唆されている。特に、適応的勾配法は常に他のオプティマイザよりも性能が低下しないことが実験で示されており、ハイパーパラメータのチューニングに関する実用的なヒントも提供されている。 Comment

日本語での解説: https://akichan-f.medium.com/optimizerはどれが優れているか-on-empirical-comparisons-of-optimizers-for-deep-learningの紹介-f843179e8a8d

Adamが良いのだけど、学習率以外のハイパーパラメータをチューニングしないと本来のパフォーマンス発揮されないかもよ、という感じっぽい

ICLR 2020 Open Review: https://openreview.net/forum?id=HygrAR4tPS




Paper/Blog Link My Issue
#RecommenderSystems #NeuralNetwork #LanguageModel #CIKM #SequentialRecommendation #Initial Impression Notes Issue Date: 2021-05-25 GPT Summary- ユーザーの動的嗜好をモデル化するために、BERT4RecというTransformerに基づく双方向エンコーダを導入。従来の順序型モデルの限界を克服し、Clozeタスクを用いて左側と右側の文脈を共同で条件付けしてアイテムを予測。さまざまなベンチマークデータセットにおいて、提案モデルが最先端の逐次モデルを一貫して上回る結果を示す。 Comment

BERTをrecsysのsequential recommendationタスクに転用してSoTA。
しっかり読んで無いけどモデル構造はほぼBERTと一緒。
異なる点は、Training時にNext Sentence Predictionは行わずClozeのみ行なっているという点。Clozeとは、実質Masked Language Modelであり、sequenceの一部を[mask]に置き換え、置き換えられたアイテムを左右のコンテキストから予測するタスク。異なる点としては、sequential recommendationタスクでは、次のアイテムを予測したいので、マスクするアイテムの中に、sequenceの最後のアイテムをマスクして予測する事例も混ぜた点。

もう一個異なる点として、BERT4Recはend-to-endなモデルで、BERTはpretraining modelだ、みたいなこと言ってるけど、まあ確かに形式的にはそういう違いはあるけど、なんかその違いを主張するのは違和感を覚える…。
sequential recommendationで使うuser behaviorデータでNext item predictionで学習したいことが、MLMと単に一致していただけ、なのでは…。

BERT4Recのモデル構造。next item predictionしたいsessionの末尾に [mask] をconcatし、[MASK]部分のアイテムを予測する構造っぽい?

image

オリジナルはtensorflow実装

pytorchの実装はこちら: https://github.com/jaywonchung/BERT4Rec-VAE-Pytorch/tree/master/models




Paper/Blog Link My Issue
#RecommenderSystems #NeuralNetwork #NaturalLanguageGeneration #NLP #ReviewGeneration #WWW Issue Date: 2019-05-31 Comment

Personalized Review Generationと、Rating Predictionを同時学習した研究(同時学習自体はすでに先行研究がある)。

また、先行研究のinputは、たいていはuser, itemであるが、multi-modalなinputとしてレビューのphotoを活用したという話。



まだあまりしっかり読んでいないが、モデルのstructureはシンプルで、rating predictionを行うDNN、テキスト生成を行うLSTM(fusion gateと呼ばれる新たなゲートを追加)、画像の畳み込むCNNのハイブリッドのように見える。




Paper/Blog Link My Issue
#NeuralNetwork #ComputerVision #DataAugmentation #Self-SupervisedLearning #ConvolutionalModels Issue Date: 2026-08-30 GPT Summary- ConvNetsを用いて2D回転を認識することで、非監視での意味的特徴学習を提案。これにより、手動ラベルが不要な強力な監督信号を提供し、さまざまなベンチマークで最先端の性能を達成。特に、PASCAL VOC 2007検出タスクでは54.4%のmAPを記録し、教師あり学習との差を縮小。特徴を他のタスクに転移させても顕著な成果を示す。コードとモデルは公開中。 Comment

元ポスト:

Loading…

画像Xが与えられた時に、geometric transformation(e.g., 90/180/270度回転等)を適用した画像をX^yとする。X^yが与えられた時に、どのようなgeometric transformation y^* が適用されたかを予測するConvNet F(X^y* | theta) を学習するシンプルなSSL手法。
objectに対するコンセプトが学習されていなければ、rotationが適用された画像の認識ができないであろう、という直感に基づいたSSL手法のようである(Figure 1)。

元ポストによるとこれは最近の様々なaugmentationされたデータに対して共通の表現を得る自己教師あり学習(下記)とは逆に、augmentationされた画像に依存した表現を学習することを目指いる点で異なっているとのことである。

- MoCo
- [Paper Note] Momentum Contrast for Unsupervised Visual Representation Learning, Kaiming He+, CVPR'20, 2019.11
- DINO
- [Paper Note] Emerging Properties in Self-Supervised Vision Transformers, Mathilde Caron+, ICCV'21, 2021.04
- SimCLR
- [Paper Note] A Simple Framework for Contrastive Learning of Visual Representations, Ting Chen+, ICML'20




Paper/Blog Link My Issue
#NeuralNetwork #Analysis #MachineLearning #ReinforcementLearning #AAAI #Selected Papers/Blogs #Reproducibility Issue Date: 2025-10-22 GPT Summary- 深層強化学習(RL)の進展を持続させるためには、既存研究の再現性と新手法の改善を正確に評価することが重要である。しかし、非決定性や手法のばらつきにより、結果の解釈が難しくなることがある。本論文では、再現性や実験報告の課題を調査し、一般的なベースラインとの比較における指標のばらつきを示す。さらに、深層RLの結果を再現可能にするためのガイドラインを提案し、無駄な努力を最小限に抑えることで分野の進展を促進することを目指す。 Comment

日本語解説: https://www.slideshare.net/slideshow/dldeep-reinforcement-learning-that-matters-83905622/83905622

再現性という観点とは少し異なるのかもしれないが、最近のRLによるpost-trainingについては、以下の研究でScaling Lawsが導入されている。
- [Paper Note] The Art of Scaling Reinforcement Learning Compute for LLMs, Devvrit Khatri+, arXiv'25, 2025.10

が、結局現在も多くのRL手法が日夜出てきており、再現性に関しては同じような状況に陥っていそうである。




Paper/Blog Link My Issue
#NeuralNetwork #ComputerVision #MachineLearning #Normalization Issue Date: 2025-04-02 GPT Summary- バッチ正規化(BN)はディープラーニングの重要な技術だが、小さなバッチサイズでの精度低下が課題。本研究では、グループ正規化(GN)を提案し、チャネルをグループに分けて正規化を行うことで、バッチサイズに依存しない安定した性能を実現。ImageNetでの実験では、GNが小バッチでも優れた精度を示し、他のタスクでもBNよりも性能を向上させることを確認。GNは実装も簡単で、さまざまなコンピュータビジョンタスクにおいてBNの有効な代替手段である。 Comment

BatchNormalizationはバッチサイズが小さいとうまくいかず、メモリの制約で大きなバッチサイズが設定できない場合に困るからバッチサイズに依存しないnormalizationを考えたよ。LayerNormとInstanceNormもバッチサイズに依存しないけど提案手法の方が画像系のタスクだと性能が良いよ、という話らしい。

各normalizationとの比較。分かりやすい。
image




Paper/Blog Link My Issue
#NeuralNetwork #EfficiencyImprovement #MachineLearning #read-later #Selected Papers/Blogs #Batch #CriticalBatchSize Issue Date: 2024-12-16 GPT Summary- 勾配ノイズスケールを用いて、異なる分野での最適なバッチサイズを予測する方法を提示。教師あり学習や強化学習など複数の領域での実験を通じて、この統計量がロスの低下に伴い増加し、モデルサイズが性能に与える影響を分析。計算効率と時間効率のトレードオフを説明し、適応的なバッチサイズ訓練の利点を示す。 Comment

Critical Batchsize(バッチサイズをこれより大きくすると学習効率が落ちる境界)を提唱した論文

日本語解説: https://iwiwi.hatenadiary.jp/entry/2023/04/11/134316




Paper/Blog Link My Issue
#RecommenderSystems #NeuralNetwork #CollaborativeFiltering #FactorizationMachines #CTRPrediction #SIGKDD #Reading Reflections Issue Date: 2021-05-25 GPT Summary- 特徴量の自動生成が求められる中、因子分解モデルは相互作用を学習し一般化するが、DNNは暗黙的である。本研究では、明示的に相互作用を生成する圧縮相互作用ネットワーク(CIN)を提案し、DNNと統合したeXtreme Deep Factorization Machine(xDeepFM)を開発。xDeepFMは低次・高次の相互作用を学習し、実データセットで最先端モデルを超える性能を示した。 Comment

DeepFM: A Factorization-Machine based Neural Network for CTR Prediction, Guo+, IJCAI’17 DeepFMの発展版

[Paper Note] Factorization Machines, Steffen Rendle, ICDM'10, 2010.12 にも書いたが、下記リンクに概要が記載されている。

DeepFMに関する動向: https://data.gunosy.io/entry/deep-factorization-machines-2018



DeepFMの発展についても詳細に述べられていて、とても参考になる。




Paper/Blog Link My Issue
#RecommenderSystems #NeuralNetwork #CollaborativeFiltering #FactorizationMachines #CTRPrediction #WWW Issue Date: 2020-08-29 GPT Summary- クリック率(CTR)予測はオンライン広告での重要なタスクであり、マルチフィールドのカテゴリカルデータが使用される。フィールド認識型因子分解機(FFMs)は異なるフィールド間の特徴相互作用を効果的にモデル化するが、パラメータ数が膨大で実用的ではない。提案するField-weighted Factorization Machines(FwFMs)は、メモリ効率よく相互作用をモデル化し、わずか4%のパラメータで競争力のある性能を発揮。実験では、FwFMsがFFMsよりも0.92%および0.47%のAUC改善を達成した。 Comment

CTR予測でbest-performingなモデルと言われているField Aware Factorization Machines(FFM)では、パラメータ数がフィールド数×特徴数のorderになってしまうため非常に多くなってしまうが、これをよりメモリを効果的に利用できる手法を提案。FFMとは性能がcomparableであるが、パラメータ数をFFMの4%に抑えることができた。




Paper/Blog Link My Issue
#RecommenderSystems #Tools #Library Issue Date: 2018-01-01 GPT Summary- LensKitはレコメンダーシステムのためのオープンソースツールキットで、次世代版としてPython用のLensKit(LKPY)を紹介。LKPYは、研究者や学生が再現可能な実験を構築できるようにし、scikit-learnやTensorFlow、PyTorchなどのエコシステムを活用。古典的な協調フィルタリングの実装や評価指標、データ準備ルーチンを提供し、他のPythonソフトウェアと組み合わせて使用可能。設計目標やユースケースについて、元のJava版の成功と失敗を振り返りながら説明。 Comment

実装されているアルゴリズム:協調フィルタリング、Matrix Factorizationなど

実装:Java

使用方法:コマンドライン、Javaライブラリとして利用

※ 推薦システム界隈で有名な、GroupLens研究グループによるJava実装

参考:

http://www.kamishima.net/archive/recsysdoc.pdf

https://takuti.me/note/recommender-libraries/




Paper/Blog Link My Issue
#NeuralNetwork #NLP #MoE(Mixture-of-Experts) #ICLR #Selected Papers/Blogs Issue Date: 2025-04-29 GPT Summary- 条件付き計算を用いたスパースゲーテッドミクスチャーオブエキスパート(MoE)レイヤーを導入し、モデル容量を1000倍以上向上。学習可能なゲーティングネットワークが各例に対してスパースなエキスパートの組み合わせを決定。最大1370億パラメータのMoEをLSTM層に適用し、言語モデリングや機械翻訳で低コストで優れた性能を達成。 Comment

Mixture-of-Experts (MoE) Layerを提案した研究




Paper/Blog Link My Issue
#NeuralNetwork #MachineLearning #Catastrophic Forgetting #Selected Papers/Blogs Issue Date: 2024-10-10 GPT Summary- タスクを逐次的に学習する能力を持つネットワークを訓練する方法を提案。重要な重みの学習を選択的に遅くすることで、古いタスクの記憶を維持。MNISTやAtari 2600ゲームでの実験により、アプローチの効果とスケーラビリティを実証。 Comment

Catastrophic Forgettingを防ぐEWCを提案した論文

日本語解説: https://qiita.com/yu4u/items/90c039ec2f1d4f2d2414

ポイント解説:

Loading…




Paper/Blog Link My Issue
#NeuralNetwork #ComputerVision #Optimizer Issue Date: 2023-12-13 GPT Summary- 大規模畳み込みネットワークのトレーニングでは、計算ユニットを追加することで高速化を図るが、大きなバッチサイズはモデルの精度を低下させることがある。従来の線形学習率スケーリングは一般的ではなく、トレーニングの発散リスクがある。これを解決するために、Layer-wise Adaptive Rate Scaling(LARS)に基づく新しいアルゴリズムを提案し、AlexNetはバッチサイズ8K、ResNet-50は32Kまでの拡張でも精度を維持できることを示した。 Comment

BatchSizeを大きくすると性能が落ちますよ、系の話(CNN)
image

OpenReview: https://openreview.net/forum?id=rJ4uaX2aW

ICLR'18にrejectされている

先行研究で提案よりも大きなバッチサイズを扱えるsynchronized SGDは強みだが、評価が一つのタスクのみなのでより増やした方がconvincingだということ、提案手法に追加のハイパーパラメータが必要な点が手法をless appealingにしてしまっていること、layer wise rate scailng (LARS)の理論的なjustificationが何か欲しいこと、先行研究との比較がクリアではないこと、などが理由な模様。




Paper/Blog Link My Issue
#Embeddings #NLP #Dataset #RepresentationLearning #STS (SemanticTextualSimilarity) #Japanese Issue Date: 2023-07-31 GPT Summary- 日本語の分散表現評価のために、語の類似度データセットを構築。これが日本語分散表現評価の初の資源であり、一般語と稀少語の両方を含む様々な品詞を網羅。 Comment

github: https://github.com/tmu-nlp/JapaneseWordSimilarityDataset



単語レベルの類似度をベンチマーキングしたい場合は使ってもよいかも。




Paper/Blog Link My Issue
#EducationalDataMining #KnowledgeTracing #EDM Issue Date: 2021-07-04 Comment

DKT [Paper Note] Deep Knowledge Tracing, Piech+, NIPS'15 のPiech氏も共著に入っている。
プログラミングの課題を行なっている時(要複数回のソースコードサブミット)、

1. 次のexerciseが最終的に正解で終われるか否か
2. 現在のexerciseを最終的に正解で終われるか否か

を予測するタスクを実施




Paper/Blog Link My Issue
#ComputerVision #NLP #CommentGeneration #CVPR Issue Date: 2019-09-27 Comment

画像が与えられたときに、その画像に対するHashtag predictionと、personalizedなpost generationを行うタスクを提案。

InstagramのPostの簡易化などに応用できる。

Postを生成するためには、自身の言葉で、画像についての説明や、contextといったことを説明しなければならず、image captioningをする際にPersonalization Issueが生じることを指摘。



official implementation: https://github.com/cesc-park/attend2u




Paper/Blog Link My Issue
#NeuralNetwork #NLP #QuestionAnswering #EMNLP #Encoder-Decoder #RecurrentModels Issue Date: 2018-06-29 GPT Summary- QAシステムにおけるパラフレーズの重要性に着目し、質問と回答のペアを用いたエンドツーエンドの学習フレームワークを提案。ニューラルスコアリングモデルを通じて、正しい回答を得る可能性の高い表現に重みを付ける。実験結果は、提案手法が性能を向上させ、シンプルなQAモデルでも競争力のある結果を達成することを示す。 Comment

question-answeringタスクにおいて、paraphrasingを活用して精度向上させる研究

似たような意味の質問が、異なる表現で出現することがあるので、

questionの様々なparaphrasingを用意して活用したいという気持ち。

たとえば、



- Is the campus far from Shibuya?

- Is the campus near the city center?



のような例があげられる。



手法としては、paraphrasing modelとqa modelを用意し、あるquestionが与えられたときに、paraphrasing modelでparaphraseのスコアを算出、その後、各paraphrasingの候補に対してqa modelで解答を予測し、両者のスコアの積のsummationによって最終的なanswerを決定

QAはデータセットのサイズが小さいので、paraphrasingのような手法が有効に働いているのかもしれない




Paper/Blog Link My Issue
#NeuralNetwork #ComputerVision #NaturalLanguageGeneration #NLP #MultitaskLearning #ACL #Encoder-Decoder #3D (Video) #VideoCaptioning Issue Date: 2017-12-31 GPT Summary- ビデオキャプショニングの改善のため、教師なしビデオ予測タスクと論理的言語含意生成タスクを共有し、リッチなビデオエンコーダ表現を学習。パラメータを共有するマルチタスク学習モデルを提案し、標準データセットで大幅な改善を達成。 Comment

解説スライド: https://www.slideshare.net/HangyoMasatsugu/hangyo-acl-paperreading2017multitask-video-captioning-with-video-and-entailment-generation/1

multitask learningで動画(かなり短め)のキャプション生成を行なった話




Paper/Blog Link My Issue
#NeuralNetwork #Sentence #Embeddings #NLP #RepresentationLearning #ICLR #Selected Papers/Blogs Issue Date: 2017-12-28 GPT Summary- 自己注意機構を用いた新しい文埋め込みモデルを提案。2次元行列で文の異なる部分に注意を払い、視覚化手法も提供。著者プロファイリング、感情分類、テキスト含意の3つのタスクで評価し、他の手法と比較して性能が向上したことを示す。 Comment

OpenReview: https://openreview.net/forum?id=BJC_jUqxe

日本語解説: https://ryotaro.dev/posts/a_structured_self_attentivesentence_embedding/

self-attentionを提案した研究




Paper/Blog Link My Issue
#NeuralNetwork #Controllable #NLP #EMNLP #Length #Selected Papers/Blogs #Encoder-Decoder Issue Date: 2025-01-03 GPT Summary- ニューラルエンコーダ-デコーダモデルの出力長を制御する方法を提案。特にテキスト要約において、デコーディングと学習に基づく2つのアプローチを用い、学習ベースの方法が要約の質を保ちながら長さを調整できることを示した。 Comment

Encoder-Decoderモデルにおいてoutput lengthを制御する手法を提案した最初の研究




Paper/Blog Link My Issue
#NeuralNetwork #NaturalLanguageGeneration #NLP #VariationalAutoEncoder #CoNLL #Selected Papers/Blogs #Reference Collection #RecurrentModels Issue Date: 2018-02-14 GPT Summary- RNNベースの変分オートエンコーダ生成モデルを導入し、文全体の分散潜在表現を組み込むことで、文のスタイルやトピックなどの特性を明示的にモデル化。潜在空間を通じて新しい文を生成し、欠損単語の補完効果を実証。モデルの特性と使用に関する否定的な結果も示す。 Comment

VAEを利用して文生成

【Variational Autoencoder徹底解説】

https://qiita.com/kenmatsu4/items/b029d697e9995d93aa24




Paper/Blog Link My Issue
#TimeSeriesDataProcessing #MachineLearning #CIKM Issue Date: 2017-12-31 GPT Summary- DDE-MGMという新しいオンラインモデリング手法を提案。従来の固定長や整列データの仮定を排除し、導関数遅延埋め込みを用いてストリーミング時系列データを効率的に処理。非パラメトリックマルコフ地理モデルでパターンをモデル化し、優れた分類精度を実現。実験結果は最先端手法と比較して効果的であることを示す。 Comment

スライド: https://www.slideshare.net/akihikowatanabe3110/brief-survey-of-datatotext-systems

(管理人が作成した過去のスライドより)
image




Paper/Blog Link My Issue
#NeuralNetwork #MachineTranslation #NLP #ACL #Selected Papers/Blogs Issue Date: 2017-12-28 GPT Summary- 希少および未知の単語に対処するため、注意機構を用いた新しいニューラルネットワークモデルを提案。2つのソフトマックス層を使用し、文脈に基づいて適応的に選択。提案モデルは、翻訳と要約タスクで性能向上を示した。 Comment

テキストを生成する際に、source textからのコピーを行える機構を導入することで未知語問題に対処した話

CopyNetと同じタイミングで(というか同じconferenceで)発表




Paper/Blog Link My Issue
#NeuralNetwork #ComputerVision #Visual Words #CVPR Issue Date: 2017-12-28 GPT Summary- 分類決定の説明は重要であり、既存の深層視覚認識アプローチは不透明である。新たに提案するモデルは、可視オブジェクトの識別特性に基づき、クラスラベルを予測し、その理由を説明する。サンプリングと強化学習に基づく新しい損失関数を用いて、グローバルな文の特性を実現する。実験結果は、提案モデルが一貫性のある識別的な説明を生成できることを示している。 Comment

画像そのものだけでなく、モデルへのInputにVisual Wordsを明示的に加えることで、captioningの精度が上がりましたという論文




Paper/Blog Link My Issue
#Embeddings #NLP #Word #RepresentationLearning #Selected Papers/Blogs #Finetuning Issue Date: 2025-12-04 GPT Summary- 意味的レキシコンの情報を活用して、単語のベクトル空間表現を改善する手法を提案。関連する単語が類似のベクトルを持つよう促し、従来の仮定に依存しない。複数の言語での語彙意味評価タスクで大幅な改善を示し、従来技術を上回る性能を達成。 Comment

日本語解説: https://www.slideshare.net/slideshow/20150421-forupdate/47365800

Retrofittingという用語を今でも耳にすることがあるが、この研究のような手法を指すと思って良いと思われる(研究室の輪講で本論文の発表があったのを思い出すなぁ)。事前学習済みの単語ベクトルに対して事後的に外部知識(辞書など)を埋め込みチューニングする話。




Paper/Blog Link My Issue
#NeuralNetwork #MachineTranslation #NLP #Attention #ICLR #Selected Papers/Blogs Issue Date: 2025-05-12 GPT Summary- ニューラル機械翻訳は、エンコーダー-デコーダーアーキテクチャを用いて翻訳性能を向上させる新しいアプローチである。本論文では、固定長のベクトルの使用が性能向上のボトルネックであるとし、モデルが関連するソース文の部分を自動的に検索できるように拡張することを提案。これにより、英語からフランス語への翻訳タスクで最先端のフレーズベースシステムと同等の性能を達成し、モデルのアライメントが直感と一致することを示した。 Comment

(Cross-)Attentionを初めて提案した研究。メモってなかったので今更ながら追加。Attentionはここからはじまった(と認識している)




Paper/Blog Link My Issue
#RecommenderSystems #NeuralNetwork #CTRPrediction #SequentialRecommendation #SIGKDD Issue Date: 2025-04-25 GPT Summary- メールの領収書から得た購入履歴を活用し、Yahoo Mailユーザーにパーソナライズされた商品広告を配信するシステムを提案。新しい神経言語ベースのアルゴリズムを用いて、2900万人以上のユーザーのデータでオフラインテストを実施した結果、クリック率が9%向上し、コンバージョン率も改善。システムは2014年のホリデーシーズンに本稼働を開始。 Comment

Yahoo mailにおける商品推薦の研究
image

Yahoo mailのレシート情報から、商品購入に関する情報とtimestampを抽出し、時系列データを形成。評価時はTimestampで1ヶ月分のデータをheldoutし評価している。Sequential Recommendationの一種とみなせるが、評価データをユーザ単位でなくtimestampで区切っている点でよりrealisticな評価をしている。

関連:
- [Paper Note] Sequence-Aware Recommender Systems, Massimo Quadrana+, ACM Computing Surveys (CSUR), Volume 51, Issue 4, 2018.02




Paper/Blog Link My Issue
#RecommenderSystems #SessionBased #ICLR #SequentialRecommendation #Selected Papers/Blogs Issue Date: 2019-08-02 GPT Summary- RNNを用いたセッションベースのレコメンダーシステムを提案。短いユーザーヒストリーに基づく推薦の精度向上を目指し、セッション全体をモデル化。ランキング損失関数などの修正を加え、実用性を考慮。実験結果は従来のアプローチに対して顕著な改善を示す。 Comment

RNNを利用したsequential recommendation (session-based recommendation)の先駆け的論文。

日本語解説: https://qiita.com/tatamiya/items/46e278a808a51893deac




Paper/Blog Link My Issue
#NLP #LanguageModel #ACL #IJCNLP #Selected Papers/Blogs #Reference Collection Issue Date: 2018-03-30 Comment

文のacceptability(容認度)論文。

文のacceptabilityとは、native speakerがある文を読んだときに、その文を正しい文として容認できる度合いのこと。

acceptabilityスコアが低いと、Readabilityが低いと判断できる。

言語モデルをトレーニングし、トレーニングした言語モデルに様々な正規化を施すことで、acceptabilityスコアを算出する。

日本語解説: http://www.lr.pi.titech.ac.jp/~sasano/acl2015suzukake/slides/01.pdf




Paper/Blog Link My Issue
#RecommenderSystems #CollaborativeFiltering #Library #FactorizationMachines Issue Date: 2018-01-01 GPT Summary- 因子分解機(FM)は、レコメンダーシステムで成功を収めているにもかかわらず、機械学習の標準ツールボックスには含まれていない。私たちのFMの実装は、回帰、分類、ランキングタスクをサポートし、多くのソルバーへのアクセスを簡素化することで、FMの幅広いアプリケーション利用を促進する。これにより、FMモデルの理解が深まり、新たな開発が期待される。 Comment

実装されているアルゴリズム:Factorization Machines

実装:python

使用方法:pythonライブラリとして利用

※ Factorization Machinesに特化したpythonライブラリ

参考:

http://www.kamishima.net/archive/recsysdoc.pdf

https://takuti.me/note/recommender-libraries/




Paper/Blog Link My Issue
#NLP #ReviewGeneration #Personalization Issue Date: 2017-12-28 Comment

review generationの結果をrating predictionに伝搬することで性能よくしました、という話だと思う




Paper/Blog Link My Issue
#RecommenderSystems #CTRPrediction Issue Date: 2021-10-29 Comment

日本語解説: https://ameblo.jp/cyberanalyst/entry-11784152713.html



CTR予測の概要や、広告主・事業者にとってCTR予測ができることでどのようなメリットがあるかなどがまとまっている。

論文の手法自体は、logistic regressionが利用されている。




Paper/Blog Link My Issue
#AdaptiveLearning #StudentPerformancePrediction #KnowledgeTracing #EDM Issue Date: 2021-10-29 Comment

BKTでは1種類のスキルしか扱えなかった問題を改善(skillだけでなく、sub-skillも扱えるように)

様々なFeatureを組み合わせることが可能

実装: https://github.com/ml-smores/fast

ただし、GPL-2.0ライセンス




Paper/Blog Link My Issue
#InformationRetrieval #LearningToRank #Online/Interactive #Interleaved #WSDM Issue Date: 2018-01-01 Comment

[Paper Note] Interactively Optimizing Information Retrieval Systems as a Dueling Bandits Problem, Yue+, ICML'09 DBGDを拡張した手法を提案している。

アルゴリズムが細かく書いてあるので、追っていくとDBGD等について理解が深まると思われる。

Interleavemethodについても。




Paper/Blog Link My Issue
#MachineLearning #StructuredLearning Issue Date: 2017-12-31 Comment

タイトルの通り、構造学習版のpassive-aggressiveアルゴリズムの分散処理による高速化手法について提案されている論文。



論文中のAlgorithm.2がアルゴリズム。




Paper/Blog Link My Issue
#NeuralNetwork #ComputerVision #NeurIPS #Selected Papers/Blogs #ImageClassification #Backbone Issue Date: 2025-05-13 Comment

ILSVRC 2012において圧倒的な性能示したことで現代のDeepLearningの火付け役となった研究AlexNet。メモってなかったので今更ながら追加した。

AlexNet以前の画像認識技術については牛久先生がまとめてくださっている(当時の課題とそれに対する解決法、しかしまだ課題が…と次々と課題に直面し解決していく様子が描かれており非常に興味深かった)。現在でも残っている技術も紹介されている。:
https://speakerdeck.com/yushiku/pre_alexnet

> 過去の技術だからといって聞き流していると時代背景の変化によってなし得たイノベーションを逃すかも

これは肝に銘じたい。




Paper/Blog Link My Issue
#PersonalizedDocumentSummarization #NLP #Personalization Issue Date: 2023-05-05 Comment

ざっくり言うと、ソーシャルタギングシステムにおいて、ユーザ uと類似したユーザのタグ付け情報と、原文書d _と同じトピックに属する文書をそれぞれ考慮することによって、ユーザのinterestに関する情報(と原文書のinformativenessに関する情報)を拡張し、これらの情報を活用して、全てのクラスタリングしたドキュメントの中で重要文をランキングした上で、対象文書に対するsentenceのみを冗長性がないように抽出することで、Personalized_ Summarizationしましょう、という話




Paper/Blog Link My Issue
#RecommenderSystems #Comments #WWW Issue Date: 2018-01-15 Comment

過去のユーザのコメントに対するratingに基づいて、ユーザが(コメントを通じて)議論に参加したいようなNews Storyを推薦する研究。




Paper/Blog Link My Issue
#Multi #RecommenderSystems #MatrixFactorization #WSDM #ColdStart Issue Date: 2017-12-28 Comment

multi-relationalな場合でも適用できるmatrix factorizationを提案。特にcold start problemにフォーカス。social networkのデータなどに適用できる。




Paper/Blog Link My Issue
#CollaborativeFiltering #MatrixFactorization #EducationalDataMining #StudentPerformancePrediction Issue Date: 2021-10-29 Comment

過去のCollaborative Filteringを利用したStudent Performance Prediction (Collaborative Filtering Applied to Educational Data Mining, Andreas+, KDD Cup'10 など)では、単一の関係性(student-skill, student-task等の関係)のみを利用していたが、この研究では複数の関係性(task-required skill-learnt skill)を利用してCFモデルの性能を向上させ、Bayesian Knowledge TracingやMatrix Factorizationに基づく手法をRMSEの観点でoutperformした。






Paper/Blog Link My Issue
#AdaptiveLearning #EducationalDataMining #StudentPerformancePrediction #EDM Issue Date: 2018-12-22 Comment

student performanceは、推薦システムの問題において、下記の2種類にcastできる:

1. rating prediction task, すなわち、ユーザ・アイテム・ratingを、生徒・タスク・パフォーマンスとみなす

2. sequentialなエフェクトを考慮して、forecasting problemに落とす



image

TensorFactorizationで、欠損値を予測

cold-start problem(new-user, new item)への対処としては、global averageをそれぞれ用いることで対処(more sophisticatedなやり方が提案されているとも述べている)



使用している手法としては、この辺?

https://pdfs.semanticscholar.org/8e6b/5991f9c1885006aa204d80cc2c23682d8d31.pdf




Paper/Blog Link My Issue
#NeuralNetwork #CollaborativeFiltering #MatrixFactorization #EducationalDataMining #StudentPerformancePrediction Issue Date: 2021-10-29 Comment

KDD Cup'10のStudent Performance Predictionタスクにおいて3位をとった手法

メモリベースドな協調フィルタリングと、Matirx Factorizationモデルを利用してStudent Performance Predictionを実施。

最終的にこれらのモデルをニューラルネットでensembleしている。




Paper/Blog Link My Issue
#Multi #PersonalizedDocumentSummarization #DocumentSummarization #NLP #QueryBiased #Personalization Issue Date: 2017-12-28 Comment

・unigramの共起だけでなく,bigramの共起も考慮したPLSIモデルを提案し,jointで学習.与えられたクエリやnarrativeなどとsentenceの類似度(latent spaceで計算)を計算し重要文を決定。

・user-modelを使ったPersonalizationはしていない.




Paper/Blog Link My Issue
#AdaptiveLearning #KnowledgeTracing #ITS Issue Date: 2022-08-31 Comment

- BKTのModel Degeneracy問題について言及されている

- Model Degeneracy: parameterの値がモデルのconceptualな意味合いを破ってしまうこと

- たとえば、学習者がスキルを知っている場合よりも、知らない場合に正答を得る可能性が高くなってしまう、など

- slipping, guessingパラメータにboundaryを設ける(0.3, 0.1未満になるようにする)などの制約をつけることでこういった事態を過去の研究では回避していることが言及されている




Paper/Blog Link My Issue
#NeuralNetwork #NLP #MultitaskLearning #ICML #Selected Papers/Blogs Issue Date: 2018-02-05 Comment

Deep Neural Netを用いてmultitask learningを行いNLPタスク(POS tagging, Semantic Role Labeling, Chunking etc.)を解いた論文。

被引用数2000を超える。



multitask learningの学習プロセスなどが引用されながら他論文で言及されていたりする。




Paper/Blog Link My Issue
#RecommenderSystems #MatrixFactorization #NeurIPS #Selected Papers/Blogs Issue Date: 2018-01-11 Comment

Matrix Factorizationを確率モデルとして表した論文。

解説: http://yamaguchiyuto.hatenablog.com/entry/2017/07/13/080000

既存のMFは大規模なデータに対してスケールしなかったが、PMFではobservationの数に対して線形にスケールし、さらには、large, sparse, imbalancedなNetflix datasetで良い性能が出た(Netflixデータセットは、rating件数が少ないユーザとかも含んでいる。MovieLensとかは含まれていないのでより現実的なデータセット)。

また、Constrained PMF(同じようなsetの映画にrateしているユーザは似ているといった仮定に基づいたモデル[^1])を用いると、少ないratingしかないユーザに対しても良い性能が出た。

[^1]: ratingの少ないユーザの潜在ベクトルは平均から動きにくい、つまりなんの特徴もない平均的なユーザベクトルになってしまうので、同じ映画をratingした人は似た事前分布を持つように制約を導入したモデル




Paper/Blog Link My Issue
#RecommenderSystems #MatrixFactorization #SIGKDD Issue Date: 2018-01-11 Comment

従来のMatrix Factorization(MF)では、pair-wiseなrelation(たとえば映画とユーザと、映画に対するユーザのrating)からRating Matrixを生成し、その行列を分解していたが、multipleなrelation(たとえば、user-movie ratingの5-scale Matrixとmovie - genreの binary Matrixなど)を扱うことができなかったので、それを可能にした話。

これができると、たとえば ユーザの映画に対するratingを予測する際に、あるユーザが特定のジャンルの映画に対して高いratingを付けるような情報も考慮して予測ができたりする。




Paper/Blog Link My Issue
#MachineLearning #StructuredLearning #SIGKDD Issue Date: 2017-12-31 Comment

従来、structured learningの設定でranking lossを最適化する際は、smoothなmetric、たとえばMAPやAUCなどを最適化するといったことが行われていたが、MRRやNDCGなどのnon-smoothなmetricに対しては適用されていなかった。



なので、それをできるようにしましたという論文。




Paper/Blog Link My Issue
#PersonalizedDocumentSummarization #DocumentSummarization #NLP #Personalization #WI Issue Date: 2017-12-28 Comment

評価
5人の研究者による人手評価。
25種類の異なるトピックが選択され、各トピックには5-10の記事が紐づいている。
generic,personalizedな要約を提示しrelevanceを判定してもらった。具体的には、informativenessを5段階評価。
データ非公開、ニュース記事を使ったとしか記述されておらず再現不可




Paper/Blog Link My Issue
#MachineTranslation #NLP #LanguageModel #Selected Papers/Blogs Issue Date: 2024-12-24 GPT Summary- 本論文では、機械翻訳における大規模な統計的言語モデルの利点を報告し、最大2兆トークンでトレーニングした3000億n-gramのモデルを提案。新しいスムージング手法「Stupid Backoff」を導入し、大規模データセットでのトレーニングが安価で、Kneser-Neyスムージングに近づくことを示す。 Comment

N-gram言語モデル+スムージングの手法において、学習データを増やして扱えるngramのタイプ数(今で言うところのvocab数に近い)を増やしていったら、perplexityは改善するし、MTにおけるBLEUスコアも改善するよ(BLEUはサチってるかも?)という考察がされている

image

元ポスト:

Loading…

Large Language Modelsという用語が利用されたのはこの研究が初めてなのかも…?




Paper/Blog Link My Issue
#UserModeling #Personalization #WWW Issue Date: 2017-12-28 Comment

social bookmarkのタグを使ってどのようにユーザモデルを作成する手法が提案されている。タグの時系列も扱っているみたいなので、参考になりそう。




Paper/Blog Link My Issue
#InformationRetrieval #LearningToRank #PairWise #ICML #Selected Papers/Blogs Issue Date: 2018-01-01 Comment

pair-wiseのlearning2rankで代表的なRankNet論文

解説ブログ: https://qiita.com/sz_dr/items/0e50120318527a928407



lossは2個のインスタンスのpair、A, Bが与えられたとき、AがBよりも高くランクされる場合は確率1, AがBよりも低くランクされる場合は確率0、そうでない場合は1/2に近くなるように、スコア関数を学習すれば良い。




Paper/Blog Link My Issue
#InformationRetrieval #Personalization #SIGIR Issue Date: 2017-12-28 Comment

・userに関するデータがrichなほうが、Personalizationは改善する。

・queries, visited web pages, emails, calendar items, stored desktop    

 documents、全てのsetを用いた場合が最も良かった

(次点としてqueriesのみを用いたモデルが良かった)




Paper/Blog Link My Issue
#Multi #DocumentSummarization #Classic #NLP Issue Date: 2023-08-27 Comment

MEAD, Centroid-basedな手法で要約を実施する古典的なMDS手法




Paper/Blog Link My Issue
#AdaptiveLearning #KnowledgeTracing #ITS Issue Date: 2022-09-12 Comment

英語の音読に関してKTを適用した話が記載されている

スキルの定義はgrapheme=>phoneme mappingsとして定義されるっぽい

- ch は /CH/ と発音する場合(e.g. Charles)もあれば /K/ の場合もある(e.g. Chaos)

- ch=>/CH/, ch=>/K/ のマッピングがスキルとして定義されている?




Paper/Blog Link My Issue
#MachineTranslation #Metrics #NLP Issue Date: 2021-06-25 Comment

BLEUスコア、NISTスコア、WordErrorRate(WER)などに関して丁寧かつ簡潔に解説してある。

BLEUスコア算出に利用するN-gramは一般的にはN=4が用いられる、といった痒いところに手が届く情報も書いてある。

普段何気なく使っているBLEUスコアで、あれ定義ってどんなだっけ?と立ち帰りたくなった時に読むべし。

実際に研究等でBLEUスコアを測りたい場合は、mosesの実装を使うのが間違いない:

https://github.com/moses-smt/mosesdecoder/blob/master/scripts/generic/multi-bleu.perl




Paper/Blog Link My Issue
#DocumentSummarization #NLP #Alignment #EMNLP Issue Date: 2018-01-15 Comment

AbstractsとSource TextのAlignmentをとるために、Phrase-Based HMMを提案。

Ziff-Davis Corpusのテキストに対して、2人のannotatorによってgold standardを作成。

評価においてMTにおけるIBM Model4やHMM basedな単語アライメント手法と比較しているが、fair comparisonのために行なっている施策が参考になる。




Paper/Blog Link My Issue
#MachineTranslation #Tools #NLP #WordAlignment Issue Date: 2018-01-15 Comment

Giza++
標準的に利用される単語アライメントツール

評価の際は、Sure, Possibleの二種類のラベルによる単語アライメントのground-truth作成も行っている

http://delivery.acm.org/10.1145/780000/778824/s2.pdf?ip=122.18.145.201&id=778824&acc=OPEN&key=4D4702B0C3E38B35%2E4D4702B0C3E38B35%2E4D4702B0C3E38B35%2E6D218144511F3437&__acm__=1529099122_be539b373009b5812a7efac44e71e64d




Paper/Blog Link My Issue
#DocumentSummarization #NLP #WordAlignment Issue Date: 2018-01-15 Comment

文を単位とし、文を文中の単語の出現頻度ベクトルで表し、ベクトル間の距離で文間の類似度を計ることで自由作成要約中の文と現文中の文をもっとも類似度が大きくなるように対応づける。




Paper/Blog Link My Issue
#NeuralNetwork #MachineLearning #MoE(Mixture-of-Experts) Issue Date: 2025-04-29 Comment

Mixture of Expertsの起源

と思ったのだが、下記研究の方が年号が古いようだが、こちらが起源ではなのか・・・?だがアブスト中に上記論文で提案されたMoEのパフォーマンスを比較する、といった旨の記述があるので時系列がよくわからない。
[Evaluation of Adaptive Mixtures of Competing Experts]( http://www.cs.toronto.edu/~fritz/absps/nh91.pdf)

参考: https://speakerdeck.com/onysuke/mixture-of-expertsniguan-suruwen-xian-diao-cha




Paper/Blog Link My Issue
#Article #NLP #LanguageModel #MultiModal #Blog #LLMServing #VisionLanguageModel #Reading Reflections #SystemOneModel Issue Date: 2026-09-30 Comment

元ポスト:

Loading…

SGLangにおいて、Qwen3.8-27B、およびQwen3.5-35B-A3Bを、chat modelからdecision model(System Oneな分類モデル)として利用するためのエンドポイントが追加されたようである。

ドキュメントを読むと、要は既存のLLMに対してリクエストをreasoning modeをオフでprefillし、応答のトークン位置でのスコアリング、選択肢、yes/noのトークンのlogprobを取得し、たとえばyes/noトークンのprobabilityを計算する場合はyes/noの2 vocabularyのsoftmaxを計算する。つまり、単に通常のLLMの応答の開始位置でのラベルのlogprobを取得して、最もlogprobが高いラベルを返し上述の確率を返すというシンプルな実装に見える。

System Oneモデル向けの追加のチューニングや、分類headなどが学習されているわけではない(SGLangはLLM Servingエンジンでありモデルの学習そのものはしないだろうから、そりゃそうだ、という話だった)点に注意。シンプルに、LLMのデコード開始位置でのlogprobを用いた分類器であり、これを念頭におけば、このエンドポイントを利用した場合のおおよその性能の見当はつく(性能が悪いと言いたいわけではなく、これまでのLLM利用の経験からあたりをつけやすいという意図である)。

System One系の話は実装の中身を確認して、どのような原理の元駆動するかを確認しないと、足元をすくわれる気がする。外から見た時の挙動は同じでも、アーキテクチャが結構異なる気がする。あと、アーキテクチャだけでなく、System Oneモデル向けのデータや最適化がされているかによって、そもそもの予測性能やzero-shotでの汎化性能にかなり差が生まれるのではないか、と思っている。しかし、まあ結局自分たちのユースケースに対して必要な性能が出ていて、latencyが必要な水準に達しているかを確認すれば良いだけではある。




Paper/Blog Link My Issue
#Article #Analysis #NLP #LanguageModel #GenerativeAI #Post Issue Date: 2026-09-28 Comment

主要なクローズドモデル、オープンモデルを提供する企業の(おそらくLLM周りの)ARRを比較したところ、オープンモデルのARRはクローズドモデルのARRの10%程度と推察される、という話に見える。

が、オープンモデルのプロバイダーに対して、古いデータが使われている(プロバイダーによっては、usageが数倍〜10倍になっている)という指摘と、Googleの売上に対するAIの間接的な貢献「軽視しすぎている、という指摘がある。

Loading…


あと、一部からClaudeに作成させ、検証をせずに読者側に検証の手間を委ねるのはいかがなものか、という趣旨の批判がある。




Paper/Blog Link My Issue
#Article #ComputerVision #Analysis #ImageSegmentation #Blog #Reasoning #ComputerUse #VisionLanguageModel #2D (Image) #ObjectDetection Issue Date: 2026-09-27 Comment

元ポスト:

Loading…

GPT-6-Astraに対して、Image Segmentation, Object Detection, counting, box prompt, counting, visual reasoning, re-identification(バスケットボールの動画を例に、選手を一貫して検知し共通のIDを付与できるか, 特に選手交代などにも対応できるか)などのさまざまなタスクでテストした結果が報告されている。結論としては、彼らがテストした中で最も強力なVisionモデルだが、コスト、latencyに関するトレードオフがあることが考察されており、特にリアルタイム処理には向いていないが、アノテーションなどのパッチ処理には価値があるだろうとしている。




Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #Blog #Distillation #PostTraining #read-later #Author Thread-Post Issue Date: 2026-09-25 Comment

元ポスト:

Loading…

RL前にSFTを通じてオフポリシー蒸留をすることが、どれだけ後段のRL後のパフォーマンスに影響するかを調査したようで、
- 小規模モデルには効果的だが大規模なモデルには効果が薄く
- ベースモデルに存在しない慣習や理解を必要とするタスクに対して効果的で
- 副作用としてポリシーのエントロピーが低減する、すなわちRL中の探索が抑制される

といった知見が得られたようである。

一見すると、SLMに関しては

- [Paper Note] A Sober Look at Progress in Language Model Reasoning: Pitfalls and Paths to Reproducibility, Andreas Hochlehnert+, COLM'25

と対立する知見に見えるが、前提として何が違うだろうか。

SLMに対しては同様の知見が示されている:
- [Paper Note] AceReason-Nemotron 1.1: Advancing Math and Code Reasoning through SFT and RL Synergy, Zihan Liu+, arXiv'25, 2025.06




Paper/Blog Link My Issue
#Article #NLP #Dataset #LanguageModel #ReinforcementLearning #Repository #SmallModel #PostTraining #Environment Issue Date: 2026-09-25 Comment

元ポスト:

Loading…

SLMのcoding, datascience向けの
(いわゆるSmolな)RL学習用の5k+のverifiableなタスクデータ、Environment、評価、学習のコードを提供。

従来の初心者向けのチュートリアルでは、GSM8Kのような既に飽和したデータセットが主なデータであり、より実用的なデータに基づいたRLVRのための環境を整えた、という感じに見える。




Paper/Blog Link My Issue
#Article #NLP #LanguageModel #ReinforcementLearning #Blog #PostTraining #Selected Papers/Blogs #CriticalBatchSize Issue Date: 2026-09-24 Comment

元ポスト:

Loading…

目標性能まで到達するまでに必要なwall-clock timeとLLMでのオンポリシーRLのバッチサイズの関係性を明らかにしているようである。

LLMのオンポリシーRLでは、生成と学習においてバッチサイズの大きさが非対称に働く(すなわち、生成側の並列数を増やすとモデルの重み転送をより多く共有できるため処理に要する時間が短縮されるが、学習側でバッチサイズが増えると処理時間は増加する)ため、生成側の並列数の変化によるスループットの向上と、学習側のバッチサイズによる更新に必要なサンプル数の両方を考える必要がある。

このとき、目標性能に到達するまでに必要な累積応答数N(学習側)、エンドツーエンドのスループットq(生成側だけではなくシステム全体)を考える。

これにより、バッチサイズを変化させた時に必要なサンプル数の変化の比率r_N (=N/N_pivot, r_Nが1より大きい場合は、新たなバッチサイズが基準となるバッチサイズよりも、ある性能に到達するまでより多くの応答を必要とする)、

スループットの変化の比率r_q(=q/q_pivot, r_q>1の場合は、1秒あたりにより多くの応答を処理できる)を定義でき、

r_q > r_Nの場合、すなわち、バッチサイズを大きくしたことによる、システムのエンドツーエンドのスループット向上による恩恵が、学習側のサンプルコストの悪化を上回った場合に、バッチサイズを大きくすることで学習が高速化される、このときの改善の度合いは r_N/r_q で測ることができる。例えば、r_N/r_q=0.8の場合、学習時間が20%削減されることを意味する、といったフレームワークを定義でき (The criterion部分を参照)、

実践的には、
- 候補となるバッチサイズについて、学習率や関連するハイパーパラメータを調整し、学習に利用される応答単位での学習に対する寄与を揃え、累積応答数が等しい点での学習曲線を比較することで、r_Nを推定し
- 与えられたバッチサイズにおいてシステムのスループットを最大化する設定を探索し、r_qを測定する
- その上で、r_N/r_qを測定し、最も学習時間が短縮されるバッチサイズを採用する

というプロセスにおとしこむことができる(conclusionを参照)

という感じの話のようにみえる。




Paper/Blog Link My Issue
#Article #Pretraining #NLP #Dataset #LanguageModel #MoE(Mixture-of-Experts) #Selected Papers/Blogs #DataMixture #Reading Reflections #Author Thread-Post Issue Date: 2026-09-24 Comment

元ポスト:

Loading…

Marinの535B級のMoEモデルを学習した際のデータであり、利用されたツール(クラスタリングに利用されたモデル)も公開されている。

元ポスト中にデータ構築の手順が紹介されており、
- 学習が許可された152の公開データから、25Tトークンを利用
- deduplicationによる2.13T tokensを除外し
- 評価データとの重複を避けるために13-gramによるフィルタリングを実施し
- 特定の分野のデータ等をサンプリングしたいが、その際にソースではなくドキュメントの内容でグルーピングしたいので、embeddingに基づいてクラスタリングを実施し、200のクラスタを形成した

といった話が紹介されている。

LLM-jpではOpenSourceであるために、徹底的にデータセット内部まで精査をして、問題のあるインスタンスの修正等が実施されていたが、Marinではこのような取り組みは行われているのだろうか。特に、データセットに付与されているライセンスがオープンソースである場合でも、データセット、あるいはデータセット中のサンプルの出自を辿るとオープンソースとは呼べないものが存在するという話がある。

- 約12兆トークンの良質なコーパスで学習した新たな国産LLM「LLM-jp-4 8Bモデル」「LLM-jp-4 32B-A3Bモデル」をオープンソースライセンスで公開 ~一部ベンチマークでGPT-4oやQwen3-8Bを上回る性能を達成~, NII, 2026.04
- LLM-jp-4-VL 9Bリリース, LLM-jp, 2026.09

Marinコミュニティにおける"Open"の意味を読むと、Open Sourceの定義を満たすことを目指しているというより、weightを公開するだけではなく、その他の構築に関わる全ての情報を公開する、たとえば学習データであれば全データのソースを開示する、という開発プロセス全体を公開しますよ、という意味に見えるため、ライセンス的に問題のあるインスタンスの削除などは行われていないのかもしれない、が、Marinプロジェクトの公開されている全ての議論の中にそういった話題は存在するかもしれないので実際のところは一次ソースを当たらないとよくわからない。

https://marin.community




Paper/Blog Link My Issue
#Article #NLP #LanguageModel #SmallModel #OpenWeight #reading #Reading Reflections #SystemOneModel Issue Date: 2026-09-20 Comment

元ポスト:

Loading…

こちらはJev系のモデルを謳うものと比較して、Qwenをベースにしており、かつ広範なタスクで評価がされているため、ある程度のzeroshotでの汎用モデルとは言えそうである。が、結局のところどこまで汎用的に使えるかはよくわからない。

関連:
- Needle 3 Automation Foundation Model For Tiny Devices, Cactus, 2026.09
- Introducing System One Models & Jev, TypeSafe AI, 2026.09




Paper/Blog Link My Issue
#Article #ComputerVision #NLP #Dataset #Transformer #SyntheticData #OpenWeight #ComputerUse #Encoder #Author Thread-Post Issue Date: 2026-09-19 Comment

github: https://github.com/trycua/cua/tree/main/libs/cua-s1
dataset: https://huggingface.co/datasets/cua-ai/cua-s1-forms

元ポスト:

Loading…

フォーム入力に特化したCUAを実施できるモデルのようで、これもいわゆるSystem One Modelとして紹介されている。Transformer Encoderをバックボーンとする。

まあしかしこれは言ってしまえばただの合成データでFinetuningをしたBERTに見える。Jevのような様々なタスクに対してzero-shotの汎化をしめすものではないであろう点に注意。Jevがどれだけ汎用なのかはわからんが...




Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #MultiLingual #OpenWeight #Encoder #Reading Reflections Issue Date: 2026-09-19 Comment

元ポスト:

Loading…

state (email, text, ticket, あるいはJSON)を与え、質問のタイプとinstruction(choice, score, noul)を与えると、質問に対応する出力を得られるModernBERTベースのモデル。questionあたり512トークンまで扱えるようである(state, question, optionの合計で512トークン)。RLCDと呼ばれるポリシーがdistributionを出力する手法で学習され、この手法はhonest probabilityを出力することで機体報酬が最大化されるとの記載がある。100+言語に対応。

emailのサンプル例は、ユーザからの問い合わせに対して、担当部署(choice)、緊急度(score)、解約の確率(noul)を出力する例となっている。

関連:
- Needle 3 Automation Foundation Model For Tiny Devices, Cactus, 2026.09
- Introducing System One Models & Jev, TypeSafe AI, 2026.09

これ系の話がいきなり増えてきた。マルチリンガルでモデルがオープンなのはありがたや。

最初読んだ時は様々なタスクやドメインに利用できるのかなと思ったが、emailドメインにしか適用できないのでは?zero-shotで汎用的に利用できないのであれば、それはただのFinetuningされたBERTである。




Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #LanguageModel #Transformer #Blog #SmallModel #Proprietary #Architecture #Selected Papers/Blogs #ToolUse #Author Thread-Post #SystemOneModel Issue Date: 2026-09-19 Comment

元ポスト:

Loading…

チャットをせず、各ターンごとに関数呼び出しに特化したedge向け小型モデルとのこと。アプリが利用するツール群を渡し、ユーザの発言に基づいて全ての引数を埋めて関数を呼び出す、あるいはスキーマを与えればそのスキーマに則った出力を返し(構造化出力)、推測はしない(関数の範囲外のものは空出力)というもののようである。

これらは、simple attention networkと呼ばれるもので実現される。simple attention networkはtransformerからFFN Layerをを無くし軽量なHadarmard MLPというlayerに置き換え、FFNが従来保持していた知識に関する情報はengramによって、n-gram embedding側に持たせることによって高速、軽量化がじつげんされているようである。residual streamとしては、mHCが用いられているようである。
また、デプロイ時にモデルの深さを指定することで、20個あるうちのどのlayerを利用するかが決まり、性能とコストを調整できるようである。これを公式ポストではIntelligence Laddersと呼称している。

関連:
- [Paper Note] Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models, Xin Cheng+, arXiv'26, 2026.01
- [Paper Note] mHC: Manifold-Constrained Hyper-Connections, Zhenda Xie+, arXiv'25, 2025.12

関連:
- Introducing System One Models & Jev, TypeSafe AI, 2026.09

と思想が似ている。




Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Quantization #Blog #OpenWeight #ComputerUse #Selected Papers/Blogs #reading #Author Thread-Post Issue Date: 2026-09-18 Comment

元ポスト:

Loading…

HF: https://huggingface.co/collections/prism-ml/bonsai-2

関連:
- Announcing Bonsai 27B: The First 27B-Class Model to Run on a Phone, PrismRL, 2026.07

ternary weight (1bit)の重みで動作するBonsaiシリーズのメジャーアップデートで、Qwen-3.8-27Bをベースにしており、ベンチマークスコアの98.2パーセントを保持しつつ、1/9程度に利用メモリが節約されるようである。Computer Useも可能で、ローカルのRTX 5090でBrowser Useするデモが掲載されている。




Paper/Blog Link My Issue
#Article #Analysis #NLP #Transformer #Blog #Selected Papers/Blogs #reading #Proofs #Reading Reflections #Author Thread-Post Issue Date: 2026-09-17 Comment

元ポスト:

Loading…

証明のコストが下がることによって、Leanによって型式的な証明をされたML Codeの価値が高まるのではないかという筆者の予測と、

一方で、証明を全て理解することは依然として困難という課題があるのとに言及し、

落とし所として人間にとって理解しやすい(部分的に証明したい)数学的な性質を選択的にAIによって証明するという試みをやってみよう、

そのために、Transformerを例に、Transformerの最適化や効率化の礎となっている数学的な性質を実際にLeanを用いて型式的に証明し理解してみよう、その結果、たとえば、VanillaAttentionとFlashAttentionが数学的に等価だということも示せる、

このような証明したい性質が何であるかを人間が選び、証明を得られることになった変化は重要であり、これらを今後どう活用するかということは今後の挑戦だよね、という話が書かれているようである。

実際に駆動するML Codeで、特定のモデルが実装されているときに、そのモデルが本来備えるべき重要な数学的性質を満たす実装になっていることが、型式的に証明された上で公開され、型式的に証明済みのbadgeがリポジトリに付与されている、みたいな未来が来るのだろうなあ




Paper/Blog Link My Issue
#Article #NLP #LanguageModel #ReinforcementLearning #AIAgents #Blog #PostTraining #Selected Papers/Blogs #Reading Reflections #Author Thread-Post Issue Date: 2026-09-17 Comment

元ポスト:

Loading…

リアルタイムでMimoのRLの学習の経過が公開されている。おもしろい

コストの試算:

Loading…


Mimo, 1T-A42Bの場合、RL 1stepあたり1000万円程度かかっているようだ。
おそらくインフラは高度に最適化されている。

現時点で2モデル合計でコストが約300万ドルに到達し、日本円にして約4.7億円(ドル円157円換算, pro 68B / flash 81B Tokens)🙄DeepSWEやコーディング系のベンチは順調にスコアが向上している。また、noticesに記載されているインシデントの報告が興味深く、インフラ周りのエラーや、学習に悪影響を与えるタスクやデータセット単位での除去なども情報共有されており大変興味深い。PostTrainingデータセットなどMixtureも公開されている。




Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Evaluation #Blog #ContinualLearning Issue Date: 2026-09-13 Comment

元ポスト:

Loading…

Computer Use + Continual Learningに関するベンチマークで、仮想的な建設会社の経理担当として入社し、一定の見習い期間(7ヶ月)を経て、その期間に企業のハンドブックやERPシステムチュートリアル、過去の請求書などで学習をする想定。その実際の請求書処理をこなしていくが、そこには実務上の罠が多く意図的に仕掛けられているようで、Human Baselineでも成功率は51%。最終的にHuman Baselineを上回ったのはAstra, Fable 5.1のようである。モデル間の傾向の違いなども考察されているようである。




Paper/Blog Link My Issue
#Article #Pretraining #NLP #LanguageModel #SyntheticData #Post Issue Date: 2026-09-11 Comment

Phi, Nemotron, Qwenは事前学習における合成データを非常に重視している一方、Kimi, Olmoは徐々に合成データの取り入れを強めてきているが、DeepSeek, MAIは利用していない、という戦略の違いがあるようだ。




Paper/Blog Link My Issue
#Article #Analysis #Pretraining #NLP #LanguageModel #Architecture #Data #Author Thread-Post Issue Date: 2026-09-09 Comment

元ポスト:

Loading…

2019--2025年までの代表的なデータとモデルアーキテクチャの組み合わせによる小規模実験を通じて、事前学習に対するデータ由来の改善とアーキテクチャ由来の改善を分離したところ、データはモデルの改善と比較して3倍以上寄与しているという結論を得た、という話のようである。

ただし、下記ポストのようにMoEが試されていないことや、評価タスクがPPLのようなcompletionベースなではなく、Multiple Choice Questionを用いているためデータが追加されることでbenchmaxingされやすい点が指摘されている。

Loading…




Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #LanguageModel #Blog #LLMServing #GPUKernel #Author Thread-Post Issue Date: 2026-09-09 Comment

github: https://github.com/cohere-ai/cohere-megakernel

バッチサイズ1, 256k context、単一H100利用の条件下において、vLLM v0.24+FlashAttention3+Triton MoE backendよりも最大1.58倍デコーディングが高速(合成されたKV Cacheによる実験、実プロンプト+バッチサイズ8でも1.25--1.41倍高速)な実験的なLLM Servingエンジンのようである。
LLMのデコードを単一のカーネルに集約し、デコーディングのために必要な様々なステップごとの同期のオーバヘッドを削減したのだとか。

元ポスト:

Loading…




Paper/Blog Link My Issue
#Article #ComputerVision #Pretraining #NLP #Dataset #OpenWeight #Japanese #OpenSource #Selected Papers/Blogs #VisionLanguageModel Issue Date: 2026-09-06 Comment

元ポスト:

Loading…

モデル: https://huggingface.co/llm-jp/llm-jp-4-vl-9b

RefinedVision: https://huggingface.co/datasets/llm-jp/RefinedVision

OpenSource AIの定義を満たすためにFineVisionデータセットを精査(e.g. GPT-4oの出力等は利用規約上問題がある)した上で修正(FineVisionは185サブセット, 24M VQAで構成されている)したとのこと。すごい。。。

ライセンス・利用規約上の問題を精査するだけでなく、品質(画像の品質、QAの品質)の観点でも精査の上修正しているようである。

関連:
- [Paper Note] FineVision: Open Data Is All You Need, Luis Wiedmann+, NeurIPS'26, 2025.09




Paper/Blog Link My Issue
#Article #Analysis #Pretraining #NLP #LanguageModel #Blog #MoE(Mixture-of-Experts) #Author Thread-Post Issue Date: 2026-08-30 Comment

元ポスト:

Loading…

sparse MoEモデルを学習する際に、浅い層のexpertが機能しなくなっていく(重みのノルムが非常に小さくなり学習シグナルも消失し回復しない)にもかかわらず、ロードバランシングは正常なままという現象を観測し(Silent Expert Death)、公開されているMoEモデルでも同様の現象が生じていることを確認。LM Loss as Auxiliary Loss (LLAL)と呼ばれる、最初の数千ステップで浅いMoE Layerを一時的に言語モデルのheadに接続し、その後その接続を削除するような方法を用いると、loss・downstream task性能が改善し silent expert collapseも防止することができた、という話のようである。

LLALの気持ちとしては、非常にSparseなMoEの学習では、浅い層を学習するためのpressureが小さいことが問題であることが前提のもと、これを解決するために、まず浅い層のexpert数を削減する、あるいは異なる学習率やweight decayをチューニングするなどの方法も検討している。しかしこれらの方法は結局ハイパーパラメータ探索の沼に学習をするたびにはまってしまい嬉しくない。そのため、よりgenericに適用可能な学習方法として、安定していて、モデルの本来の学習目的と整合していて、expertの差別化を促すような性質のものが求められ、これを満たすものとしてnext-token-predictionを活用することを提案している。
浅い層のexpertが何を学習することを求められるかというと、一般的にはlexical-levelな情報を学習していることを求められるが、現状ではSilnet Expert Deathによってこれがうまく進んでいないことが懸念される。これを是正するために、シンプルに浅いMoE LayerをLM headに接続し、next-token-predictionのlossをより直接供給することで学習を促す、という気持ちのようである。

image




Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #SyntheticData #Blog #SelfImprovement #Reading Reflections #Data #autoresearch/RSI #Author Thread-Post #AgentHarness #Creativity Issue Date: 2026-08-19 Comment

元ポスト:

Loading…

Data researchを自動的に実施することに特化したAgentHarness。端的に言うと、あるデータをキュレーション/合成し、decontaminationを実施した上でモデルを学習、評価、実験結果に基づいて改善を繰り返す。これによりClaude Codeを上回る性能を実現している。

image

興味深いのはClaude Codeと比較して、DataSmithを使うと2.6倍思考(reasoning tokenを生成)し、6.6倍のデータセットを試し、48.4倍のsubagent callを1回のsessionで実現する。そして、45倍のコードを記述し、1.8倍の研究アイデアを創出する。
image

decontaminationがどれだけ正確にできているかが鍵になりそうだなと思ったが、本ブログには具体的なアルゴリズムの記述はないように見えた。

が、以下のページには一言記載があり、どうならN-gramベースのmatchingでdecontaminationを実施しているようである。
https://www.datologyai.com/product?utm_source=chatgpt.com

- [Paper Note] Soft Contamination Means Benchmarks Test Shallow Generalization, Ari Spiesberger+, arXiv'26, 2026.02

で指摘されているように、表層ベースのマッチングアルゴリズムだけではSoft Contamination(意味的には重複しているが表層が異なるもの)は無くせない点で、limitationがあると考えられる(ただしこれは本ハーネスだけの問題というより評価全体の問題ではある)。




Paper/Blog Link My Issue
#Article #NLP #Search #LanguageModel #AIAgents #Blog #Author Thread-Post Issue Date: 2026-08-15 Comment

GPT 5.6 Sol, Opus 5と同等以上の性能をもち、10倍安く、12倍高速なsearch agentとのこと。技術的な詳細は書かれていないように見え、ベンチマークの話が記述されている。

元ポスト:

Loading…

Prime Intellectによるポスト:

Loading…


Prime Intellectを通じて学習されたということは、大規模なAgentic RLを大規模なEnvironmentに対して実行したことが示唆される。




Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Blog #MoE(Mixture-of-Experts) #reading #GPUKernel #Author Thread-Post Issue Date: 2026-08-15 Comment

元ポスト:

Loading…

4k--128kのコンテキストに対して最大2.4倍高速なMoE向けCUDAカーネル。メモリ書き出しのトラフィックを大幅に削減することで実現。

参考:
- CUDA Programming Guide Part 1, Kazuki Fujii, 2026.06




Paper/Blog Link My Issue
#Article #NLP #LanguageModel #OpenWeight #Selected Papers/Blogs Issue Date: 2026-08-15 Comment

GDPValでGPT-5.6-Sol, Fable5超え。ベンチマークスコアだけ見ると、フロンティアモデルにほぼ追いついたと言って良さそうに見える。残る砦はOpus 5

所見:

Loading…

所見:

Loading…


スケーリング則に関するLiterature、考察、GLM-5.3のその中での位置付けについて述べられている。ポスト中で言及されている Roberts et al. (2025)は以下

関連:
- [Paper Note] Compute Optimal Scaling of Skills: Knowledge vs Reasoning, Nicholas Roberts+, ACL'25 Findings, 2025.03
- Deconstructing Scaling Laws: The Triad of Optimization, Architecture, and Data, 苏剑林, 2026.07

weightが公開: https://huggingface.co/zai-org/GLM-5.3

Loading…




Paper/Blog Link My Issue
#Article #Tools #NLP #LanguageModel #AIAgents #Coding #SelfImprovement #SoftwareEngineering #Selected Papers/Blogs #Reading Reflections #Author Thread-Post #AgentHarness Issue Date: 2026-08-14 Comment

元ポスト:

Loading…


モデル、ツール、スキル、セッション、sandbox、ファイルシステム、ループ、オーケストレーション、UI、全てがPluginとして実装されたpluggableなハーネスとのこと。

元ポスト:

Loading…

高い拡張性を持つため、self-improveするハーネスと相性が良さそう。

所見:

Loading…




Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Proprietary #Selected Papers/Blogs #Author Thread-Post Issue Date: 2026-08-14 Comment

元ポスト:

Loading…

GPT-5.6-Sol, Fable5等のフロンティアモデルと同等のベンチマークスコア

CursorBench 3.2において、パレート最適:

Loading…

Model Card: https://media.x.ai/v1/website/card-4p6-4cd2dc57.pdf

1.5T級のモデルで、1.2節にモデル学習の概要が記述されているが、極めてgenericな内容である。他はベンチマークの評価結果やjailbreakに対する堅牢性などの話がメイン。




Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #SpeechProcessing #Japanese #TTS #train-inference-mismatch #Author Thread-Post Issue Date: 2026-08-09 Comment

元ポスト:

Loading…

以下記事を読んでおもしろかったポイントの要約

- 学習エンジン: FSDP + Transformer, 推論エンジン: vLLM
- LLMでのRLでは生成結果をルーブリックやReward Modelで評価できるが、音声の場合は音声トークン列だけを見ても評価できないため、波形へ複合し音声認識モデルで評価
- 報酬計算はTTS学習とは異なる依存関係が必要なので学習と報酬のサーバを分離することで柔軟性を高める
- 報酬にNLLを加えると、発話長が長くなる現象が発生し、Length Penaltyを加えることで改善される
- 実際の音声をきいてみると、発話がとても間延びしていて非常に興味深かった。
- 報酬設計と話者性の関係性を分析すると、Correct Error Rateによる報酬のみの場合は女性話者(のようにきこえる)割合が減り、+NLL, +Length Penaltyの場合は、女性話者(のようにきこえる)音声の割合が大幅に増加し、学習に何らかのバイアスが加わっている可能性が示唆された。
- これはCER, NLLの計算にWhisperを用いており、Whisperのベースモデルに対する音声合成結果において、女性話者の候補が報酬を得やすい状態であったことに起因することを分析(一般的なな女性音声において有利になっているわけではない)
- RLにおけるtrain-inference mismatchに関しても分析し
- FP16/BF16、エンジン(Transformer, vLLM)において、ミスマッチが存在し、エンジンよりも数値精度の変更の影響が大きく
- BF16にすると、FP16と比較して1位, 2位の出力候補のlogitが同値となる割合が増加し、音声トークンを生成するモデルのベースとなったLLMとlogitの同値率を比較すると、音声トークン生成の方が同値率が大幅に高い結果となった
- BF16/FP16の間の学習-生成の間での対数確率の差は、BF16の場合はFP16の約8倍となった(が、学習後のCERで見ると大きな差は生じなかった)。
- TTSモデルを評価する際には、モデルと音声コーデック符号化/復号の影響を分離して考える必要がある
- 人間がきいて同じ音声にきこえる場合でも、埋め込みを用いた類似度ではあまり高くないことがある

関連:
- Your Efficient RL Framework Secretly Brings You Off-Policy RL Training, Yao+, 2025.08
- [Paper Note] Defeating the Training-Inference Mismatch via FP16, Penghui Qi+, arXiv'25, 2025.10




Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Alignment #AIAgents #PostTraining #Rubric-based #Author Thread-Post Issue Date: 2026-08-09 Comment

元ポスト:

Loading…

Constitutional AIのようなルーブリックに基づいてモデルの振る舞いを調整する方法では、ルールの捉え方がモデルに応じて異なることで幅広い解釈が存在することが問題となることを指摘。モデル間での解釈を一致させるために、
- Interpretive Constraints: 法解釈の原理に基づいたPromptingによって、モデル側の解釈の裁量を制限し
- Iterative Refinement: 曖昧性のある記述をiterativeに洗練させる

ことによって緩和する。

関連:
- [Paper Note] Constitutional AI: Harmlessness from AI Feedback, Yuntao Bai+, arXiv'22




Paper/Blog Link My Issue
#Article #ComputerVision #NLP #LanguageModel #OpenWeight #VisionLanguageModel #UMM #Author Thread-Post Issue Date: 2026-08-09 Comment

HF: https://huggingface.co/thinkingmachines/Inkling-Small

関連:
- Inkling: Our open-weights model, THINKING MACHINES, 2026.07

- 276B-A12B
- NVFP4
- 小規模なモデルだが、Inklingと同等以上の性能を達成(ただし、一般的な知識や事実性に関してはInklingの方が上)
- 事前学習データのDataMixtureや学習レシピにいくつかの改良
- Inklingを教師モデルとしたOPD
- codingに特化したagentic RLをスケールアップ

元ポスト:

Loading…




Paper/Blog Link My Issue
#Article #Pretraining #NLP #LanguageModel #Blog #ResidualStream #LowPrecision #Author Thread-Post Issue Date: 2026-08-09 Comment

元ポスト:

Loading…

残差ストリームの精度はbf16で保存されるのが一般的で、70層以上の大きなモデルの場合、140回の累積演算を行うため、フル精度を保たないと誤差が蓄積し、学習に影響を与える可能性がある。実際に、bf16, fp32での残差ストリームのフル精度との差分や符号の反転を比較すると、fp32よりもbf16の方が誤差や符号反転の回数が、layerが深くなるにつれ顕著に大きくなった。

しかし、実際に3種類の幅・高さのバリエーションを持ったLlama3 1Bのバリエーションに対して、fp32、bf16の2種類の精度(つまり合計6種類のモデル・精度)で、FineWebから0.1Tトークンをバッチサイズ0.5M tokenで事前学習したところ、loss, downstreamタスクの性能共にほとんど差が見受けられなかった(唯一winograndeだけは差があった)、といった実験結果が記載されている。

筆者も示唆している通り、モデルのサイズや事前学習の学習トークン数の規模感が小さいので、より大きくしたら何か差は生まれるのだろうか。




Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Selected Papers/Blogs #Compression #Reading Reflections #Author Thread-Post #AgentHarness Issue Date: 2026-08-08 Comment

元ポスト:

Loading…

ARC-AGI-3のベンチマークを測定する際に、ARC-AGI-3が提供いているオフィシャルのシンプルなハーネスではなく、Response APIで実施されているような reasoningの保持と圧縮をするようなハーネスに変更したら、スコアが3倍以上になったよ、という話のようである。

それはそう、という感じではあるのだが、シンプルなハーネスでそのモデルが持つ強みを発揮しきれないのであれば、公平な比較になっていないよね?という話でもある。モデルの能力を測定するための変数が増えすぎて、公平な比較をするのがどんどん難しくなってきている。




Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #MultiLingual #OpenWeight #Selected Papers/Blogs #Encoder #Reading Reflections #Author Thread-Post Issue Date: 2026-08-06 Comment

元ポスト:

Loading…

CPUでのinferenceにおいて、ModernBERTよりもlong context (8k付近)でのスループットが3.3倍高いEncoder。context長は8192。

HF: https://huggingface.co/LiquidAI/LFM2.5-Encoder-350M

日本語にも対応しているようだが、日本語ModernBertなどと比較して日本語でこのダウンストリームタスクの性能はどうなるだろうか




Paper/Blog Link My Issue
#Article #Analysis #NLP #LanguageModel #AIAgents #GenerativeAI #Blog #Reading Reflections #Author Thread-Post Issue Date: 2026-08-05 Comment

元ポスト:

Loading…

ChatGPTに送られるメッセージと、ユーザの職種に基づいて、特定の職種の人間が、自身の職種外のタスクに関するクエリをどれだけChatGPTに送付しているかを分析。これにより、職種外のタスクが多く投げられていることが定量的に示され、タスクの分担範囲がシフトしてきていることが分析されている。職種によって、度合いが異なり、たとえばカスタマーエクスペリエンスでは、職種固有のメッセージ(汎用的なメッセージではなくその職種特有のもの)のうち77%職種外タスクに関するもので、エンジニアの場合は28%であったりするのは興味深い。

このブログの分析対象はChatGPTだけだと思うが、生成AIを用いたSaaS系のサービスまで含めたら、かなり元々のスコープを広げて色々なことに取り組んでいる人はいるのではなかろうか?




Paper/Blog Link My Issue
#Article #ComputerVision #NLP #Dataset #Evaluation #Selected Papers/Blogs #VisionLanguageModel Issue Date: 2026-08-05 Comment

元ポスト:

Loading…

Vision系の新たなベンチマーク。42種類のベンチマークのフロンティアモデルが失敗する事例に基づいて評価対象とするatomicな能力を定義し、それらのatomicなスキルを独立して評価可能なサンプルを作成し評価するベンチマーク。サンプルは与えられた情報のみから、評価対象とするatomicな能力を駆使すれば成功できるverifiableなタスクとして定義されているようである。能力ごとにモデルのスコアが算出可能。

実例としては、たとえば、魚が泳いでいる複数の池のイラストが与えられて、真ん中の池には何匹の魚がいる?といったクエリに応答するなどである。これには localization の能力が求められる(Countingも必要な気がするが)。




Paper/Blog Link My Issue
#Article #NLP #LanguageModel #OpenWeight Issue Date: 2026-08-04 Comment

元ポスト:

Loading…

アーキテクチャ解説:

Loading…

所見:

Loading…


DeepSeek-V4 Pro, MiniMax M3等のモデルと同等程度のスコアの314B-A13Bモデル。
Grouped Differential Latent Attention (GDLA), Grouped PolyNorm activation と呼ばれる(おそらく本モデル独自の)技術を利用している。




Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Blog #Author Thread-Post Issue Date: 2026-08-04 Comment

元ポスト:

Loading…

GEPA, AutoResearch, MetaHarnessなどのLLMベースの最適化アルゴリズムを適用した時に、タスクの性能を平均すると特定のアルゴリズムが強いが、個々のインスタンスレベルで見ると必ずしも特定のアルゴリズムが支配的とはならないこと、および、あるアルゴリズムで性能向上がサチったインスタンスも、異なるアルゴリズム、初期化した同じアルゴリズムを継続的に適用することで、異なるアプローチが探索されさらなる性能向上が見込める、という2つの洞察から、

Phase1
固定された予算の元、タスクに対して様々なLLMベースの最適化アルゴリズムをまず走らせ候補を作成。その中から最も良い候補を選び、

Phase2
初期化した最適化アルゴリズムで継続的に最適化することで、単一の最適化アルゴリズムを用いた場合よりも性能が改善

このようなパイプラインを実現するmeta optimiser-omniを実装している。

関連:
- [Paper Note] GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning, Lakshya A Agrawal+, ICLR'26, 2025.07
- [Paper Note] Meta-Harness: End-to-End Optimization of Model Harnesses, Yoonho Lee+, arXiv'26, 2026.03
- autoresearch, karpathy, 2026.03




Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Evaluation #Selected Papers/Blogs #reading #Author Thread-Post Issue Date: 2026-08-03 Comment

元ポスト:

Loading…

費用対効果を人間とAI Agentそれぞれでplotすることで、人間とAI Agentが同じ支出で出せるパフォーマンスを出せる点(expenditure horizon)を見つけるというのがアイデアで、これにより低予算下ではAIの方が効果的で、高予算下では人間の方が効果的といった分析が可能となる。

nanogpt speedrunを通じた分析結果なども載っている。




Paper/Blog Link My Issue
#Article #Embeddings #InformationRetrieval #NLP #LanguageModel #RepresentationLearning #RAG(RetrievalAugmentedGeneration) #MultiLingual #OpenWeight #Selected Papers/Blogs Issue Date: 2026-07-31 Comment

元ポスト:

Loading…

HF: https://huggingface.co/collections/nvidia/nemotron-3-embed

LLMベースのretrieval, STSタスク特化のembeddingモデルで、最大32k contextをサポート。多言語対応している。

RTEB Multilingualと呼ばれるベンチマークでSoTA:
https://mteb-leaderboard.hf.space/benchmark/RTEB(beta)

- Introducing RTEB: A New Standard for Retrieval Evaluation, Liu+, 2025.10

解説:

Loading…


Autoregressiveなモデルをbidirectionalなattentionに変換した上で、contrastive learning+高品質データでFinutuning。小規模モデルの作成には、pruning, NAS, 蒸留を2回繰り返すことで実現。




Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #LanguageModel #DiffusionModel #Blog #Proprietary #read-later #Author Thread-Post Issue Date: 2026-07-25 Comment

元ポスト:

Loading…

アーキテクチャとしてdLLMを採用したGPT-5-miniと同等程度の性能のモデルで、GPT-5-miniに対して15倍程度(1280TPS)のスループットを実現しているとのこと。

Artificial Analysisによるoutput speed評価で1位:

Loading…




Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Proprietary #Selected Papers/Blogs #VisionLanguageModel #Author Thread-Post Issue Date: 2026-07-25 Comment

元ポスト:

Loading…

coding, knowledge workでのベンチマークスコアはFable5超えで、コストはFable5のおよそ半分

いよいよベンチマークではClaude一強という感じになってきた:

Loading…

Fable5のPromptingに関する話:
- A Field Guide to Fable: Finding Your Unknowns, Claude, 2026.07

Context Engineeringの話:
- The new rules of context engineering for Claude 5 models, Thariq, 2026.07

脆弱性を検知する能力が高い:

Loading…




Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #DiffusionModel #MoE(Mixture-of-Experts) #read-later #Selected Papers/Blogs Issue Date: 2026-07-25 Comment

HF: https://huggingface.co/inclusionAI/LLaDA2.2-flash

元ポスト:

Loading…

LLaDA2.2シリーズとして初めてのAgent指向なdLLMとのこと。MoEアーキテクチャ採用。ベンチマークスコアはARモデルよりも少し劣る面があるが、スループットは1.64倍。




Paper/Blog Link My Issue
#Article #Pretraining #NLP #Dataset #LanguageModel #Blog #Coding #Selected Papers/Blogs #reading #Author Thread-Post Issue Date: 2026-07-24 Comment

元ポスト:

Loading…

114 TB, 770言語, 224Mリポジトリ, 約5Tトークンの重複除去やフィルタリング済みGithubから収集されたソースコードで、制限付きライセンスのコードは一切含まないデータセット。V2では2023年時点のスナップショットに基づいており、V3は2025年8月時点までのスナップショットとのこと。たとてば、C++は15倍、TypeScript は7.5倍、Rustは7倍、Pythonは4.8倍程度のトークンがあるらしい。全体としては8.9倍のトークン量。

また、V2ではdeduplicationにおいて正規表現にバグがあったようで、そちらも修正されているようである。

Stack V2:
- [Paper Note] StarCoder 2 and The Stack v2: The Next Generation, Anton Lozhkov+, arXiv'24

所見:

Loading…




Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Evaluation #Blog #Selected Papers/Blogs #Live #reading #Author Thread-Post Issue Date: 2026-07-24 Comment

元ポスト:

Loading…

Terminal Benchを構築したチームによる新たなベンチマークで、GPT-5.6-Sol (Codex) でもスコアは34.4%。タスクは今後も更新される。

タスクは、ソフトウェア、ML、科学、オペレーション、セキュリティ、ハードウェア、メディアなどのドメインによって構成されるようである。

Terminal Bench:
- [Paper Note] Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces, Mike A. Merrill+, arXiv'26, 2026.01




Paper/Blog Link My Issue
#Article #Tools #NLP #LanguageModel #ReinforcementLearning #AIAgents #PostTraining #TrainingFramework Issue Date: 2026-07-19 Comment

元ポスト:

Loading…

ハイパフォーマンス、かつminimalな実装のRLライブラリで、研究用のハックがしやすいフレームワーク。verlの1/9, Slimeの1/3の行数で実現されているとのこと。

verl:
- verl: Volcano Engine Reinforcement Learning for LLMs, ByteDance Seed Team, 2025.04

Slime:
- slime, THUDM & Zhihu, 2025.09




Paper/Blog Link My Issue
#Article #NLP #AIAgents #OpenWeight #Safety #Security #Safeguard Issue Date: 2026-07-19 Comment

元ポスト:

Loading…

AI Agent向けのガードレールで、モデルの安全性からランタイムの安全性を指向して開発されている。エージェントのアクション実行前に、attackを検知し防御するなどの用途に使われる。