Selected Papers/Blogs (1247) — 5/7
[Paper Note] Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks, Patrick Lewis+, N_A, NeurIPS'20
Paper/Blog Link My Issue
#InformationRetrieval #NLP #LanguageModel #RAG(RetrievalAugmentedGeneration) #NeurIPS #Encoder-Decoder #ContextEngineering Issue Date: 2023-12-01 GPT Summary- 大規模な事前学習言語モデルを使用した検索強化生成(RAG)の微調整手法を提案しました。RAGモデルは、パラメトリックメモリと非パラメトリックメモリを組み合わせた言語生成モデルであり、幅広い知識集約的な自然言語処理タスクで最先端の性能を発揮しました。特に、QAタスクでは他のモデルを上回り、言語生成タスクでは具体的で多様な言語を生成することができました。 Comment
RAGを提案した研究
Retrieverとして利用されているDense Passage Retrieval (DPR)はこちら:
- [Paper Note] Dense Passage Retrieval for Open-Domain Question Answering, Vladimir Karpukhin+, EMNLP'20, 2020.04
所見:
[Paper Note] Measuring Massive Multitask Language Understanding, Dan Hendrycks+, arXiv'20, 2020.09
Paper/Blog Link My Issue
#NLP #Dataset #LanguageModel #Evaluation #ICLR #One-Line Notes #needs-revision Issue Date: 2023-07-24 GPT Summary- 新しいテストを提案し、57のマルチタスクを用いてテキストモデルの正確度を測定。高い正確度には広範な世界知識と問題解決能力が必要である。GPT-3モデルはランダム推測を約20ポイント上回るが、専門家レベルには遠く、多くのタスクで偏った性能を示す。特に道徳や法に関してはほぼランダムに近い正確度を記録。このテストはモデルの理解力を評価し、重要な欠点を明らかにすることを目的とする。 Comment
OpenReview: https://openreview.net/forum?id=d7KBjmI3GmQ
MMLU論文
- [Paper Note] Are We Done with MMLU?, Aryo Pradipta Gema+, NAACL'25
において、多くのエラーが含まれることが指摘され、再アノテーションが実施されている。
[Paper Note] Language Models are Few-Shot Learners, Tom B. Brown+, NeurIPS'20, 2020.05
Paper/Blog Link My Issue
#NeuralNetwork #NLP #LanguageModel #Zero/Few/ManyShotPrompting #In-ContextLearning #NeurIPS Issue Date: 2023-04-27 GPT Summary- GPT-3は1750億パラメータの自己回帰型モデルで、タスク非依存のFew-shot学習を改善。ファインチューニングなしで多様なNLPタスクで高い性能を示し、人間と区別しにくい文を生成可能。訓練の課題も明らかに。 Comment
In-Context Learningを提案した論文
論文に記載されているIn-Context Learningの定義は、しっかり押さえておいた方が良い。
下図はmeta-learningの観点から見たときの、in-contextの位置付け。事前学習時にSGDでパラメータをupdateするのをouter loopとし、そこで広いスキルとパターン認識の能力を身につける。一方で、in-context learningは、Inference時に事前学習時に得たそれらのスキルを用いて、求めるタスクを認識、あるいは適応するInner loopのことを指す。
この上で、論文中では In-Context Learningについて:
> Recent work [RWC+19] attempts to do this via what we call “in-context learning”, using the text input of a pretrained language model as a form of task specification: the model is conditioned on a natural language instruction and/or a few demonstrations of the task and is then expected to complete further instances of the task simply by predicting what comes next.
と定義している。
[Paper Note] Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism, Mohammad Shoeybi+, arXiv'19, 2019.09
Paper/Blog Link My Issue
#Pretraining #Tools #NLP #LanguageModel #Supervised-FineTuning (SFT) #ReinforcementLearning #PostTraining #Parallelism #One-Line Notes #DistributedLearning #TrainingFramework Issue Date: 2026-09-29 GPT Summary- 大規模Transformerモデルを学習するため、ネイティブPyTorchに少数の通信操作を追加する層内モデル並列化手法を提案。パイプライン型並列化と併用可能で、512 GPU上で最大83億パラメータのモデルを学習し、15.1ペタFLOPSと76%のスケーリング効率を達成。GPT-2型・BERT型モデルで既存のSOTAを上回り、WikiText103、LAMBADA、RACEで高い性能を実現。 Comment
Megatron-LMがメモされていなかったので追加。代表的なLLM・マルチモーダルモデル学習のためのフレームワーク
事前学習、継続事前学習だけでなく
- Swallow: LLaMA-2 日本語継続事前学習モデル, Kazuki Fujii, 2023.12
以下のような事後学習フレームワークのバックエンドとしても利用される:
- Nemo-RL, Nvidia, 2025.05
- verl: Volcano Engine Reinforcement Learning for LLMs, ByteDance Seed Team, 2025.04
- slime, THUDM & Zhihu, 2025.09
- ms-swiftによるMegatron-LMベースのQwen3のファインチューニング, Aratako, 2025.05
[Paper Note] CTRL: A Conditional Transformer Language Model for Controllable Generation, Nitish Shirish Keskar+, arXiv'19, 2019.09
Paper/Blog Link My Issue
#NaturalLanguageGeneration #Controllable #NLP #LanguageModel #Transformer #Decoder Issue Date: 2026-01-16 GPT Summary- CTRLは、スタイルや内容、タスク特有の振る舞いを制御するコードに基づいて訓練された条件付きトランスフォーマー言語モデルで、1.63億パラメータを持つ。このモデルは、無監督学習の利点を生かしつつ、テキスト生成に対する明示的な制御を提供。CTRLは与えられたシーケンスに基づいて最も可能性のあるトレーニングデータを予測でき、データ分析の新たなアプローチを提示する。また、複数の事前訓練済みバージョンが公開されている。 Comment
Control Code(いわゆるタグ)によって条件付けることで生成されるテキストのスタイルや内容等をcontrollableにする研究の先駆け
[Paper Note] Generating Long Sequences with Sparse Transformers, Rewon Child+, arXiv'19, 2019.04
Paper/Blog Link My Issue
#ComputerVision #Transformer #LongContext #One-Line Notes #SparseAttention Issue Date: 2025-11-30 GPT Summary- スパース因子分解を用いてトランスフォーマーの注意行列を$O(n \sqrt{n})$に削減し、深いネットワークの訓練やメモリ節約のための手法を導入。スパーストランスフォーマーは数百層で数万タイムステップのシーケンスをモデル化し、Enwik8、CIFAR-10、ImageNet-64で新たな最先端を達成。自己注意を用いて100万以上の長さのシーケンスをモデル化する可能性を示す。 Comment
Sparse Attentionの概念を提案した研究。以下Surveyより
- [Paper Note] Generating Long Sequences with Sparse Transformers, Rewon Child+, arXiv'19, 2019.04
[Paper Note] Universal Transformers, Mostafa Dehghani+, ICLR'19
Paper/Blog Link My Issue
#NLP #Transformer #Architecture #ICLR #Generalization #LatentReasoning #RecurrentModels Issue Date: 2025-08-30 GPT Summary- 再帰神経ネットワーク(RNN)は逐次処理によりシーケンスモデリングで広く使われてきたが、トレーニングが遅くなる欠点がある。最近のフィードフォワードや畳み込みアーキテクチャは並列処理が可能で優れた結果を出しているが、RNNが得意とする単純なタスクでの一般化には失敗する。そこで、我々はユニバーサル・トランスフォーマー(UT)を提案し、フィードフォワードの並列処理能力とRNNの帰納バイアスを組み合わせたモデルを開発した。UTは特定の条件下でチューリング完全であり、実験では標準的なトランスフォーマーを上回る性能を示し、特にLAMBADAタスクで新たな最先端を達成し、機械翻訳でもBLEUスコアを改善した。 Comment
openreview: https://openreview.net/forum?id=HyzdRiR9Y7
[Paper Note] EfficientNet: Rethinking Model Scaling for Convolutional Neural Networks, Mingxing Tan+, ICML'19
Paper/Blog Link My Issue
#NeuralNetwork #ComputerVision #EfficiencyImprovement #ICML #Backbone Issue Date: 2025-05-12 GPT Summary- 本論文では、ConvNetsのスケーリングを深さ、幅、解像度のバランスを考慮して体系的に研究し、新しいスケーリング手法を提案。これにより、MobileNetsやResNetのスケールアップを実証し、EfficientNetsという新しいモデルファミリーを設計。特にEfficientNet-B7は、ImageNetで84.3%のトップ1精度を達成し、従来のConvNetsよりも小型かつ高速である。CIFAR-100やFlowersなどのデータセットでも最先端の精度を記録。ソースコードは公開されている。 Comment
元論文をメモってなかったので追加。
- EfficientNet解説, omiita (オミータ), 2019.10
も参照のこと。
[Paper Note] BERTScore: Evaluating Text Generation with BERT, Tianyi Zhang+, arXiv'19, 2019.04
Paper/Blog Link My Issue
#DocumentSummarization #NaturalLanguageGeneration #Metrics #NLP #Evaluation #Reference-based #Surface-level Notes #needs-revision Issue Date: 2023-05-10 GPT Summary- BERTScoreは、テキスト生成の自動評価指標で、候補文のトークンと参照文のトークン間の類似度を文脈埋め込みを使用して計算。363の機械翻訳と画像キャプション生成システムを評価し、人間の判断と高い相関を示し、モデル選択性能を向上。敵対的パラフレーズ検出タスクでも、既存の指標と比較して堅牢性が確認された。 Comment
# 概要
既存のテキスト生成の評価手法(BLEUやMETEOR)はsurface levelのマッチングしかしておらず、意味をとらえられた評価になっていなかったので、pretrained BERTのembeddingを用いてsimilarityを測るような指標を提案しましたよ、という話。
# prior metrics
## n-gram matching approaches
n-gramがreferenceとcandidateでどれだけ重複しているかでPrecisionとrecallを測定
### BLEU
MTで最も利用される。n-gramのPrecision(典型的にはn=1,2,3,4)と短すぎる候補訳にはペナルティを与える(brevity penalty)ことで実現される指標。SENT-BLEUといった亜種もある。BLEUと比較して、BERTScoreは、n-gramの長さの制約を受けず、潜在的には長さの制限がないdependencyをcontextualized embeddingsでとらえることができる。
### METEOR
METEOR: An Automatic Metric for MT Evaluation with Improved Correlation with Human Judgments, Banerjee+, CMU, ACL Workshop on Intrinsic and Extrinsic Evaluation Measures for Machine Translation and/or Summarization
METEOR 1.5では、内容語と機能語に異なるweightを割り当て、マッチングタイプによってもweightを変更する。METEOR++2.0では、学習済みの外部のparaphrase resourceを活用する。METEORは外部のリソースを必要とするため、たった5つの言語でしかfull feature setではサポートされていない。11の言語では、恥部のfeatureがサポートされている。METEORと同様に、BERTScoreでも、マッチに緩和を入れていることに相当するが、BERTの事前学習済みのembeddingは104の言語で取得可能である。BERTScoreはまた、重要度によるweightingをサポートしている(コーパスの統計量で推定)。
### Other Related Metrics
- NIST: BLEUとは異なるn-gramの重みづけと、brevity penaltyを利用する
- ΔBLEU: multi-reference BLEUを、人手でアノテーションされたnegative reference sentenceで変更する
- CHRF: 文字n-gramを比較する
- CHRF++: CHRFをword-bigram matchingに拡張したもの
- ROUGE: 文書要約で利用される指標。ROUGE-N, ROUGE^Lといった様々な変種がある。
- CIDEr: image captioningのmetricであり、n-gramのtf-idfで重みづけされたベクトルのcosine similrityを測定する
## Edit-distance based Metrics
- Word Error Rate (WER): candidateからreferenceを再現するまでに必要なedit operationの数をカウントする手法
- Translation Edit Rate (TER): referenceの単語数によってcandidateからreferenceまでのedit distanceを正規化する手法
- ITER: 語幹のマッチと、より良い正規化に基づく手法
- PER: positionとは独立したError Rateを算出
- CDER: edit operationにおけるblock reorderingをモデル化
- CHARACTER / EED: character levelで評価
## Embedding-based Metrics
- MEANT 2.0: lexical, structuralの類似度を測るために、word embeddingとshallow semantic parsesを利用
- YISI-1: MEANT 2.0と同様だが、semantic parseの利用がoptionalとなっている
これらはBERTScoreと同様の、similarityをシンプルに測るアプローチで、BERTScoreもこれにinspireされている。が、BERTScoreはContextualized Embeddingを利用する点が異なる。また、linguistic structureを生成するような外部ツールは利用しない。これにより、BERTScoreをシンプルで、新たなlanguageに対しても使いやすくしている。greedy matchingの代わりに、WMD, WMDo, SMSはearth mover's distanceに基づく最適なマッチングを利用することを提案している。greedy matchingとoptimal matchingのtradeoffについては研究されている。sentence-levelのsimilarityを計算する手法も提案されている。これらと比較して、BERTScoreのtoken-levelの計算は、重要度に応じて、tokenに対して異なる重みづけをすることができる。
## Learned Metrics
様々なmetricが、human judgmentsとのcorrelationに最適化するために訓練されてきた。
- BEER: character-ngram, word bigramに基づいたregresison modelを利用
- BLEND: 29の既存のmetricを利用してregressionを実施
- RUSE: 3種類のpre-trained sentence embedding modelを利用する手法
これらすべての手法は、コストのかかるhuman judgmentsによるsupervisionが必要となる。そして、新たなドメインにおける汎化能力の低さのリスクがある。input textが人間が生成したものか否か予測するneural modelを訓練する手法もある。このアプローチは特定のデータに対して最適化されているため、新たなデータに対して汎化されないリスクを持っている。これらと比較して、BERTScoreは特定のevaluation taskに最適化されているモデルではない。
# BERTScore
referenceとcandidateのトークン間のsimilarityの最大値をとり、それらを集約することで、Precision, Recallを定義し、PrecisionとRecallを利用してF値も計算する。Recallは、reference中のすべてのトークンに対して、candidate中のトークンとのcosine similarityの最大値を測る。一方、Precisionは、candidate中のすべてのトークンに対して、reference中のトークンとのcosine similarityの最大値を測る。ここで、類似度の式が単なる内積になっているが、これはpre-normalized vectorを利用する前提であり、正規化が必要ないからである。
また、IDFによるトークン単位でのweightingを実施する。IDFはテストセットの値を利用する。TFを使わない理由は、BERTScoreはsentence同士を比較する指標であるため、TFは基本的に1となりやすい傾向にあるためである。IDFを計算する際は出現数を+1することによるスムージングを実施。
さらに、これはBERTScoreのランキング能力には影響を与えないが、BERTScoreの値はコサイン類似度に基づいているため、[-1, 1]となるが、実際は学習したcontextual embeddingのgeometryに値域が依存するため、もっと小さなレンジでの値をとることになってしまう。そうすると、人間による解釈が難しくなる(たとえば、極端な話、スコアの0.1程度の変化がめちゃめちゃ大きな変化になってしまうなど)ため、rescalingを実施。rescalingする際は、monolingualコーパスから、ランダムにsentenceのペアを作成し(BETRScoreが非常に小さくなるケース)、これらのBERTScoreを平均することでbを算出し、bを利用してrescalingした。典型的には、rescaling後は典型的には[0, 1]の範囲でBERTScoreは値をとる(ただし数式を見てわかる通り[0, 1]となることが保証されているわけではない点に注意)。これはhuman judgmentsとのcorrelationとランキング性能に影響を与えない(スケールを変えているだけなので)。
# 実験
## Contextual Embedding Models
12種類のモデルで検証。BERT, RoBERTa, XLNet, XLMなど。
## Machine Translation
WMT18のmetric evaluation datasetを利用。149種類のMTシステムの14 languageに対する翻訳結果, gold referencesと2種類のhuman judgment scoreが付与されている。segment-level human judgmentsは、それぞれのreference-candiate pairに対して付与されており、system-level human judgmentsは、それぞれのシステムに対して、test set全体のデータに基づいて、単一のスコアが付与されている。pearson correlationの絶対値と、kendall rank correration τをmetricsの品質の評価に利用。そしてpeason correlationについてはWilliams test、kendall τについては、bootstrap re-samplingによって有意差を検定した。システムレベルのスコアをBERTScoreをすべてのreference-candidate pairに対するスコアをaveragingすることによって求めた。また、ハイブリッドシステムについても実験をした。具体的には、それぞれのreference sentenceについて、システムの中からランダムにcandidate sentenceをサンプリングした。これにより、system-level experimentをより多くのシステムで実現することができる。ハイブリッドシステムのシステムレ4ベルのhuman judgmentsは、WMT18のsegment-level human judgmentsを平均することによって作成した。BERTScoreを既存のメトリックと比較した。
通常の評価に加えて、モデル選択についても実験した。10kのハイブリッドシステムを利用し、10kのうち100をランダムに選択、そして自動性能指標でそれらをランキングした。このプロセスを100K回繰り返し、human rankingとmetricのランキングがどれだけagreementがあるかをHits@1で評価した(best systemの一致で評価)。モデル選択の指標として新たにtop metric-rated systemとhuman rankingの間でのMRR, 人手評価でtop-rated systemとなったシステムとのスコアの差を算出した。WMT17, 16のデータセットでも同様の評価を実施した。
## Image Captioning
COCO 2015 captioning challengeにおける12種類のシステムのsubmissionデータを利用。COCO validationセットに対して、それぞれのシステムはimageに対するcaptionを生成し、それぞれのimageはおよそ5個のreferenceを持っている。先行研究にならい、Person Correlationを2種類のシステムレベルmetricで測定した。
- M1: 人間によるcaptionと同等、あるいはそれ以上と評価されたcaptionの割合
- M2: 人間によるcaptionと区別がつかないcaptionの割合
BERTScoreをmultiple referenceに対して計算し、最も高いスコアを採用した。比較対象のmetricはtask-agnostic metricを採用し、BLEU, METEOR, CIDEr, BEER, EED, CHRF++, CHARACTERと比較した。そして、2種類のtask-specific metricsとも比較した:SPICE, LEIC
# 実験結果
## Machine Translation
system-levelのhuman judgmentsとのcorrelationの比較、hybrid systemとのcorrelationの比較、model selection performance
to-Englishの結果では、BERTScoreが最も一貫して性能が良かった。RUSEがcompetitiveな性能を示したが、RUSEはsupervised methodである。from-Englishの実験では、RUSEは追加のデータと訓練をしないと適用できない。
以下は、segment-levelのcorrelationを示したものである。BERTScoreが一貫して高い性能を示している。BLEUから大幅な性能アップを示しており、特定のexampleについての良さを検証するためには、BERTScoreが最適であることが分かる。BERTScoreは、RUSEをsignificantlyに上回っている。idfによる重要度のweightingによって、全体としては、small benefitがある場合があるが全体としてはあんまり効果がなかった。importance weightingは今後の課題であり、テキストやドメインに依存すると考えられる。FBERTが異なる設定でも良く機能することが分かる。異なるcontextual embedding model間での比較などは、appendixに示す。
## Image Captioning
task-agnostic metricの間では、BETRScoreはlarge marginで勝っている。image captioningはchallengingな評価なので、n-gramマッチに基づくBLEU, ROUGEはまったく機能していない。また、idf weightingがこのタスクでは非常に高い性能を示した。これは人間がcontent wordsに対して、より高い重要度を置いていることがわかる。最後に、LEICはtrained metricであり、COCO dataに最適化されている。この手法は、ほかのすべてのmetricを上回った。
## Speed
pre-trained modelを利用しているにもかかわらず、BERTScoreは比較的高速に動作する。192.5 candidate-reference pairs/secondくらい出る(GTX-1080Ti GPUで)。WMT18データでは、15.6秒で処理が終わり、SacreBLEUでは5.4秒である。計算コストそんなにないので、BERTScoreはstoppingのvalidationとかにも使える。
# Robustness analysis
BERTScoreのロバスト性をadversarial paraphrase classificationでテスト。Quora Question Pair corpus (QQP) を利用し、Word Scrambling dataset (PAWS) からParaphrase Adversariesを取得。どちらのデータも、各sentenceペアに対して、それらがparaphraseかどうかラベル付けされている。QQPの正例は、実際のduplicate questionからきており、負例は関連するが、異なる質問からきている。PAWSのsentence pairsは単語の入れ替えに基づいているものである。たとえば、"Flights from New York to Florida" は "Flights from Florida to New York" のように変換され、良いclassifierはこれらがparaphraseではないと認識できなければならない。PAWSはPAWS_QQPとPAWS_WIKIによって構成さえrており、PAWS_QQPをdevelpoment setとした。automatic metricsでは、paraphrase detection training dataは利用しないようにした。自動性能指標で高いスコアを獲得するものは、paraphraseであることを想定している。
下図はAUCのROC curveを表しており、PAWS_QQPにおいて、QQPで訓練されたclassifierはrandom guessよりも性能が低くなることが分かった。つまりこれらモデルはadversaial exampleをparaphraseだと予測してしまっていることになる。adversarial examplesがtrainingデータで与えられた場合は、supervisedなモデルも分類ができるようになる。が、QQPと比べると性能は落ちる。多くのmetricsでは、QQP ではまともなパフォーマンスを示すが、PAWS_QQP では大幅なパフォーマンスの低下を示し、ほぼrandomと同等のパフォーマンスとなる。これは、これらの指標がより困難なadversarial exampleを区別できないことを示唆している。一方、BERTSCORE のパフォーマンスはわずかに低下するだけであり、他の指標よりもロバスト性が高いことがわかる。
# Discussion
- BERTScoreの単一の設定が、ほかのすべての指標を明確に上回るということはない
- ドメインや言語を考慮して、指標や設定を選択すべき
- 一般的に、機械翻訳の評価にはFBERTを利用することを推奨
- 英語のテキスト生成の評価には、24層のRoBERTa largeモデルを使用して、BERTScoreを計算したほうが良い
- 非英語言語については、多言語のBERT_multiが良い選択肢だが、このモデルで計算されたBERTScoreは、low resource languageにおいて、パフォーマンスが安定しているとは言えない
[Paper Note] Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks, Nils Reimers+, arXiv'19, 2019.08
Paper/Blog Link My Issue
#NeuralNetwork #NLP #Library #RepresentationLearning #EMNLP #Encoder #One-Line Notes Issue Date: 2022-07-29 GPT Summary- BERTとRoBERTaは文ペア回帰タスクで優れた性能を示す一方で、計算負荷が高いため意味的類似度検索には適していない。本研究では、コサイン類似度を用いた文の埋め込みを得るために、シアミーズネットワークとトリプレットネットワークを用いたSentence-BERT(SBERT)を提案。これにより、類似ペアの検索時間が65時間から約5秒に短縮され、精度はBERTに匹敵。SBERTは一般的なSTSタスクや転移学習タスクで最先端の性能を示した。 Comment
BERTでトークンをembeddingし、mean poolingすることで生成される文ベクトルを、Siamese Networkを使い距離学習(finetune)させたモデル。
文/文章のベクトルを事前学習済みのモデルを使って簡単に求められる。
モデルの一覧は下記:
https://www.sbert.net/docs/pretrained_models.html
[Paper Note] Are We Really Making Much Progress? A Worrying Analysis of Recent Neural Recommendation Approaches, Maurizio Ferrari Dacrema+, RecSys'19, 2019.07
Paper/Blog Link My Issue
#RecommenderSystems #NeuralNetwork #CollaborativeFiltering #Evaluation #RecSys #Reproducibility #KeyPoint Notes #Reading Reflections Issue Date: 2022-04-11 GPT Summary- 深層学習技術はレコメンダーシステムの研究で広く用いられているが、再現性やベースライン選択に問題がある。18のトップnレコメンデーションアルゴリズムを分析した結果、再現できたのは7つのみで、6つは単純なヒューリスティック手法に劣っていた。残りの1つはベースラインを上回ったが、非ニューラル手法には及ばなかった。本研究は機械学習の実践における問題を指摘し、改善を呼びかけている。 Comment
RecSys'19のベストペーパー
日本語解説:
https://qiita.com/smochi/items/98dbd9429c15898c5dc7
TopN推薦におけるDNNを用いた研究を追試した研究で、トップ会議の手法のうち18本の追試を試みたところ、追試のための現実的な努力や著者に連絡をするといったことを実施した上で再現できたものは7本であり、そのうち6/7が適切なハイパーパラメータ調整を行なったkNNベースのシンプルな手法に勝てなかった(かつ残りの一つも線形モデルに対して負ける場合もあった)、という話で、業界における評価における再現性の問題(ハイパーパラメータ調整の記載がない等)や、適切な実験設定の欠如(ベースラインのハイパーパラメータチューニングをせずに先行研究の記述内容をそのまま踏襲等、テストデータを用いたエポック数の調整、ランダムサンプリングのはずなのに明らかに提案手法に有利となるような偏ったサンプリングを実施...)、ベースラインの適切な選定(多くの研究がNeural Collaboraive Filteringをベースラインにしているが果たしてそれが適切か)などについて警鐘を鳴らす内容になっている。
過去の先行研究([Paper Note] Sequence-Aware Recommender Systems, Massimo Quadrana+, ACM Computing Surveys (CSUR), Volume 51, Issue 4, 2018.02
)でも、研究者の間でデータセットの分割に関して、標準化されていない旨が記述されている。また、管理人が研究を追う中でも、共通のフレームワークで評価がされているとは言い難い印象を持っている(**このコメントは論文を読んだ当時を思い起こし2026年に追記しているが、この頃から業界はどのようにシフトしただろうか?最近は追えていない**)。
たとえば評価をする際には、データセットの選択だけでなく、データセットの中でどの規模感のデータセットを使うのか(MovieLens一つとっても様々なバリエーションがある)、leave-one-outをするのか、時系列性を考慮した履歴の分割をするのか、negative samplingをする際の件数やサンプリング方法、なんらかのstratifiedなk-fold cross validationをするのか否か、coldstartなデータを排除するのか否か、排除する際の足切りの基準、ハイパーパラメータ。最適化する際のメトリックと最適化をするパラメータ、平均を取る際の実験の試行回数、性能を測るメトリック(Precision, Recall, NDCG, MAP, MRR, AUC, HITS@N...)など様々な変数が存在し、これらの設定が異なると性能は確かに大きく変化すると思われる。実際に推薦モデルの検証をする際には適切な検証となるよう細心の注意を払いたい。
私個人としては本研究を知った以後、オフラインでの実験のみでなくらA/Bテストが実施されている研究に対する信頼性をより高めるようになった。
おそらくこれを受けてRecboleのようなフレームワークが登場したと思うが、現在は更新がされていないという認識である。いまはどのように再現性に関する取り組みがされているだろうか?
- Autonomously Generating Hints by Inferring Problem Solving Policies, Piech+, Stanford University, L@S'15
A Self-Attentive model for Knowledge Tracing, Pandy+ (with George Carypis), EDM'19
Paper/Blog Link My Issue
#NeuralNetwork #AdaptiveLearning #EducationalDataMining #StudentPerformancePrediction #EDM #In-Depth Notes Issue Date: 2021-10-28 Comment
Knowledge Tracingタスクに初めてself-attention layerを導入した研究
interaction (e_{t}, r_{t}) および current exercise (e_{t+1}) が与えられた時に、current_exerciseの正誤を予測したい。
* e_{t}: 時刻tのexercise
* r_{t}: 時刻tでの正誤
interactionからKey, Valueを生成し、current exerciseからQueryを生成し、multi-head attentionを適用する。その後、得られたcontext vectorをFFNにかけて、正誤を予測する。

DKTや、DKVMNを全てのデータセットでoutperform
Context-Aware Attentive Knowledge Tracing, Ghosh+, University of Massachusetts Amherst, KDD'20
においてはSAKTがDKT, DKVMN等に勝てていないのに対し(ASSSITments Data + Statics Data)
An Empirical Comparison of Deep Learning Models for Knowledge Tracing on Large-Scale Dataset, Pandey+, AAAI workshop on AI in Education'21
Do we need to go Deep? Knowledge Tracing with Big Data, Varun+, University of Maryland Baltimore County, AAAI'21 Workshop on AI Education
においてはSAKTはDKT, DKVMNに勝っている(EdNet Data)
When is Deep Learning the Best Approach to Knowledge Tracing?, Theophile+ (Ken Koedinger), CMU+, JEDM'20
においてもSAKTがDKTに勝てないことが報告されている(ASSISTments Data + Statics Data + Bridge to Algebra, Squirrel dataなど)。ただし、Interaction数が大きいデータセット(Squirrel data)ではDKTの性能に肉薄している。
Large ScaleなデータだとSAKTが強いが、Large Scaleなデータでなければあまり強くないということだと思われる。
Large Scaleの基準は、なかなか難しいが、1億Interaction程度あれば(EdNetデータ)SAKTの方が優位に強くなりそう。
数十万、数百万Interaction程度のデータであれば、DKTとSAKTはおそらくcomparableだと思われる。
(追記)
しかし Learning Process-consistent Knowledge Tracing, Shen+, SIGKDD'21
においてはSAKTはEdNetデータセット(Large Scale)においてDKT, DKT+, DKVMNとcomparableなので、
正直何を信じたら良いか分からない。
[Paper Note] EKT: Exercise-aware Knowledge Tracing for Student Performance Prediction, Qi Liu+, IEEE TKDE'19, 2019.06
Paper/Blog Link My Issue
#NeuralNetwork #EducationalDataMining #LearningAnalytics #StudentPerformancePrediction #KnowledgeTracing #In-Depth Notes Issue Date: 2021-05-28 GPT Summary- 学生のパフォーマンス予測のために、演習記録と教材情報を統合するEERNNフレームワークを提案。双方向LSTMを用いて演習内容をエンコードし、マルコフ特性とアテンションメカニズムを持つ2つの実装を提供。さらに、知識概念を追跡するEKTに拡張し、演習が知識習得に与える影響を定量化。実験により、予測精度と解釈可能性の向上が確認された。 Comment
DKT等のDeepなモデルでは、これまで問題テキストの情報等は利用されてこなかったが、learning logのみならず、問題テキストの情報等もKTする際に活用した研究。
[Paper Note] Exercise-Enhanced Sequential Modeling for Student Performance Prediction, Hu+, AAAI'18
をより洗練させjournal化させたものだと思われる。
[Paper Note] Exercise-Enhanced Sequential Modeling for Student Performance Prediction, Hu+, AAAI'18
ではKTというより、問題の正誤を予測するモデルとなっており、個々のconceptに対するproficiencyを推定するというKTの考え方はあまり導入されていなかった。
EKTの方では、個々のknowledge componentのproficiency scoreを算出する方法も提案されている。
モデル自体は、基本的にはattention-basedなRNNモデル。

Exercise EmbeddingはBidireictional-RNNを利用して、問題文をエンコードすることによって求める。
EKTによるmastery levelを可視化したもの。T=0とT=30では各conceptに対するmastery levelが大きく異なっている。基本的に、たくさん正解したconceptはmastery levelが向上し、不正解しまくったconceptはどんどんmastery levelがshrinkしていく。
予測性能。問題のContentを考慮することで、正誤予測のAUCは圧倒的に高くなる。DKTよりも10ポイント程度EKTAの方がAUCが高いように見える。
各モデルの特徴や、knowledge tracingが行えるか否か、といった性質を整理した表。わかりやすい。しかしDKTのknowledge tracking?が×になっているのは誤りでは?
各knowledge conceptの時刻tにおけるmastery levelの求め方。
EKTでは、生徒の各knowledge conceptの状態を保持した行列H_t^i(0 <= i <= # of concepts)を保持している。correctness probabilityを最終的に求める際には、H_t^iの各knowledge conceptに対する重みβ_iで重みづけた上でsummationをとり、各知識の状態を統合したベクトルsを作成し、sとexercise embedding xをconcatした上でスコアを予測する。
このスコアの予測部分を変更し、β_iをmastery levelを測定したいconceptのone-hot encodingに置き換え、さらにexercise embeddingをmaskしたベクトル=masked exercise embedding = zero vectorをconcatした上で、スコアを予測するようにする。
こうすることで、exerciseの影響を除き、かつone-hot encodingで指定したknowledgeのmasteryのみが考慮されたスコアを抽出できるため、そのスコアをmastery levelとする。
単にStudent Performance Predictionして終わり!ってんじゃなく、knowledge tracing的な側面をきちんと考慮している点で、この研究めっちゃ好き。
スキルタグごとにLSTMのhidden_stateを保持しないといけないので、メモリの消費量がえぐいことになりそう。小規模なスキルタグのデータセットじゃないと動かないのでは?
実際、実験では37種類のスキルタグが存在するデータセットしか扱っていない。
[Paper Note] Shampoo: Preconditioned Stochastic Tensor Optimization, Vineet Gupta+, ICML'18, 2018.02
Paper/Blog Link My Issue
#Pretraining #NLP #LanguageModel #Optimizer #ICML #read-later Issue Date: 2026-08-06 GPT Summary- Shampooは、テンソル空間における確率的最適化のための新しい前処理アルゴリズムで、次元を縮約する行列の集合を保持し、収束保証を提供。実験により、Shampooが一般の最適化手法より速く収束し、実行時間は他の単純な手法と同等であることを示した。 Comment
次:
- [Paper Note] SOAP: Improving and Stabilizing Shampoo using Adam, Nikhil Vyas+, ICLR'25
[Paper Note] Intrinsic Motivation and Automatic Curricula via Asymmetric Self-Play, Sainbayar Sukhbaatar+, ICLR'18, 2017.03
Paper/Blog Link My Issue
#NeuralNetwork #NLP #ReinforcementLearning #ICLR #read-later #SelfPlay Issue Date: 2026-04-29 GPT Summary- エージェントが教師なしで学習するための単純なスキームを提案。アリスとボブの二つのエージェントが対戦し、アリスが課題を提示、ボブがそれを完了しようと試みる。可逆な環境とリセット可能な環境に焦点を当て、アリスが行動を提案し、ボブがそれを元に戻すか繰り返す。適切な報酬設計により、自動的に探索のカリキュラムを生成し、教師なし学習を実現。ボブをRLタスクに適用することで、教師付きエピソードの数を減少させ、高い報酬へ収束する可能性がある。 Comment
openreview: https://openreview.net/forum?id=SkT5Yg-RZ
[Paper Note] Subword Regularization: Improving Neural Network Translation Models with Multiple Subword Candidates, Taku Kudo, ACL'18, 2018.04
Paper/Blog Link My Issue
#NeuralNetwork #MachineTranslation #Subword #ACL #Tokenizer #read-later Issue Date: 2025-11-19 GPT Summary- サブワード単位はNMTのオープンボキャブラリー問題を軽減するが、セグメンテーションの曖昧さが存在する。本研究では、この曖昧さを利用してNMTのロバスト性を向上させるため、サブワードの正則化手法を提案し、確率的にサンプリングされた複数のセグメンテーションでモデルを訓練する。また、ユニグラム言語モデルに基づく新しいセグメンテーションアルゴリズムも提案。実験により、特にリソースが限られた設定での改善を示した。
[Paper Note] SentencePiece: A simple and language independent subword tokenizer and detokenizer for Neural Text Processing, Taku Kudo+, arXiv'18, 2018.08
Paper/Blog Link My Issue
#NeuralNetwork #NLP #MultiLingual #Tokenizer Issue Date: 2025-11-19 GPT Summary- 本論文では、Neural Machine Translation向けの言語に依存しないサブワードトークナイザー「SentencePiece」を紹介。生の文から直接サブワードモデルを訓練でき、エンドツーエンドのシステム構築が可能。英日機械翻訳の実験で高精度を確認し、さまざまな構成での性能比較も行った。SentencePieceはオープンソースで提供されている。 Comment
真の多言語処理を実現できる価値
著者による解説:
https://qiita.com/taku910/items/7e52f1e58d0ea6e7859c
[Paper Note] Deep Reinforcement Learning that Matters, Peter Henderson+, AAAI'18, 2017.09
Paper/Blog Link My Issue
#NeuralNetwork #Analysis #MachineLearning #ReinforcementLearning #AAAI #Reproducibility #One-Line Notes Issue Date: 2025-10-22 GPT Summary- 深層強化学習(RL)の進展を持続させるためには、既存研究の再現性と新手法の改善を正確に評価することが重要である。しかし、非決定性や手法のばらつきにより、結果の解釈が難しくなることがある。本論文では、再現性や実験報告の課題を調査し、一般的なベースラインとの比較における指標のばらつきを示す。さらに、深層RLの結果を再現可能にするためのガイドラインを提案し、無駄な努力を最小限に抑えることで分野の進展を促進することを目指す。 Comment
日本語解説: https://www.slideshare.net/slideshow/dldeep-reinforcement-learning-that-matters-83905622/83905622
再現性という観点とは少し異なるのかもしれないが、最近のRLによるpost-trainingについては、以下の研究でScaling Lawsが導入されている。
- [Paper Note] The Art of Scaling Reinforcement Learning Compute for LLMs, Devvrit Khatri+, arXiv'25, 2025.10
が、結局現在も多くのRL手法が日夜出てきており、再現性に関しては同じような状況に陥っていそうである。
[Paper Note] Self-Attentive Sequential Recommendation, Wang-Cheng Kang+, ICDM'18
Paper/Blog Link My Issue
#RecommenderSystems #Transformer #SequentialRecommendation #ICDM Issue Date: 2025-07-04 GPT Summary- 自己注意に基づく逐次モデル(SASRec)を提案し、マルコフ連鎖と再帰型ニューラルネットワークの利点を統合。SASRecは、少数のアクションから次のアイテムを予測し、スパースおよび密なデータセットで最先端のモデルを上回る性能を示す。モデルの効率性と注意重みの視覚化により、データセットの密度に応じた適応的な処理が可能であることが確認された。
[Paper Note] An Empirical Model of Large-Batch Training, Sam McCandlish+, arXiv'18, 2018.12
Paper/Blog Link My Issue
#NeuralNetwork #EfficiencyImprovement #MachineLearning #read-later #Batch #One-Line Notes #CriticalBatchSize Issue Date: 2024-12-16 GPT Summary- 勾配ノイズスケールを用いて、異なる分野での最適なバッチサイズを予測する方法を提示。教師あり学習や強化学習など複数の領域での実験を通じて、この統計量がロスの低下に伴い増加し、モデルサイズが性能に与える影響を分析。計算効率と時間効率のトレードオフを説明し、適応的なバッチサイズ訓練の利点を示す。 Comment
Critical Batchsize(バッチサイズをこれより大きくすると学習効率が落ちる境界)を提唱した論文
[Paper Note] StarSpace: Embed All The Things, Wu+, AAAI'18
Paper/Blog Link My Issue
#RecommenderSystems #NeuralNetwork #General #Embeddings #MachineLearning #RepresentationLearning #AAAI #KeyPoint Notes Issue Date: 2017-12-28 Comment
分類やランキング、レコメンドなど、様々なタスクで汎用的に使用できるEmbeddingの学習手法を提案。
Embeddingを学習する対象をEntityと呼び、Entityはbag-of-featureで記述される。
Entityはbag-of-featureで記述できればなんでもよく、
これによりモデルの汎用性が増し、異なる種類のEntityでも同じ空間上でEmbeddingが学習される。
学習方法は非常にシンプルで、Entity同士のペアをとったときに、relevantなpairであれば類似度が高く、
irelevantなペアであれば類似度が低くなるようにEmbeddingを学習するだけ。
たとえば、Entityのペアとして、documentをbag-of-words, bag-of-ngrams, labelをsingle wordで記述しテキスト分類、
あるいは、user_idとユーザが過去に好んだアイテムをbag-of-wordsで記述しcontent-based recommendationを行うなど、 応用範囲は幅広い。
5種類のタスクで提案手法を評価し、既存手法と比較して、同等かそれ以上の性能を示すことが示されている。
手法の汎用性が高く学習も高速なので、色々な場面で役に立ちそう。
また、異なる種類のEntityであっても同じ空間上でEmbeddingが学習されるので、学習されたEmbeddingの応用先が広く有用。
実際にSentimentAnalysisで使ってみたが(ポジネガ二値分類)、少なくともBoWのSVMよりは全然性能良かったし、学習も早いし、次元数めちゃめちゃ少なくて良かった。
StarSpaceで学習したembeddingをBoWなSVMに入れると性能が劇的に改善した。
解説:
https://www.slideshare.net/akihikowatanabe3110/starspace-embed-all-the-things
[Paper Note] Neural Discrete Representation Learning, Aaron van den Oord+, NIPS'17, 2017.11
Paper/Blog Link My Issue
#ComputerVision #Quantization #VariationalAutoEncoder #NeurIPS #Tokenizer #UMM Issue Date: 2025-12-11 GPT Summary- 教師なしでの有用な表現学習のために、生成モデルVQ-VAEを提案。VQ-VAEは、離散的なコードを出力し、学習された事前分布を持つ点でVAEと異なる。ベクトル量子化を用いることで、ポスティアコラプス問題を回避し、高品質な画像や音声生成、スピーカー変換を実現。 Comment
日本語解説:
-
https://qiita.com/nishiha/items/44de5c46ebdfe615f6e8
-
https://data-analytics.fun/2021/05/14/understanding-vq-vae/
[Paper Note] Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer, Noam Shazeer+, ICLR'17
Paper/Blog Link My Issue
#NeuralNetwork #NLP #MoE(Mixture-of-Experts) #ICLR #One-Line Notes Issue Date: 2025-04-29 GPT Summary- 条件付き計算を用いたスパースゲーテッドミクスチャーオブエキスパート(MoE)レイヤーを導入し、モデル容量を1000倍以上向上。学習可能なゲーティングネットワークが各例に対してスパースなエキスパートの組み合わせを決定。最大1370億パラメータのMoEをLSTM層に適用し、言語モデリングや機械翻訳で低コストで優れた性能を達成。 Comment
Mixture-of-Experts (MoE) Layerを提案した研究
Overcoming catastrophic forgetting in neural networks, James Kirkpatrick+, N_A, PNAS'17
Paper/Blog Link My Issue
#NeuralNetwork #MachineLearning #Catastrophic Forgetting #One-Line Notes Issue Date: 2024-10-10 GPT Summary- タスクを逐次的に学習する能力を持つネットワークを訓練する方法を提案。重要な重みの学習を選択的に遅くすることで、古いタスクの記憶を維持。MNISTやAtari 2600ゲームでの実験により、アプローチの効果とスケーラビリティを実証。 Comment
Catastrophic Forgettingを防ぐEWCを提案した論文
日本語解説: https://qiita.com/yu4u/items/90c039ec2f1d4f2d2414
ポイント解説:
[Paper Note] Neural Collaborative Filtering, Xiangnan He+, WWW'17, 2017.08
Paper/Blog Link My Issue
#RecommenderSystems #NeuralNetwork #CollaborativeFiltering #MatrixFactorization #WWW #KeyPoint Notes Issue Date: 2018-02-16 GPT Summary- 深層ニューラルネットワークを用いたレコメンダーシステムの研究が少ない中、本研究では協調フィルタリングの問題に取り組むため、NCF(Neural network-based Collaborative Filtering)フレームワークを提案。内積をニューラルアーキテクチャに置き換え、ユーザーとアイテムの相互作用を多層パーセプトロンでモデル化。実験により、提案手法が最先端技術に対して顕著な改善を示し、深層ニューラルネットワークの層を深くすることでレコメンデーション性能が向上することが確認された。 Comment
Collaborative FilteringをMLPで一般化したNeural Collaborative Filtering、およびMatrix Factorizationはuser, item-embeddingのelement-wise product + linear transofmration + activation で一般化できること(GMF; Generalized Matrix Factorization)を示し、両者を組み合わせたNeural Matrix Factorizationを提案している。
学習する際は、Implicit Dataの場合は負例をNegative Samplingし、LogLoss(Binary Cross-Entropy Loss)で学習する。
Neural Matrix Factorizationが、ItemKNNやBPRといったベースラインをoutperform
Negative Samplingでサンプリングする負例の数は、3~4程度で良さそう
[Paper Note] Attention Is All You Need, Ashish Vaswani+, NeurIPS'17, 2017.07
Paper/Blog Link My Issue
#NeuralNetwork #MachineTranslation #NLP #Transformer #FoundationModel #Attention #PositionalEncoding #NeurIPS #Normalization #KeyPoint Notes #Reference Collection Issue Date: 2018-01-19 GPT Summary- Transformerは、再帰や畳み込みを排除し、注意機構のみに基づいた新しいネットワークアーキテクチャである。実験により、機械翻訳タスクで優れた品質を示し、トレーニング時間を大幅に短縮。WMT 2014の英独翻訳で28.4 BLEU、英仏翻訳で41.8 BLEUを達成し、既存モデルを上回る性能を示した。また、英語の構文解析にも成功裏に適用可能であることを示した。 Comment
Transformer (self-attentionを利用) 論文
解説スライド:
https://www.slideshare.net/DeepLearningJP2016/dlattention-is-all-you-need
解説記事:
https://qiita.com/nishiba/items/1c99bc7ddcb2d62667c6
* 新しい翻訳モデル(Transformer)を提案。既存のモデルよりも並列化に対応しており、短時間の訓練で(既存モデルの1/4以下のコスト)高いBLEUスコアを達成した。
* TransformerはRNNやCNNを使わず、attentionメカニズムに基づいている。
(解説より)
分かりやすい:
https://qiita.com/halhorn/items/c91497522be27bde17ce
Transformerの各コンポーネントでのoutputのshapeや、attention_maskの形状、実装について記述されており有用:
https://qiita.com/FuwaraMiyasaki/items/239f3528053889847825
集合知
Transformer提案時と最近の動向への流れ
- BPEによるOOVの防止
- その後sentencepieceによる真の多言語化の実現
- Positional Encodingの提案
- 本稿はSinusoidal PE(絶対位置エンコーディング)で提案され、その後相対位置エンコーディング / RoPE / NoPE などの変種が登場
- Residual Connectionによる勾配爆発・消失の低減による深いモデル化
- 最近はHyperConnection等のResidual Streamの改善が進む
- QK Norm + learnableなScaling factor
- [Paper Note] Query-Key Normalization for Transformers, Alex Henry+, EMNLP'20 Findings
- 活性化関数の進化
- [Paper Note] GLU Variants Improve Transformer, Noam Shazeer, arXiv'20, 2020.02
- Multi-head-attentionによるトークン間の多様な関係性のモデル化
- トークン間を跨いだ情報のmixing
- FFNによるトークン内での情報のmixing
- MHA -> MQA -> GQA -> MLA
- O(n^2)によるボトルネックを改善するために Sparse Attention / Linear Attention 等のより計算量が小さい手法へ進展
- また、実装上の工夫としてFlash Attentionが標準に
- Layer Normalizationによる正規化(内部共変量シフト防止)による学習の安定化
- 本稿ではPostLN
- その後Pre-LNの方が性能は落ちるが学習が安定するため主流となり、現在またPost-LNが再考されている
- また、現在はLayerNormalizationではなくRMSNormを使用する傾向がある
- [Paper Note] Understanding and Improving Layer Normalization, Jingjing Xu+, arXiv'19, 2019.11
- 本稿ではRNNと比較して並列計算可能なEncoder-Decoderアーキテクチャとして提案されMTで評価
- Decoder側ではCausal Maskの導入によるleakの防止
- その後、Decoder-only Model として現在のLLMの基盤に
- 実装上の工夫としてKV Cacheによる生成の高速化
[Paper Note] Challenges in Data-to-Document Generation, Sam Wiseman+, EMNLP'17, 2017.07
Paper/Blog Link My Issue
#NeuralNetwork #NaturalLanguageGeneration #NLP #DataToTextGeneration #EMNLP #KeyPoint Notes Issue Date: 2018-01-01 GPT Summary- ニューラルモデルは少数のデータから短い説明文を生成するタスクで進展を見せているが、難易度の高いデータに対しては効果が限定的である。本研究では新たなデータレコードと説明文のコーパスを導入し、評価手法を提案してパフォーマンスを分析した。実験結果では、モデルは流暢なテキストを生成するものの、人間の文書には及ばず、テンプレートベースの手法が一部指標で優れていることが示された。コピーや再構築に基づく拡張が改善をもたらすことも確認された。 Comment
・RotoWire(NBAのテーブルデータ + サマリ)データを収集し公開
・Rotowireデータの統計量
【モデルの概要】
・attention-based encoder-decoder model
・BaseModel
- レコードデータ r の各要素(r.e: チーム名等のENTITY r.t: POINTS等のデータタイプ, r.m: データのvalue)からembeddingをlookupし、1-layer MLPを適用し、レコードの各要素のrepresentation(source data records)を取得
- Luongらのattentionを利用したLSTM Decoderを用意し、source data recordsとt-1ステップ目での出力によって条件付けてテキストを生成していく
- negative log likelihoodがminimizeされるように学習する
・Copying
- コピーメカニズムを導入し、生成時の確率分布に生成テキストを入力からコピーされるか否かを含めた分布からテキストを生成。コピーの対象は、入力レコードのvalueがコピーされるようにする。
- コピーメカニズムには下記式で表現される Conditional Copy Modelを利用し、p(zt|y1:t-1, s)はMLPで表現する(Conditional Copy Model 節参照)。
- またpcopyは、生成している文中にあるレコードのエンティティとタイプが出現する場合に、対応するvalueをコピーし生成されるように表現する
[Paper Note] Get To The Point: Summarization with Pointer-Generator Networks, Abigail See+, arXiv'17, 2017.04
Paper/Blog Link My Issue
#Single #DocumentSummarization #NeuralNetwork #Document #Supervised #NLP #Abstractive #ACL #KeyPoint Notes Issue Date: 2017-12-31 GPT Summary- ニューラルシーケンス・ツー・シーケンスモデルは抽象的なテキスト要約に新たなアプローチを提供するが、事実の不正確な再現と自己繰り返しの問題がある。本研究では、ハイブリッドポインタージェネレーターネットワークを用いて情報の正確な再現を促進し、カバレッジを利用して繰り返しを抑制する新しいアーキテクチャを提案。CNN/Daily Mail要約タスクで、最先端技術を2 ROUGEポイント上回る結果を得た。 Comment
単語の生成と単語のコピーの両方を行えるハイブリッドなニューラル文書要約モデルを提案。
同じ単語の繰り返し現象(repetition)をなくすために、Coverage Mechanismも導入した。
[Paper Note] Incorporating Copying Mechanism in Sequence-to-Sequence Learning, Gu+, ACL'16
などと比較するとシンプルなモデル。
一般的に、PointerGeneratorと呼ばれる。
OpenNMTなどにも実装されている:
https://opennmt.net/OpenNMT-py/_modules/onmt/modules/copy_generator.html
(参考)Pointer Generator Networksで要約してみる:
https://qiita.com/knok/items/9a74430b279e522d5b93
[Paper Note] Toward Controlled Generation of Text, Zhiting Hu+, ICML'17, 2017.03
Paper/Blog Link My Issue
#NeuralNetwork #NaturalLanguageGeneration #Controllable #NLP #DataToTextGeneration #ConceptToTextGeneration #GenerativeAdversarialNetwork #ICML #KeyPoint Notes Issue Date: 2017-12-31 GPT Summary- 属性に基づいて制御された自然言語文を生成するために、変分オートエンコーダと属性識別器を組み合わせた新しい生成モデルを提案。微分可能な近似を用いて解釈可能な表現を学習し、望ましい属性を持つ文を生成。定量的評価で生成の正確性を確認。 Comment
Text Generationを行う際は、現在は基本的に学習された言語モデルの尤度に従ってテキストを生成するのみで、outputされるテキストをcontrolすることができないので、できるようにしましたという論文。 VAEによるテキスト生成にGANを組み合わせたようなモデル。 decodingする元となるfeatureのある次元が、たとえばpolarityなどに対応しており、その次元の数値をいじるだけで生成されるテキストをcontrolできる。
テキストを生成する際に、生成されるテキストをコントロールするための研究。 テキストを生成する際には、基本的にはVariational Auto Encoder(VAE)を用いる。
VAEは、入力をエンコードするEncoderと、エンコードされた潜在変数zからテキストを生成するGeneratorの2つの機構によって構成されている。
この研究では、生成されるテキストをコントロールするために、VAEの潜在変数zに、生成するテキストのattributeを表す変数cを新たに導入。
たとえば、一例として、変数cをsentimentに対応させた場合、変数cの値を変更すると、生成されるテキストのsentimentが変化するような生成が実現可能。
次に、このような生成を実現できるようなパラメータを学習したいが、学習を行う際のポイントは、以下の二つ。
cで指定されたattributeが反映されたテキストを生成するように学習
潜在変数zとattributeに関する変数cの独立性を保つように学習 (cには制御したいattributeに関する情報のみが格納され、その他の情報は潜在変数zに格納されるように学習する)
1を実現するために、新たにdiscriminatorと呼ばれる識別器を用意し、VAEが生成したテキストのattributeをdiscriminatorで分類し、その結果をVAEのGeneratorにフィードバックすることで、attributeが反映されたテキストを生成できるようにパラメータの学習を行う。 (これにはラベル付きデータが必要だが、少量でも学習できることに加えて、sentence levelのデータだけではなくword levelのデータでも学習できる。)
また、2を実現するために、VAEが生成したテキストから、生成する元となった潜在変数zが再現できるようにEncoderのパラメータを学習。
実験では、sentimentとtenseをコントロールする実験が行われており、attributeを表す変数cを変更することで、以下のようなテキストが生成されており興味深い。
[sentimentを制御した例]
this movie was awful and boring. (negative)
this movie was funny and touching. (positive)
[tenseを制御した例]
this was one of the outstanding thrillers of the last decade
this is one of the outstanding thrillers of the all time
this will be one of the great thrillers of the all time
VAEは通常のAutoEncoderと比較して、奥が深くて勉強してみておもしろかった。 Reparametrization Trickなどは知らなかった。
管理人による解説資料:
[Controllable Text Generation.pdf](https://github.com/AkihikoWatanabe/paper_notes/files/1595121/Controllable.Text.Generation.pdf)
slideshare: https://www.slideshare.net/akihikowatanabe3110/towards-controlled-generation-of-text
[Paper Note] A Structured Self-attentive Sentence Embedding, Zhouhan Lin+, ICLR'17, 2017.03
Paper/Blog Link My Issue
#NeuralNetwork #Sentence #Embeddings #NLP #RepresentationLearning #ICLR #One-Line Notes Issue Date: 2017-12-28 GPT Summary- 自己注意機構を用いた新しい文埋め込みモデルを提案。2次元行列で文の異なる部分に注意を払い、視覚化手法も提供。著者プロファイリング、感情分類、テキスト含意の3つのタスクで評価し、他の手法と比較して性能が向上したことを示す。 Comment
OpenReview: https://openreview.net/forum?id=BJC_jUqxe
日本語解説: https://ryotaro.dev/posts/a_structured_self_attentivesentence_embedding/
self-attentionを提案した研究
[Paper Note] Wide & Deep Learning for Recommender Systems, Heng-Tze Cheng+, DLRS'16, 2016.06
Paper/Blog Link My Issue
#RecommenderSystems #NeuralNetwork Issue Date: 2026-01-06 GPT Summary- Wide & Deep学習は、推薦システムのために広範な線形モデルと深層ニューラルネットワークを共同で訓練する手法で、記憶と一般化の利点を組み合わせる。Google Playでの実用化により、アプリの獲得が大幅に増加したことがオンライン実験で示された。TensorFlowでの実装はオープンソース化されている。 Comment
日本語解説: https://data.gunosy.io/entry/deep-factorization-machines-2018#Wide--Deep-Cheng-arXiv160607792-2016
[Paper Note] WaveNet: A Generative Model for Raw Audio, Aaron van den Oord+, arXiv'16
Paper/Blog Link My Issue
#NeuralNetwork #SpeechProcessing Issue Date: 2025-06-13 GPT Summary- 本論文では、音声波形を生成する深層ニューラルネットワークWaveNetを提案。自己回帰的なモデルでありながら、効率的に音声データを訓練可能。テキストから音声への変換で最先端の性能を示し、人間のリスナーに自然な音と評価される。話者の特性を忠実に捉え、アイデンティティに基づく切り替えが可能。音楽生成にも応用でき、リアルな音楽の断片を生成。また、音素認識のための有望な識別モデルとしての利用も示唆。
[Paper Note] Controlling Output Length in Neural Encoder-Decoders, Yuta Kikuchi+, EMNLP'16
Paper/Blog Link My Issue
#NeuralNetwork #Controllable #NLP #EMNLP #Length #Encoder-Decoder #One-Line Notes Issue Date: 2025-01-03 GPT Summary- ニューラルエンコーダ-デコーダモデルの出力長を制御する方法を提案。特にテキスト要約において、デコーディングと学習に基づく2つのアプローチを用い、学習ベースの方法が要約の質を保ちながら長さを調整できることを示した。 Comment
Encoder-Decoderモデルにおいてoutput lengthを制御する手法を提案した最初の研究
[Paper Note] Deep Residual Learning for Image Recognition, Kaiming He+, CVPR'16, 2015.12
Paper/Blog Link My Issue
#NeuralNetwork #ComputerVision #CVPR #Backbone #KeyPoint Notes #ResidualStream #Reading Reflections Issue Date: 2021-11-04 GPT Summary- 残差学習フレームワークを提案し、深いニューラルネットワークのトレーニングを容易にする。参照層の入力に基づいて残差関数を学習することで、最適化が容易になり、精度が向上。152層の残差ネットはImageNetで低い複雑性を保ちながら高い性能を示し、ILSVRC 2015で1位を獲得。COCOデータセットでも28%の改善を達成。 Comment
ResNet論文
ResNetでは、レイヤーの計算する関数を、残差F(x)と恒等関数xの和として定義する。これにより、レイヤーが入力との差分だけを学習すれば良くなり、モデルを深くしても最適化がしやすくなる効果ぎある。数レイヤーごとにResidual Connectionを導入し、恒等関数によるショートカットができるようにしている。
ResNetが提案される以前、モデルを深くすれば表現力が上がるはずなのに、実際には精度が下がってしまうことから、理論上レイヤーが恒等関数となるように初期化すれば、深いモデルでも浅いモデルと同等の表現が獲得できる、と言う考え方を発展させた。
(ステートオブAIガイドに基づく)
同じパラメータ数でより層を深くできる(Plainな構造と比べると層が1つ増える)Bottleneckアーキテクチャも提案している。
今や当たり前のように使われているResidual Connectionは、層の深いネットワークを学習するために必須の技術なのだと再認識。
[Paper Note] Deep Neural Networks for YouTube Recommendations, Covington+, RecSys'16
Paper/Blog Link My Issue
#RecommenderSystems #NeuralNetwork #RecSys Issue Date: 2018-12-27
[Paper Note] Convolutional Neural Networks on Graphs with Fast Localized Spectral Filtering, Michaël Defferrard+, NIPS'16, 2016.06
Paper/Blog Link My Issue
#NeuralNetwork #MachineLearning #GraphConvolutionalNetwork #NeurIPS #Initial Impression Notes Issue Date: 2018-03-30 GPT Summary- 本研究では、CNNを用いて低次元のグリッドから高次元のグラフドメインへの一般化を探求。スペクトルグラフ理論に基づくCNNの定式化を提案し、古典的CNNと同等の計算複雑性を維持しつつ、任意のグラフ構造に対応可能。MNISTおよび20NEWSの実験により、グラフ上での局所的特徴学習の能力を示した。 Comment
GCNを勉強する際は読むと良いらしい。
あわせてこのへんも:
Semi-Supervised Classification with Graph Convolutional Networks, Kipf+, ICLR'17
https://github.com/tkipf/gcn
[Paper Note] Layer Normalization, Ba+, arXiv'16, 2016.07
Paper/Blog Link My Issue
#NeuralNetwork #MachineLearning #Normalization #Reference Collection Issue Date: 2018-02-19 GPT Summary- バッチ正規化の代わりにレイヤー正規化を用いることで、リカレントニューラルネットワークのトレーニング時間を短縮。レイヤー内のニューロンの合計入力を正規化し、各ニューロンに独自の適応バイアスとゲインを適用。トレーニング時とテスト時で同じ計算を行い、隠れ状態のダイナミクスを安定させる。実証的に、トレーニング時間の大幅な短縮を確認。 Comment
解説スライド:
https://www.slideshare.net/KeigoNishida/layer-normalizationnips
[Paper Note] Generating Sentences from a Continuous Space, Samuel R. Bowman+, CoNLL'16, 2015.11
Paper/Blog Link My Issue
#NeuralNetwork #NaturalLanguageGeneration #NLP #VariationalAutoEncoder #CoNLL #One-Line Notes #Reference Collection #RecurrentModels Issue Date: 2018-02-14 GPT Summary- RNNベースの変分オートエンコーダ生成モデルを導入し、文全体の分散潜在表現を組み込むことで、文のスタイルやトピックなどの特性を明示的にモデル化。潜在空間を通じて新しい文を生成し、欠損単語の補完効果を実証。モデルの特性と使用に関する否定的な結果も示す。 Comment
VAEを利用して文生成
【Variational Autoencoder徹底解説】
https://qiita.com/kenmatsu4/items/b029d697e9995d93aa24
[Paper Note] Collaborative Denoising Auto-Encoders for Top-N Recommender Systems, Wu+, WSDM'16
Paper/Blog Link My Issue
#RecommenderSystems #NeuralNetwork #CollaborativeFiltering #WSDM #KeyPoint Notes #AutoEncoder Issue Date: 2018-01-02 Comment
Denoising Auto-Encoders を用いたtop-N推薦手法、Collaborative Denoising Auto-Encoder (CDAE)を提案。
モデルベースなCollaborative Filtering手法に相当する。corruptedなinputを復元するようなDenoising Auto Encoderのみで推薦を行うような手法は、この研究が初めてだと主張。
学習する際は、userのitemsetのsubsetをモデルに与え(noiseがあることに相当)、全体のitem setを復元できるように、学習する(すなわちDenoising Auto-Encoder)。
推薦する際は、ユーザのその時点でのpreference setをinputし、new itemを推薦する。
- [Paper Note] Collaborative Deep Learning for Recommender Systems, Hao Wang+, KDD'15
もStacked Denoising Auto EncoderとCollaborative Topic Regression [Paper Note] Collaborative topic modeling for recommending scientific articles, Wang+, KDD'11
を利用しているが、[Paper Note] Collaborative Deep Learning for Recommender Systems, Hao Wang+, KDD'15
ではarticle recommendationというspecificな問題を解いているのに対して、提案手法はgeneralなtop-N推薦に利用できることを主張。
[Paper Note] Incorporating Copying Mechanism in Sequence-to-Sequence Learning, Gu+, ACL'16
Paper/Blog Link My Issue
#Single #DocumentSummarization #NeuralNetwork #Document #Supervised #NLP #Abstractive #ACL #KeyPoint Notes Issue Date: 2017-12-31 Comment
単語のコピーと生成、両方を行えるネットワークを提案。
location based addressingなどによって、生成された単語がsourceに含まれていた場合などに、copy-mode, generate-modeを切り替えるような仕組みになっている。
[Paper Note] Pointing the Unknown Words, Caglar Gulcehre+, ACL'16, 2016.03
と同じタイミングで発表
[Paper Note] Pointing the Unknown Words, Caglar Gulcehre+, ACL'16, 2016.03
Paper/Blog Link My Issue
#NeuralNetwork #MachineTranslation #NLP #ACL #One-Line Notes Issue Date: 2017-12-28 GPT Summary- 希少および未知の単語に対処するため、注意機構を用いた新しいニューラルネットワークモデルを提案。2つのソフトマックス層を使用し、文脈に基づいて適応的に選択。提案モデルは、翻訳と要約タスクで性能向上を示した。 Comment
テキストを生成する際に、source textからのコピーを行える機構を導入することで未知語問題に対処した話
CopyNetと同じタイミングで(というか同じconferenceで)発表
[Paper Note] Retrofitting Word Vectors to Semantic Lexicons, Manaal Faruqui+, NAACL'15, 2014.11
Paper/Blog Link My Issue
#Embeddings #NLP #Word #RepresentationLearning #Finetuning #One-Line Notes Issue Date: 2025-12-04 GPT Summary- 意味的レキシコンの情報を活用して、単語のベクトル空間表現を改善する手法を提案。関連する単語が類似のベクトルを持つよう促し、従来の仮定に依存しない。複数の言語での語彙意味評価タスクで大幅な改善を示し、従来技術を上回る性能を達成。 Comment
日本語解説: https://www.slideshare.net/slideshow/20150421-forupdate/47365800
Retrofittingという用語を今でも耳にすることがあるが、この研究のような手法を指すと思って良いと思われる(研究室の輪講で本論文の発表があったのを思い出すなぁ)。事前学習済みの単語ベクトルに対して事後的に外部知識(辞書など)を埋め込みチューニングする話。
[Paper Note] U-Net: Convolutional Networks for Biomedical Image Segmentation, Olaf Ronneberger+, MICCAI'15, 2015.05
Paper/Blog Link My Issue
#NeuralNetwork #ComputerVision #Encoder-Decoder #Backbone #U-Net Issue Date: 2025-09-22 GPT Summary- データ拡張を活用した新しいネットワークアーキテクチャを提案し、少ない注釈付きサンプルからエンドツーエンドでトレーニング可能であることを示す。電子顕微鏡スタックの神経構造セグメンテーションで従来手法を上回り、透過光顕微鏡画像でも優れた結果を達成。512x512画像のセグメンテーションは1秒未満で完了。実装とトレーニング済みネットワークは公開されている。
[Paper Note] Neural Machine Translation by Jointly Learning to Align and Translate, Dzmitry Bahdanau+, ICLR'15
Paper/Blog Link My Issue
#NeuralNetwork #MachineTranslation #NLP #Attention #ICLR #One-Line Notes Issue Date: 2025-05-12 GPT Summary- ニューラル機械翻訳は、エンコーダー-デコーダーアーキテクチャを用いて翻訳性能を向上させる新しいアプローチである。本論文では、固定長のベクトルの使用が性能向上のボトルネックであるとし、モデルが関連するソース文の部分を自動的に検索できるように拡張することを提案。これにより、英語からフランス語への翻訳タスクで最先端のフレーズベースシステムと同等の性能を達成し、モデルのアライメントが直感と一致することを示した。 Comment
(Cross-)Attentionを初めて提案した研究。メモってなかったので今更ながら追加。Attentionはここからはじまった(と認識している)
[Paper Note] Batch Normalization: Accelerating Deep Network Training by Reducing Internal Covariate Shift, Sergey Ioffe+, ICML'15
Paper/Blog Link My Issue
#MachineLearning #LanguageModel #Transformer #ICML #Normalization #Reference Collection Issue Date: 2025-04-02 GPT Summary- バッチ正規化を用いることで、深層ニューラルネットワークのトレーニングにおける内部共変量シフトの問題を解決し、高い学習率を可能にし、初期化の注意を軽減。これにより、同じ精度を14倍少ないトレーニングステップで達成し、ImageNet分類で最良の公表結果を4.9%改善。 Comment
メモってなかったので今更ながら追加した
共変量シフトやBatch Normalizationの説明は
- [Paper Note] Layer Normalization, Ba+, arXiv'16, 2016.07
記載のスライドが分かりやすい。
[Paper Note] Hidden Technical Debt in Machine Learning Systems, Sculley+, NIPS'15
Paper/Blog Link My Issue
#Tutorial #MachineLearning #Infrastructure #NeurIPS #One-Line Notes Issue Date: 2021-10-19 Comment

よく見るML codeが全体のごく一部で、その他の基盤が大半を占めてますよ、の図が掲載されている文献。様々な資料で引用されている。
[Paper Note] Effective Approaches to Attention-based Neural Machine Translation, Luong+, EMNLP'15
Paper/Blog Link My Issue
#NeuralNetwork #MachineTranslation #NLP #EMNLP #KeyPoint Notes Issue Date: 2021-06-02 Comment
Luong論文。attentionの話しはじめると、だいたいBahdanau+か、Luong+論文が引用される。
Global Attentionと、Local Attentionについて記述されている。Global Attentionがよく利用される。
Global Attention
Local Attention
やはり菊池さんの解説スライドが鉄板。
https://www.slideshare.net/yutakikuchi927/deep-learning-nlp-attention
参考までに、LuongらのGlobal Attentionの計算の流れは下記となっている:
- h_t -> a_t -> c_t -> h^~_t
BahdanauらのAttentionは下記
- h_t-1 -> a_t -> c_t -> h_t
t-1のhidden stateを使うのか、input feeding後の現在のhidden stateをattention weightの計算に使うのかが異なっている。
また、過去のalignmentの情報を考慮した上でデコーディングしていくために、input-feeding approachも提案
input-feeding appproachでは、t-1ステップ目のoutputの算出に使ったh^~_t(hidden_stateとcontext vectorをconcatし、tanhのactivationを噛ませた線形変換を行なったベクトル)を、時刻tのinput embeddingにconcatして、RNNに入力する。
[Paper Note] Session-based Recommendations with Recurrent Neural Networks, Balázs Hidasi+, arXiv'15
Paper/Blog Link My Issue
#RecommenderSystems #SessionBased #ICLR #SequentialRecommendation #One-Line Notes Issue Date: 2019-08-02 GPT Summary- RNNを用いたセッションベースのレコメンダーシステムを提案。短いユーザーヒストリーに基づく推薦の精度向上を目指し、セッション全体をモデル化。ランキング損失関数などの修正を加え、実用性を考慮。実験結果は従来のアプローチに対して顕著な改善を示す。 Comment
RNNを利用したsequential recommendation (session-based recommendation)の先駆け的論文。
日本語解説: https://qiita.com/tatamiya/items/46e278a808a51893deac
[Paper Note] Deep Knowledge Tracing, Piech+, NIPS'15
Paper/Blog Link My Issue
#AdaptiveLearning #StudentPerformancePrediction #NeurIPS #KeyPoint Notes #Reference Collection Issue Date: 2018-12-22 Comment
Knowledge Tracingタスクとは:
特定のlearning taskにおいて、生徒によってとられたインタラクションの系列x0, ..., xtが与えられたとき、次のインタラクションxt+1を予測するタスク
典型的な表現としては、xt={qt, at}, where qt=knowledge component (KC) ID (あるいは問題ID)、at=正解したか否か
モデルが予測するときは、qtがgivenな時に、atを予測することになる
Contribution:
1. A novel way to encode student interactions as input to a recurrent neural network.
2. A 25% gain in AUC over the best previous result on a knowledge tracing benchmark.
3. Demonstration that our knowledge tracing model does not need expert annotations.
4. Discovery of exercise influence and generation of improved exercise curricula.
モデル:
Inputは、ExerciseがM個あったときに、M個のExerciseがcorrectか否かを表すベクトル(長さ2Mベクトルのone-hot)。separateなrepresentationにするとパフォーマンスが下がるらしい。
Output ytの長さは問題数Mと等しく、各要素は、生徒が対応する問題を正答する確率。
InputとしてExerciseを用いるか、ExerciseのKCを用いるかはアプリケーション次第っぽいが、典型的には各スキルの潜在的なmasteryを測ることがモチベーションなのでKCを使う。
(もし問題数が膨大にあるような設定の場合は、各問題-正/誤答tupleに対して、random vectorを正規分布からサンプリングして、one-hot high-dimensional vectorで表現する。)
hidden sizeは200, mini-batch sizeは100としている。
[Educational Applicationsへの応用]
生徒へ最適なパスの学習アイテムを選んで提示することができること
生徒のknowledge stateを予測し、その後特定のアイテムを生徒にassignすることができる。たとえば、生徒が50個のExerciseに回答した場合、生徒へ次に提示するアイテムを計算するだけでなく、その結果期待される生徒のknowledge stateも推測することができる
Exercises間の関係性を見出すことができる
y( j | i )を考える。y( j | i )は、はじめにexercise iを正答した後に、second time stepでjを正答する確率。これによって、pre-requisiteを明らかにすることができる。
[評価]
3種類のデータセットを用いる。
1. simulated Data
2000人のvirtual studentを作り、1〜5つのコンセプトから生成された、50問を、同じ順番で解かせた。このとき、IRTモデルを用いて、シミュレーションは実施した。このとき、hidden stateのラベルには何も使わないで、inputは問題のIDと正誤データだけを与えた。さらに、2000人のvirtual studentをテストデータとして作り、それぞれのコンセプト(コンセプト数を1〜5に変動させる)に対して、20回ランダムに生成したデータでaccuracyの平均とstandard errorを測った。
2. Khan Academy Data
1.4MのExerciseと、69の異なるExercise Typeがあり、47495人の生徒がExerciseを行なっている。
PersonalなInformationは含んでいない。
3. Assistsments bemchmark Dataset
2009-2011のskill builder public benchmark datasetを用いた。Assistmentsは、online tutorが、数学を教えて、教えるのと同時に生徒を評価するような枠組みである。
それぞれのデータセットに対して、AUCを計算。
ベースラインは、BKTと生徒がある問題を正答した場合の周辺確率?

simulated dataの場合、問題番号5がコンセプト1から生成され、問題番号22までの問題は別のコンセプトから生成されていたにもかかわらず、きちんと二つの問題の関係をとらえられていることがわかる。
Khan Datasetについても同様の解析をした。これは、この結果は専門家が見たら驚くべきものではないかもしれないが、モデルが一貫したものを学習したと言える。
[Discussion]
提案モデルの特徴として、下記の2つがある:
専門家のアノテーションを必要としない(concept patternを勝手に学習してくれる)
ベクトル化された生徒のinputであれば、なんでもoperateすることができる
drawbackとしては、大量のデータが必要だということ。small classroom environmentではなく、online education environmentに向いている。
今後の方向性としては、
・incorporate other feature as inputs (such as time taken)
・explore other educational impacts (hint generation, dropout prediction)
・validate hypotheses posed in education literature (such as spaced repetition, modeling how students forget)
・open-ended programmingとかへの応用とか(proramのvectorizationの方法とかが最近提案されているので)
などがある。
knewtonのグループが、DKTを既存手法であるIRTの変種やBKTの変種などでoutperformすることができることを示す:
https://arxiv.org/pdf/1604.02336.pdf
vanillaなDKTはかなりナイーブなモデルであり、今後の伸びが結構期待できると思うので、単純にoutperformしても、今後の発展性を考えるとやはりDKTには注目せざるを得ない感
DKT元論文では、BKTを大幅にoutperformしており、割と衝撃的な結果だったようだが、
後に論文中で利用されているAssistmentsデータセット中にdupilcate entryがあり、
それが原因で性能が不当に上がっていることが判明。
結局DKTの性能的には、BKTとどっこいみたいなことをRyan Baker氏がedXで言っていた気がする。
Deep Knowledge TracingなどのKnowledge Tracingタスクにおいては、
基本的に問題ごとにKnowledge Component(あるいは知識タグ, その問題を解くのに必要なスキルセット)が付与されていることが前提となっている。
ただし、このような知識タグを付与するには専門家によるアノテーションが必要であり、
適用したいデータセットに対して必ずしも付与されているとは限らない。
このような場合は、DKTは単なる”問題”の正答率予測モデルとして機能させることしかできないが、
知識タグそのものもNeural Networkに学習させてしまおうという試みが行われている:
https://www.jstage.jst.go.jp/article/tjsai/33/3/33_C-H83/_article/-char/ja
DKTに関する詳細な説明が書かれているブログポスト:
expectimaxアルゴリズムの説明や、最終的なoutput vector y_i の図解など、説明が省略されガチなところが詳細に書いてあって有用。(英語に翻訳して読むと良い)
https://hcnoh.github.io/2019-06-14-deep-knowledge-tracing
こちらのリポジトリではexpectimaxアルゴリズムによってvirtualtutorを実装している模様。
詳細なレポートもアップロードされている。
https://github.com/alessandroscoppio/VirtualIntelligentTutor
DKTのinputの次元数が 2 * num_skills, outputの次元数がnum_skillsだと明記されているスライド。
元論文だとこの辺が言及されていなくてわかりづらい・・・
http://gdac.uqam.ca/Workshop@EDM20/slides/LSTM_tutorial_Application.pdf
http://gdac.uqam.ca/Workshop@EDM20/slides/LSTM_Tutorial.pdf
こちらのページが上記チュートリアルのページ
http://gdac.uqam.ca/Workshop@EDM20/
[Paper Note] Unsupervised prediction of acceptability judgements, Lau+, ACL-IJCNLP'15
Paper/Blog Link My Issue
#NLP #LanguageModel #ACL #IJCNLP #One-Line Notes #Reference Collection Issue Date: 2018-03-30 Comment
文のacceptability(容認度)論文。
文のacceptabilityとは、native speakerがある文を読んだときに、その文を正しい文として容認できる度合いのこと。
acceptabilityスコアが低いと、Readabilityが低いと判断できる。
言語モデルをトレーニングし、トレーニングした言語モデルに様々な正規化を施すことで、acceptabilityスコアを算出する。
日本語解説: http://www.lr.pi.titech.ac.jp/~sasano/acl2015suzukake/slides/01.pdf
[Paper Note] An Empirical Exploration of Recurrent Network Architectures, Jozefowicz+, ICML'15
Paper/Blog Link My Issue
#NeuralNetwork #MachineLearning #Architecture #ICML #RecurrentModels #Initial Impression Notes Issue Date: 2018-02-19 Comment
GRUとLSTMの違いを理解するのに最適
[Paper Note] Improved Semantic Representations From Tree-Structured Long Short-Term Memory Networks, Kai Sheng Tai+, ACL-IJCNLP'15, 2015.02
Paper/Blog Link My Issue
#NeuralNetwork #NLP #ACL #IJCNLP #One-Line Notes #RecurrentModels #RecursiveModels Issue Date: 2018-02-13 GPT Summary- Tree-LSTMは、LSTMの構造を木構造に拡張し、文の関連性予測と感情分類で従来の全システムとLSTMベースラインを上回る性能を示す。 Comment
Tree-LSTM論文
[Paper Note] Collaborative Deep Learning for Recommender Systems, Hao Wang+, KDD'15
Paper/Blog Link My Issue
#RecommenderSystems #NeuralNetwork #CollaborativeFiltering #MatrixFactorization #SIGKDD #KeyPoint Notes #Reference Collection Issue Date: 2018-01-11 GPT Summary- 協調フィルタリング(CF)はレコメンダーシステムで広く用いられるが、評価がまばらな場合に性能が低下する。これに対処するため、補助情報を活用する協調トピック回帰(CTR)が提案されているが、補助情報がまばらな場合には効果が薄い。そこで、本研究では協調深層学習(CDL)という階層ベイズモデルを提案し、コンテンツ情報の深い表現学習とCFを共同で行う。実験により、CDLが最先端技術を大幅に上回る性能を示すことが確認された。 Comment
Rating Matrixからuserとitemのlatent vectorを学習する際に、Stacked Denoising Auto Encoder(SDAE)によるitemのembeddingを活用する話。
Collaborative FilteringとContents-based Filteringのハイブリッド手法。
Collaborative FilteringにおいてDeepなモデルを活用する初期の研究。
通常はuser vectorとitem vectorの内積の値が対応するratingを再現できるように目的関数が設計されるが、そこにitem vectorとSDAEによるitemのEmbeddingが近くなるような項(3項目)、SDAEのエラー(4項目)を追加する。
(3項目の意義について、解説ブログより)アイテム i に関する潜在表現 vi は学習データに登場するものについては推定できるけれど,未知のものについては推定できない.そこでSDAEの中間層の結果を「推定したvi」として「真の」 vi にできる限り近づける,というのがこの項の気持ち
cite-ulikeデータによる論文推薦、Netflixデータによる映画推薦で評価した結果、ベースライン(Collective Matrix Factorization [Paper Note] Relational learning via collective matrix factorization, Singh+, KDD'08
, SVDFeature [Paper Note] SVDFeature: a toolkit for feature-based collaborative filtering, Chen+, JMLR, Vol.13, 2012.12
, DeepMusic [Paper Note] Deep content-based music recommendation, Oord+, NIPS'13
, Collaborative Topic Regresison [Paper Note] Collaborative topic modeling for recommending scientific articles, Wang+, KDD'11
)をoutperform。
(下記は管理人が過去に作成した論文メモスライドのスクショ)




[Paper Note] A Neural Attention Model for Sentence Summarization, Rush+, EMNLP'15
Paper/Blog Link My Issue
#DocumentSummarization #NeuralNetwork #Sentence #Supervised #NLP #Abstractive #EMNLP Issue Date: 2017-12-31 Comment
[Paper Note] LCSTS: A Large Scale Chinese Short Text Summarization Dataset, Baotian Hu+, EMNLP'15, 2015.06
Paper/Blog Link My Issue
#Single #DocumentSummarization #NeuralNetwork #Sentence #Document #NLP #Dataset #Abstractive #EMNLP #KeyPoint Notes Issue Date: 2017-12-28 GPT Summary- 中国のマイクロブログSina Weiboから構築した200万以上の短文とその要約からなる大規模コーパスを紹介。手動でタグ付けされた10,666の要約を用いて、再帰型ニューラルネットワークを導入し、有望な要約生成結果を達成。提案コーパスは短文要約研究に有用であり、さらなる研究のベースラインを提供。 Comment
Large Chinese Short Text Summarization (LCSTS) datasetを作成
データセットを作成する際は、Weibo上の特定のorganizationの投稿の特徴を利用。
Weiboにニュースを投稿する際に、投稿の冒頭にニュースのvery short summaryがまず記載され、その後ニュース本文(短め)が記載される特徴があるので、この対をsource-reference対として収集した。
収集する際には、約100個のルールに基づくフィルタリングやclearning, 抽出等を行なっている。
データセットのpropertyとしては、下記のPartI, II, IIIに分かれている。
PartI: 2.4Mのshort text - summary pair
PartII: PartIからランダムにサンプリングされた10kのpairに対して、5 scaleで要約のrelevanceをratingしたデータ。ただし、各pairにラベルづけをしたevaluatorは1名のみ。
PartIII: 2kのpairに対して(PartI, PartIIとは独立)、3名のevaluatorが5-scaleでrating。evaluatorのratingが一致した1kのpairを抽出したデータ。
RNN-GRUを用いたSummarizerも提案している。
CopyNetなどはLCSTSを使って評価している。他にも使ってる論文あったはず。
ACL'17のPointer Generator Networkでした。
[Paper Note] Sentence Compression by Deletion with LSTMs, Fillipova+, EMNLP'15
Paper/Blog Link My Issue
#DocumentSummarization #NeuralNetwork #Sentence #NLP #EMNLP #Surface-level Notes Issue Date: 2017-12-28 Comment
slide: https://www.slideshare.net/akihikowatanabe3110/sentence-compression-by-deletion-with-lstms
[Paper Note] Auto-Encoding Variational Bayes, Diederik P Kingma+, ICLR'14, 2013.12
Paper/Blog Link My Issue
#MachineLearning #VariationalAutoEncoder #ICLR Issue Date: 2026-01-24 GPT Summary- 大規模データセットに対して効率的な推論と学習を実現するために、スケーラブルな確率的変分推論アルゴリズムを提案。変分下限の再パラメータ化により、標準的な確率勾配法で最適化可能な下限推定器を導出し、i.i.d.データセットにおける難しい事後分布の近似推論を効率的に行えることを示した。実験結果が理論的な利点を裏付けている。 Comment
openreview: https://openreview.net/forum?id=33X9fd2-9FyZd
VAEを提案した研究
日本語解説:
- makotomurakami.com/blog/2018/09/12/454/
-
https://musyoku.github.io/2016/04/29/auto-encoding-variational-bayes/
[Paper Note] Sequence to Sequence Learning with Neural Networks, Ilya Sutskever+, NIPS'14
Paper/Blog Link My Issue
#NeuralNetwork #NaturalLanguageGeneration #NLP #NeurIPS #Encoder-Decoder Issue Date: 2025-09-19 GPT Summary- DNNはシーケンス学習において優れた性能を示すが、シーケンス間のマッピングには限界がある。本研究では、LSTMを用いたエンドツーエンドのシーケンス学習アプローチを提案し、英語からフランス語への翻訳タスクで34.8のBLEUスコアを達成。LSTMは長文にも対応し、SMTシステムの出力を再ランク付けすることでBLEUスコアを36.5に向上させた。また、単語の順序を逆にすることで性能が向上し、短期的依存関係の最適化が容易になった。 Comment
いまさらながらSeq2Seqを提案した研究を追加
[Paper Note] Hierarchical Summarization: Scaling Up Multi-Document Summarization, Christensen+, ACL'14
Paper/Blog Link My Issue
#Multi #DocumentSummarization #NLP #Extractive #ACL #interactive #KeyPoint Notes #Hierarchical Issue Date: 2017-12-28 Comment
## 概要
だいぶ前に読んだ。好きな研究。
テキストのsentenceを階層的にクラスタリングすることで、抽象度が高い情報から、関連する具体度の高いsentenceにdrill downしていけるInteractiveな要約を提案している。
## 手法
通常のMDSでのデータセットの規模よりも、実際にMDSを使う際にはさらに大きな規模のデータを扱わなければならないことを指摘し(たとえばNew York Timesで特定のワードでイベントを検索すると数千、数万件の記事がヒットしたりする)そのために必要な事項を検討。
これを実現するために、階層的なクラスタリングベースのアプローチを提案。
提案手法では、テキストのsentenceを階層的にクラスタリングし、下位の層に行くほどより具体的な情報になるようにsentenceを表現。さらに、上位、下位のsentence間にはエッジが張られており、下位に紐付けられたsentence
は上位に紐付けられたsentenceの情報をより具体的に述べたものとなっている。
これを活用することで、drill down型のInteractiveな要約を実現。
[Paper Note] Query-Chain Focused Summarization, Baumel+, ACL'14
Paper/Blog Link My Issue
#Multi #DocumentSummarization #NLP #Dataset #QueryBiased #Extractive #ACL #Surface-level Notes Issue Date: 2017-12-28 Comment
(管理人が作成した過去の紹介資料)
[Query-Chain Focused Summarization.pdf](https://github.com/AkihikoWatanabe/paper_notes/files/1590916/Query-Chain.Focused.Summarization.pdf)
上記スライドは私が当時作成した論文紹介スライドです。スライド中のスクショは説明のために論文中のものを引用しています。
[Paper Note] The Mathematics of Statistical Machine Translation: Parameter Estimation, Brown+, CL'13
Paper/Blog Link My Issue
#MachineTranslation #NLP #Alignment #One-Line Notes Issue Date: 2018-01-15 Comment
IBMモデル論文。
[Paper Note] Deep content-based music recommendation, Oord+, NIPS'13
Paper/Blog Link My Issue
#RecommenderSystems #NeuralNetwork #MatrixFactorization #NeurIPS #KeyPoint Notes Issue Date: 2018-01-11 Comment
Contents-Basedな音楽推薦手法(cold-start problemに強い)。
Weighted Matrix Factorization (WMF) (Implicit Feedbackによるデータに特化したMatrix Factorization手法) [Paper Note] Collaborative filtering for implicit feedback datasets, Hu+, International Conference on Data Mining, 2008.12
に、Convolutional Neural Networkによるmusic audioのlatent vectorの情報が組み込まれ、item vectorが学習されるような仕組みになっている。
CNNでmusic audioのrepresentationを生成する際には、audioのtime-frequencyの情報をinputとする。学習を高速化するために、window幅を3秒に設定しmusic clipをサンプルしinputする。music clip全体のrepresentationを求める際には、consecutive windowからpredictionしたrepresentationを平均したものを使用する。
[Paper Note] ImageNet Classification with Deep Convolutional Neural Networks, Krizhevsky+, NIPS'12
Paper/Blog Link My Issue
#NeuralNetwork #ComputerVision #NeurIPS #ImageClassification #Backbone #One-Line Notes Issue Date: 2025-05-13 Comment
ILSVRC 2012において圧倒的な性能示したことで現代のDeepLearningの火付け役となった研究AlexNet。メモってなかったので今更ながら追加した。
AlexNet以前の画像認識技術については牛久先生がまとめてくださっている(当時の課題とそれに対する解決法、しかしまだ課題が…と次々と課題に直面し解決していく様子が描かれており非常に興味深かった)。現在でも残っている技術も紹介されている。:
https://speakerdeck.com/yushiku/pre_alexnet
> 過去の技術だからといって聞き流していると時代背景の変化によってなし得たイノベーションを逃すかも
これは肝に銘じたい。
[Paper Note] Collaborative topic modeling for recommending scientific articles, Wang+, KDD'11
Paper/Blog Link My Issue
#RecommenderSystems #CollaborativeFiltering #MatrixFactorization #SIGKDD #KeyPoint Notes Issue Date: 2018-01-11 Comment
Probabilistic Matrix Factorization (PMF) [Paper Note] Probabilistic Matrix Factorization, Salakhutdinov+, NIPS'08
に、Latent Dirichllet Allocation (LDA) を組み込んだCollaborative Topic Regression (CTR)を提案 (Figure2)。
LDAによりitemのlatent vectorを求め、このitem vectorと、user vectorの内積を(平均値として持つ正規表現からのサンプリング)用いてratingを生成する(式6)。
CFとContents-basedな手法が双方向にinterationするような手法
[Paper Note] Collaborative Filtering Recommender Systems, Ekstrand+ (with Joseph A. Konstan), Foundations and TrendsR in Human–Computer Interaction'11
Paper/Blog Link My Issue
#RecommenderSystems #Survey Issue Date: 2018-01-01
[Paper Note] Summarize What You Are Interested In: An Optimization Framework for Interactive Personalized Summarization, Yan+, EMNLP'11, 2011.07
Paper/Blog Link My Issue
#Multi #PersonalizedDocumentSummarization #DocumentSummarization #InteractivePersonalizedSummarization #NLP #Personalization #EMNLP #interactive #KeyPoint Notes Issue Date: 2017-12-28 Comment
ユーザとシステムがインタラクションしながら個人向けの要約を生成するタスク、InteractivePersonalizedSummarizationを提案。
ユーザはテキスト中のsentenceをクリックすることで、システムに知りたい情報のフィードバックを送ることができる。このとき、ユーザがsentenceをクリックする量はたかがしれているので、click smoothingと呼ばれる手法を提案し、sparseにならないようにしている。click smoothingは、ユーザがクリックしたsentenceに含まれる単語?等を含む別のsentence等も擬似的にclickされたとみなす手法。
4つのイベント(Influenza A, BP Oil Spill, Haiti Earthquake, Jackson Death)に関する、数千記事のニュースストーリーを収集し(10k〜100k程度のsentence)、評価に活用。収集したニュースサイト(BBC, Fox News, Xinhua, MSNBC, CNN, Guardian, ABC, NEwYorkTimes, Reuters, Washington Post)には、各イベントに対する人手で作成されたReference Summaryがあるのでそれを活用。
objectiveな評価としてROUGE、subjectiveな評価として3人のevaluatorに5scaleで要約の良さを評価してもらった。
結論としては、ROUGEはGenericなMDSモデルに勝てないが、subjectiveな評価においてベースラインを上回る結果に。ReferenceはGenericに生成されているため、この結果を受けてPersonalizationの必要性を説いている。
また、提案手法のモデルにおいて、Genericなモデルの影響を強くする(Personalizedなハイパーパラメータを小さくする)と、ユーザはシステムとあまりインタラクションせずに終わってしまうのに対し、Personalizedな要素を強くすると、よりたくさんクリックをし、結果的にシステムがより多く要約を生成しなおすという結果も示している。
Recurrent neural network based language model, Mikolov+, Interspeech'10
Paper/Blog Link My Issue
#NeuralNetwork #NLP #LanguageModel #Interspeech Issue Date: 2025-09-19 Comment
RNN言語モデル論文
[Paper Note] Factorization Machines, Steffen Rendle, ICDM'10, 2010.12
Paper/Blog Link My Issue
#RecommenderSystems #MachineLearning #CollaborativeFiltering #FactorizationMachines #ICDM #KeyPoint Notes #Reference Collection Issue Date: 2018-12-22 Comment
解説ブログ:
http://echizen-tm.hatenablog.com/entry/2016/09/11/024828
DeepFMに関する動向:
https://data.gunosy.io/entry/deep-factorization-machines-2018
上記解説ブログの概要が非常に完結でわかりやすい

FMのFeature VectorのExample
各featureごとにlatent vectorが学習され、featureの組み合わせのweightが内積によって表現される
Matrix Factorizationの一般形のような形式
Content-based Recommender Systems: State of the Art and Trends, Lops+, Recommender Systems Handbook'10
Paper/Blog Link My Issue
#RecommenderSystems #Survey #One-Line Notes Issue Date: 2018-01-01 Comment
RecSysの内容ベースフィルタリングシステムのユーザプロファイルについて知りたければこれ
[Paper Note] ImageNet: A Large-Scale Hierarchical Image Database, Deng+, CVPR'09
Paper/Blog Link My Issue
#ComputerVision #Dataset #ImageClassification #ObjectRecognition #ObjectLocalization Issue Date: 2025-05-13
[Paper Note] BPR: Bayesian Personalized Ranking from Implicit Feedback, Steffen Rendle+, UAI'09, 2009.06
Paper/Blog Link My Issue
#RecommenderSystems #LearningToRank #ImplicitFeedback #UAI #KeyPoint Notes Issue Date: 2017-12-28 GPT Summary- アイテム推薦において、暗黙的フィードバックを用いた個別のランキング予測のために、BPR-Optという新しい最適化基準を提案。ブートストラップサンプリングを用いた確率的勾配降下法に基づく学習アルゴリズムを提供し、行列因子分解とk近傍法に適用。実験結果は、提案手法が従来の技術を上回ることを示し、モデル最適化の重要性を強調。 Comment
重要論文
ユーザのアイテムに対するExplicit/Implicit Ratingを利用したlearning2rank。
AUCを最適化するようなイメージ。
負例はNegative Sampling。
計算量が軽く、拡張がしやすい。
Implicitデータを使ったTop-N Recsysを構築する際には検討しても良い。
また、MFのみならず、Item-Based KNNに活用することなども可能。
http://tech.vasily.jp/entry/2016/07/01/134825
参考: https://techblog.zozo.com/entry/2016/07/01/134825
pytorchでのBPR実装: https://github.com/guoyang9/BPR-pytorch
[Paper Note] A unified architecture for natural language processing: Deep neural networks with multitask learning, Collobert+, ICML'08
Paper/Blog Link My Issue
#NeuralNetwork #NLP #MultitaskLearning #ICML #One-Line Notes Issue Date: 2018-02-05 Comment
Deep Neural Netを用いてmultitask learningを行いNLPタスク(POS tagging, Semantic Role Labeling, Chunking etc.)を解いた論文。
被引用数2000を超える。
multitask learningの学習プロセスなどが引用されながら他論文で言及されていたりする。
[Paper Note] Probabilistic Matrix Factorization, Salakhutdinov+, NIPS'08
Paper/Blog Link My Issue
#RecommenderSystems #MatrixFactorization #NeurIPS #One-Line Notes Issue Date: 2018-01-11 Comment
Matrix Factorizationを確率モデルとして表した論文。
解説:
http://yamaguchiyuto.hatenablog.com/entry/2017/07/13/080000
既存のMFは大規模なデータに対してスケールしなかったが、PMFではobservationの数に対して線形にスケールし、さらには、large, sparse, imbalancedなNetflix datasetで良い性能が出た(Netflixデータセットは、rating件数が少ないユーザとかも含んでいる。MovieLensとかは含まれていないのでより現実的なデータセット)。
また、Constrained PMF(同じようなsetの映画にrateしているユーザは似ているといった仮定に基づいたモデル[^1])を用いると、少ないratingしかないユーザに対しても良い性能が出た。
[^1]: ratingの少ないユーザの潜在ベクトルは平均から動きにくい、つまりなんの特徴もない平均的なユーザベクトルになってしまうので、同じ映画をratingした人は似た事前分布を持つように制約を導入したモデル
Large Language Models in Machine Translation, Brants+, EMNLP-CoNLL'07
Paper/Blog Link My Issue
#MachineTranslation #NLP #LanguageModel #One-Line Notes Issue Date: 2024-12-24 GPT Summary- 本論文では、機械翻訳における大規模な統計的言語モデルの利点を報告し、最大2兆トークンでトレーニングした3000億n-gramのモデルを提案。新しいスムージング手法「Stupid Backoff」を導入し、大規模データセットでのトレーニングが安価で、Kneser-Neyスムージングに近づくことを示す。 Comment
N-gram言語モデル+スムージングの手法において、学習データを増やして扱えるngramのタイプ数(今で言うところのvocab数に近い)を増やしていったら、perplexityは改善するし、MTにおけるBLEUスコアも改善するよ(BLEUはサチってるかも?)という考察がされている
元ポスト:
Large Language Modelsという用語が利用されたのはこの研究が初めてなのかも…?
[Paper Note] A study of global inference algorithms in multi-document summarization, Ryan McDonald, ECIR'07
Paper/Blog Link My Issue
#Multi #DocumentSummarization #Document #NLP #IntegerLinearProgramming (ILP) #Extractive #ECIR #One-Line Notes Issue Date: 2018-01-17 Comment
文書要約をナップサック問題として定式化し、厳密解(動的計画法、ILP Formulation)、近似解(Greedy)を求める手法を提案。
[Paper Note] Learning to Rank: From Pairwise Approach to Listwise Approach (ListNet), Cao+, ICML'07
Paper/Blog Link My Issue
#InformationRetrieval #LearningToRank #ListWise #ICML #KeyPoint Notes Issue Date: 2018-01-01 Comment
解説スライド:
http://www.nactem.ac.uk/tsujii/T-FaNT2/T-FaNT.files/Slides/liu.pdf
解説ブログ:
https://qiita.com/koreyou/items/a69750696fd0b9d88608
従来行われてきたLearning to Rankはpairwiseな手法が主流であったが、pairwiseな手法は2つのインスタンス間の順序が正しく識別されるように学習されているだけであった。
pairwiseなアプローチには以下の問題点があった:
* インスタンスのペアのclassification errorを最小化しているだけで、インスタンスのランキングのerrorを最小化しているわけではない。
* インスタンスペアが i.i.d な分布から生成されるという制約は強すぎる制約
* queryごとに生成されるインスタンスペアは大きく異なるので、インスタンスペアよりもクエリに対してバイアスのかかった学習のされ方がされてしまう
これらを解決するために、listwiseなアプローチを提案。
listwiseなアプローチを用いると、インスタンスのペアの順序を最適化するのではなく、ランキング全体を最適化できる。
listwiseなアプローチを用いるために、Permutation Probabilityに基づくloss functionを提案。loss functionは、2つのインスタンスのスコアのリストが与えられたとき、Permutation Probability Distributionを計算し、これらを用いてcross-entropy lossを計算するようなもの。
また、Permutation Probabilityを計算するのは計算量が多すぎるので、top-k probabilityを提案。
top-k probabilityはPermutation Probabilityの計算を行う際のインスタンスをtop-kに限定するもの。
論文中ではk=1を採用しており、k=1はsoftmaxと一致する。
パラメータを学習する際は、Gradient Descentを用いる。
k=1の設定で計算するのが普通なようなので、普通にoutputがsoftmaxでlossがsoftmax cross-entropyなモデルとほぼ等価なのでは。
[Paper Note] A Survey of Explanations in Recommender Systems, Tintarev+, ICDEW'07
Paper/Blog Link My Issue
#RecommenderSystems #Survey #Explanation Issue Date: 2018-01-01
[Paper Note] Matrix Factorization Techniques for Recommender Systems, Koren+, Computer'07
Paper/Blog Link My Issue
#RecommenderSystems #Survey #CollaborativeFiltering #MatrixFactorization #Reading Reflections Issue Date: 2018-01-01 Comment
Matrix Factorizationについてよくまとまっている
[Paper Note] Frustratingly easy domain adaptation, Daum'e, ACL'07
Paper/Blog Link My Issue
#MachineLearning #DomainAdaptation #NLP #ACL #KeyPoint Notes Issue Date: 2017-12-31 Comment

domain adaptationをする際に、Source側のFeatureとTarget側のFeatureを上式のように、Feature Vectorを拡張し独立にコピーし表現するだけで、お手軽にdomain adaptationができることを示した論文。
イメージ的には、SourceとTarget、両方に存在する特徴は、共通部分の重みが高くなり、Source, Targetドメイン固有の特徴は、それぞれ拡張した部分のFeatureに重みが入るような感じ。
[Paper Note] An Architecture for Data to Text Systems, Ehud Reiter, ENLG'07
Paper/Blog Link My Issue
#Survey #NaturalLanguageGeneration #NLP #DataToTextGeneration #ConceptToTextGeneration #One-Line Notes Issue Date: 2017-12-31 Comment
NLG分野で有名なReiterらのSurvey。
NLGシステムのアーキテクチャなどが、体系的に説明されている。
[Paper Note] Learning to Rank using Gradient Descent (RankNet), Burges+, ICML'05
Paper/Blog Link My Issue
#InformationRetrieval #LearningToRank #PairWise #ICML #One-Line Notes Issue Date: 2018-01-01 Comment
pair-wiseのlearning2rankで代表的なRankNet論文
解説ブログ:
https://qiita.com/sz_dr/items/0e50120318527a928407
lossは2個のインスタンスのpair、A, Bが与えられたとき、AがBよりも高くランクされる場合は確率1, AがBよりも低くランクされる場合は確率0、そうでない場合は1/2に近くなるように、スコア関数を学習すれば良い。
[Paper Note] Toward the next generation of recommender systems: a survey of the state-of-the-art and possible extensions, Adomavicius+, IEEE Transactions on Knowledge and Data Engineering'05
Paper/Blog Link My Issue
#RecommenderSystems #Survey Issue Date: 2018-01-01 Comment
有名なやつ
[Paper Note] TextRank: Bringing Order into Texts, Mihalcea+, EMNLP'04
Paper/Blog Link My Issue
#Single #DocumentSummarization #Document #GraphBased #NLP #Extractive #EMNLP #KeyPoint Notes Issue Date: 2018-01-01 Comment
PageRankベースの手法で、キーワード抽出/文書要約 を行う手法。
キーワード抽出/文書要約 を行う際には、ノードをそれぞれ 単語/文 で表現する。
ノードで表現されている 単語/文 のsimilarityを測り、ノード間のedgeの重みとすることでAffinity Graphを構築。
あとは構築したAffinity Graphに対してPageRankを適用して、ノードの重要度を求める。
ノードの重要度に従いGreedyに 単語/文 を抽出すれば、キーワード抽出/文書要約 を行うことができる。
単一文書要約のベースラインとして使える。
gensimに実装がある。
個人的にも実装している:https://github.com/AkihikoWatanabe/textrank
[Paper Note] Evaluating Collaborative Filtering Recommener Systems, Herlocker+, TOIS'04
Paper/Blog Link My Issue
#RecommenderSystems #Survey #Evaluation Issue Date: 2018-01-01 Comment
GroupLensのSurvey
[Paper Note] PRanking with Ranking, Crammer+, NIPS'01
Paper/Blog Link My Issue
#InformationRetrieval #LearningToRank #PointWise #NeurIPS #One-Line Notes Issue Date: 2018-01-01 Comment
Point-WiseなLearning2Rankの有名手法
[Paper Note] Item-based collaborative filtering recommendation algorithms, Sarwar+(with Konstan), WWW'01, 2021.04
Paper/Blog Link My Issue
#RecommenderSystems #CollaborativeFiltering #ItemBased #WWW #One-Line Notes Issue Date: 2018-01-01 Comment
アイテムベースな協調フィルタリングを提案した論文(GroupLens)
[Paper Note] Cut and paste based text summarization, Jing+, NAACL'00
Paper/Blog Link My Issue
#DocumentSummarization #Document #NLP #NAACL #One-Line Notes Issue Date: 2018-01-21 Comment
AbstractiveなSummarizationの先駆け的研究。
AbstractiveなSummarizationを研究するなら、押さえておいたほうが良い。
[Paper Note] The Use of MMR, Diversity-Based Reranking for Reordering Documents and Producing Summaries, Carbonell+, SIGIR'98
Paper/Blog Link My Issue
#DocumentSummarization #InformationRetrieval #NLP #Search #SIGIR #KeyPoint Notes Issue Date: 2018-01-17 Comment
Maximal Marginal Relevance (MMR) 論文。
検索エンジンや文書要約において、文書/文のランキングを生成する際に、既に選んだ文書と類似度が低く、かつqueryとrelevantな文書をgreedyに選択していく手法を提案。
ILPによる定式化が提案される以前のMulti Document Summarization (MDS) 研究において、冗長性の排除を行う際には典型的な手法。
[Paper Note] Automatic condensation of electronic publications by sentence selection, Brandow+, Information Processing & Management'95, 1995.09
Paper/Blog Link My Issue
#Single #DocumentSummarization #Document #NLP #Extractive #One-Line Notes Issue Date: 2018-01-01 Comment
報道記事要約において、自動要約システムがLead文に勝つのがhardだということを示した研究
Introducing Clef: our open-source decision models, and new RL fine-tuning platform, Cloudflare, 2026.10
Paper/Blog Link My Issue
#Article #ComputerVision #EfficiencyImprovement #NLP #LanguageModel #MultiModal #Blog #PEFT(Adaptor/LoRA) #OpenWeight #Encoder #KeyPoint Notes #SystemOneModel Issue Date: 2026-10-02 Comment
元ポスト:
概要しかブログ中には書いていないが、よさげに見える。
Qwen-3.8-27Bをバックボーンとし、Qwenのパラメータはフリーズした上で軽量なアダプタを学習し、ルーティングヘッドなるcross-attentionに基づいた各選択肢のスコアを出力するヘッドによって予測が実施されるようである。
これらは、内部で作成された合成データを用いて事後学習されたとのことである。lossはlabel smoothed cross entropy(正解、不正解ラベルを0/1としてクロスエントロピーを計算するのではなく、ハイパーパラメータεでスムージングしてlossを計算するものらしい)とBrier Loss(実際に予測された確率値と正解、不正解を1/0としたときの平均二乗誤差)なるものによって、正則化によって過学習を防止し、出力される確率値がでたらめにならないように学習することを目指しているように見える。
その後RLCDと呼ばれる、選択肢間の順序関係に基づいて、正解と隣接するラベルにも部分的に報酬を与えるようなrewardを持つ(オリジナルのポリシーから分布が大きくシフトしないようなペナルティ付き)RLによって学習をしているようである。これにより、より高いAccuracyと汎化性能が得られた、と一言記述されている。
Qwenが持つVision Encoderによって画像もエンコードでき(Jevは画像は不可と述べられている)、
context長が64kとJevの2倍で
Jevよりもlatencyが良く、
様々なベンチマークスコアで高いスコアを獲得としている、と報告している。
latencyはflashモデルであれば、DiffusionGemma-as-Jevを上回る。
[Paper Note] AutoBenchmark: benchmark creation & the role of humans, Seungone+, 2026.09
Paper/Blog Link My Issue
#Article #NLP #Dataset #AIAgents #Evaluation #read-later #autoresearch/RSI #Author Thread-Post Issue Date: 2026-10-01 Comment
元ポスト:
dlab Open Source Week: Frontier AI on Your Own Hardware, Tim Dettmers, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Blog #Test-Time Scaling #DeepResearch #Compression #Reading Reflections #autoresearch/RSI Issue Date: 2026-09-29 Comment
元ポスト:
前半にオープンソースにするエコシステムとして
- エージェントのcontextの自動圧縮技術
- autonomous research
- 効率的なtest time scaling手法
- Deep Research
などの開発中におけるエピソードや、その性能の高さについて述べられている。
一方、記事全体で述べられている気持ちは博士課程在籍者(やアカデミアにいる研究者に)対するメッセージである。個人的に印象深かったのは、研究のunitが論文ではなく一貫性のあるエコシステムを構築することになる、という主張と、博士課程において容易に解決することができない課題に粘り強く取り組む力を身につけることは投資をする価値がある、という部分で、第一線の研究者の方がAI Agentによる研究環境の変化をどう捉えているかが少し垣間見えるのと、(現在の悲観的な博士課程の学生に対して)博士課程で学ぶことの価値やアカデミアだからこそなし得ることがメッセージングされており、非常に興味深く拝読した。
要約を読んだりするよりも、原文から伝わる気持ちを汲み取った方が良いと思う(という意味で原文全文を読んだ方が良いと思う)。
When Do Larger Batches Help Scale LLM Reinforcement Learning?, Tencent RL Team, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #ReinforcementLearning #Blog #PostTraining #One-Line Notes #CriticalBatchSize Issue Date: 2026-09-24 Comment
元ポスト:
目標性能まで到達するまでに必要なwall-clock timeとLLMでのオンポリシーRLのバッチサイズの関係性を明らかにしているようである。
LLMのオンポリシーRLでは、生成と学習においてバッチサイズの大きさが非対称に働く(すなわち、生成側の並列数を増やすとモデルの重み転送をより多く共有できるため処理に要する時間が短縮されるが、学習側でバッチサイズが増えると処理時間は増加する)ため、生成側の並列数の変化によるスループットの向上と、学習側のバッチサイズによる更新に必要なサンプル数の両方を考える必要がある。
このとき、目標性能に到達するまでに必要な累積応答数N(学習側)、エンドツーエンドのスループットq(生成側だけではなくシステム全体)を考える。
これにより、バッチサイズを変化させた時に必要なサンプル数の変化の比率r_N (=N/N_pivot, r_Nが1より大きい場合は、新たなバッチサイズが基準となるバッチサイズよりも、ある性能に到達するまでより多くの応答を必要とする)、
スループットの変化の比率r_q(=q/q_pivot, r_q>1の場合は、1秒あたりにより多くの応答を処理できる)を定義でき、
r_q > r_Nの場合、すなわち、バッチサイズを大きくしたことによる、システムのエンドツーエンドのスループット向上による恩恵が、学習側のサンプルコストの悪化を上回った場合に、バッチサイズを大きくすることで学習が高速化される、このときの改善の度合いは r_N/r_q で測ることができる。例えば、r_N/r_q=0.8の場合、学習時間が20%削減されることを意味する、といったフレームワークを定義でき (The criterion部分を参照)、
実践的には、
- 候補となるバッチサイズについて、学習率や関連するハイパーパラメータを調整し、学習に利用される応答単位での学習に対する寄与を揃え、累積応答数が等しい点での学習曲線を比較することで、r_Nを推定し
- 与えられたバッチサイズにおいてシステムのスループットを最大化する設定を探索し、r_qを測定する
- その上で、r_N/r_qを測定し、最も学習時間が短縮されるバッチサイズを採用する
というプロセスにおとしこむことができる(conclusionを参照)
という感じの話のようにみえる。
grug-moe-mix-swarm, marin-community, 2026.08
Paper/Blog Link My Issue
#Article #Pretraining #NLP #Dataset #LanguageModel #MoE(Mixture-of-Experts) #DataMixture #One-Line Notes #Reading Reflections #Author Thread-Post Issue Date: 2026-09-24 Comment
元ポスト:
Marinの535B級のMoEモデルを学習した際のデータであり、利用されたツール(クラスタリングに利用されたモデル)も公開されている。
元ポスト中にデータ構築の手順が紹介されており、
- 学習が許可された152の公開データから、25Tトークンを利用
- deduplicationによる2.13T tokensを除外し
- 評価データとの重複を避けるために13-gramによるフィルタリングを実施し
- 特定の分野のデータ等をサンプリングしたいが、その際にソースではなくドキュメントの内容でグルーピングしたいので、embeddingに基づいてクラスタリングを実施し、200のクラスタを形成した
といった話が紹介されている。
LLM-jpではOpenSourceであるために、徹底的にデータセット内部まで精査をして、問題のあるインスタンスの修正等が実施されていたが、Marinではこのような取り組みは行われているのだろうか。特に、データセットに付与されているライセンスがオープンソースである場合でも、データセット、あるいはデータセット中のサンプルの出自を辿るとオープンソースとは呼べないものが存在するという話がある。
- 約12兆トークンの良質なコーパスで学習した新たな国産LLM「LLM-jp-4 8Bモデル」「LLM-jp-4 32B-A3Bモデル」をオープンソースライセンスで公開 ~一部ベンチマークでGPT-4oやQwen3-8Bを上回る性能を達成~, NII, 2026.04
- LLM-jp-4-VL 9Bリリース, LLM-jp, 2026.09
Marinコミュニティにおける"Open"の意味を読むと、Open Sourceの定義を満たすことを目指しているというより、weightを公開するだけではなく、その他の構築に関わる全ての情報を公開する、たとえば学習データであれば全データのソースを開示する、という開発プロセス全体を公開しますよ、という意味に見えるため、ライセンス的に問題のあるインスタンスの削除などは行われていないのかもしれない、が、Marinプロジェクトの公開されている全ての議論の中にそういった話題は存在するかもしれないので実際のところは一次ソースを当たらないとよくわからない。
https://marin.community
Contrastive Language Models: A System One Model for Fast and Generalizable Decision-Making, Kwok+, 2026.09
Paper/Blog Link My Issue
#Article #Pretraining #NLP #Dataset #ContrastiveLearning #Blog #OpenWeight #Scaling Laws #mid-training #PostTraining #Encoder #Author Thread-Post #SystemOneModel Issue Date: 2026-09-24 Comment
元ポスト:
HF: https://huggingface.co/Contrastive-LM
非常にコンパクトにまとまっていて大変読みやすかった。あとでまとめる。
Introducing GPT‑6 Sol and Luna, OpenAI, 2026.09
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #LanguageModel #Blog #Proprietary #VisionLanguageModel #Initial Impression Notes Issue Date: 2026-09-23 Comment
元ポスト:
luna, solに関しては、AA Index上では大きな変化はないように見えるが、コスト性能比が改善しているように見える:
5.6-luna, solと比較するとコストが約半額となっている。やーすい
Introducing Claude Opus 5.5, Anthropic, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Blog #Proprietary #VisionLanguageModel #Reference Collection Issue Date: 2026-09-23 Comment
元ポスト:
KernelBench-MegaのRTX PRO 6000向けにKimi Linearのデコード向けのメガカーネルを記述するベンチマークでAstraを超えてSoTAを達成したようである:
所見:
所見:
GPTはeffortの増加に従い単調増加だが、Claude系はそうならない
Introducing MiMo-V2.6 series, Xiaomi, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #read-later #Reference Collection #Author Thread-Post Issue Date: 2026-09-23 Comment
HF: https://huggingface.co/collections/XiaomiMiMo/mimo-v26
元ポスト:
所見:
Mimo-2.6はSWA+GQAのシンプルなアーキテクチャであり、それでOpenWeightモデルでSoTAを達成しており、進歩の多くはデータと事後学習のレシピの改善によってもたらされているという主張。
DeepSeekでも同じような報告がされている:
- DeepSeek-V4.1-Flash, DeepSeek AI, 2026.09
事前学習でも以下のような話はある:
- Pretraining progress is mostly coming from data, DWARKESH PATEL AND JERRY HAN, 2026.09
関連:
- We are streaming our RL big runs. The mimo-v2.6 series is coming soon, Xiaomi Mimo Team, 2026.09
開発者の方のポスト:
所見:
AA IndexでGPT-5.6-Solと同等性能を達成し、7kのRL dataとフレームワークをオープンにする予定とのこと。
所見:
解説:
- MAI-Thinking-1: Building a Hill-Climbing Machine, Microsoft, 2026.06
もあわせて読みたい
Step 5 Preview: Advancing the Pareto Frontier, StepFun, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #OpenWeight #VisionLanguageModel #One-Line Notes #Author Thread-Post Issue Date: 2026-09-20 Comment
元ポスト:
StepFunのフラグシップモデルで、Fable 5, GPT-5.6-luna, GLM-5.3、Kimi-K3と並びAAの評価においてパレート最適に位置する。
600B-A27B, 1M contextのVLM, 10/15にOpenWeight化されるとのこと。
Needle 3 Automation Foundation Model For Tiny Devices, Cactus, 2026.09
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #LanguageModel #Transformer #Blog #SmallModel #Proprietary #Architecture #One-Line Notes #ToolUse #Author Thread-Post #SystemOneModel Issue Date: 2026-09-19 Comment
元ポスト:
チャットをせず、各ターンごとに関数呼び出しに特化したedge向け小型モデルとのこと。アプリが利用するツール群を渡し、ユーザの発言に基づいて全ての引数を埋めて関数を呼び出す、あるいはスキーマを与えればそのスキーマに則った出力を返し(構造化出力)、推測はしない(関数の範囲外のものは空出力)というもののようである。
これらは、simple attention networkと呼ばれるもので実現される。simple attention networkはtransformerからFFN Layerをを無くし軽量なHadarmard MLPというlayerに置き換え、FFNが従来保持していた知識に関する情報はengramによって、n-gram embedding側に持たせることによって高速、軽量化がじつげんされているようである。residual streamとしては、mHCが用いられているようである。
また、デプロイ時にモデルの深さを指定することで、20個あるうちのどのlayerを利用するかが決まり、性能とコストを調整できるようである。これを公式ポストではIntelligence Laddersと呼称している。
関連:
- [Paper Note] Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models, Xin Cheng+, arXiv'26, 2026.01
- [Paper Note] mHC: Manifold-Constrained Hyper-Connections, Zhenda Xie+, arXiv'25, 2025.12
関連:
- Introducing System One Models & Jev, TypeSafe AI, 2026.09
と思想が似ている。
Introducing Bonsai 2 27B: Near-Lossless Compression in a 9x Smaller Footprint, PrismML, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Quantization #Blog #OpenWeight #ComputerUse #reading #One-Line Notes #Author Thread-Post Issue Date: 2026-09-18 Comment
元ポスト:
HF: https://huggingface.co/collections/prism-ml/bonsai-2
関連:
- Announcing Bonsai 27B: The First 27B-Class Model to Run on a Phone, PrismRL, 2026.07
ternary weight (1bit)の重みで動作するBonsaiシリーズのメジャーアップデートで、Qwen-3.8-27Bをベースにしており、ベンチマークスコアの98.2パーセントを保持しつつ、1/9程度に利用メモリが節約されるようである。Computer Useも可能で、ローカルのRTX 5090でBrowser Useするデモが掲載されている。
【ノーカット】AIに関わる米中戦争と日本の現状 国立情報研 佐藤教授, 時事通信映像センター, 2026.09
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #LanguageModel #Alignment #AIAgents #GenerativeAI #FoundationModel #Safety #Video #VisionLanguageModel #Robotics #WorldModels #VisionLanguageActionModel #EmbodiedAI #Reading Reflections #WorldActionModel Issue Date: 2026-09-18 Comment
非常におもしろかった...色々と考えさせられるなあ。
特にフィジカルAIにおいて、中国は人海戦術で、(簡単な動作を学習できたら複雑な動作を実現することにつながるという仮説の元)非専門家の簡単な動作に関するデータを大量に収集し、最近では仮想環境でデータを合成し活用する動きがある(Sim-to-Real)に対して、日本の場合は、特定の企業の現場のデータを収集しようとする動きがある。(このような文脈において、日本の政策として考えた場合に)特定の企業が有する現場のデータは、その現場特有の特徴が入り込むから実はロボットの学習データに向いていない、という話は、なるほど、と思うなどした。
たとえば、
- [Paper Note] Open X-Embodiment: Robotic Learning Datasets and RT-X Models, Open X-Embodiment Collaboration+, arXiv'23, 2023.10
- [Paper Note] LeRobot: An Open-Source Library for End-to-End Robot Learning, Remi Cadene+, ICLR'26, 2026.02
のように、多様なデータを統一された枠組みで学習をすることで汎化することを狙うという戦略の場合は、現場データの現場特有のバイアス問題はどの程度緩和されるのだろうか。
- Superposition, Memorization, and Double Descent, Transformer Circuits Thread, 2023.01
のDouble Decentのような議論を考えると、同じ種別のデータで、きちんと多様なデータが集まっていれば、現場固有のバイアスが含まれていても汎用的な特徴量としては学習されずらい、という現象は起こるように思える。
また、仮想空間と実世界のgapもあるようで、視覚的なgapは合成データ等で埋め合わせがある程度できそうな一方で、触覚や力感のような繊細な部分や、物理的なセンサーのノイズや、実際のデバイスの物理的な個体差のようなものは、仮想空間上では再現しづらいという話もあるようである。
ただ、なんとなーく、まず汎用的なモデルを学習して基礎的な動作(LLMで言うところのatomic skill)を満足にできる基盤モデルを用意し(これはおそらく仮想空間や非専門家データで足りる)、その基盤モデルはin-context learning能力を備えていて、現場のロボットに適用する際にはfew-shotのdemonstrationや、ルーブリックのようなものを与えて制御する、というのでうまくいくシナリオは起きそうな気がしており、そうなると大量の現場データは必ずしも必要ではなさそうだよね、という気はする。
ただし、日本が人海戦術をとれないのであれば、汎用基盤モデル→現場での適用、というレールの上に乗るのであれば、直接的に汎化させるには専門的すぎる現場のデータが与えられたときに、そこからどのようにして汎用的な基盤モデルを学習できるのか、というところがうまくいけば、ある程度形になるのではなかろうか、と思うなどした。
Lean Verified Transformers, Sasha Rush, 2026.09
Paper/Blog Link My Issue
#Article #Analysis #NLP #Transformer #Blog #reading #One-Line Notes #Proofs #Reading Reflections #Author Thread-Post Issue Date: 2026-09-17 Comment
元ポスト:
証明のコストが下がることによって、Leanによって型式的な証明をされたML Codeの価値が高まるのではないかという筆者の予測と、
一方で、証明を全て理解することは依然として困難という課題があるのとに言及し、
落とし所として人間にとって理解しやすい(部分的に証明したい)数学的な性質を選択的にAIによって証明するという試みをやってみよう、
そのために、Transformerを例に、Transformerの最適化や効率化の礎となっている数学的な性質を実際にLeanを用いて型式的に証明し理解してみよう、その結果、たとえば、VanillaAttentionとFlashAttentionが数学的に等価だということも示せる、
このような証明したい性質が何であるかを人間が選び、証明を得られることになった変化は重要であり、これらを今後どう活用するかということは今後の挑戦だよね、という話が書かれているようである。
実際に駆動するML Codeで、特定のモデルが実装されているときに、そのモデルが本来備えるべき重要な数学的性質を満たす実装になっていることが、型式的に証明された上で公開され、型式的に証明済みのbadgeがリポジトリに付与されている、みたいな未来が来るのだろうなあ
We are streaming our RL big runs. The mimo-v2.6 series is coming soon, Xiaomi Mimo Team, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #ReinforcementLearning #AIAgents #Blog #PostTraining #One-Line Notes #Reading Reflections #Author Thread-Post Issue Date: 2026-09-17 Comment
元ポスト:
リアルタイムでMimoのRLの学習の経過が公開されている。おもしろい
コストの試算:
Mimo, 1T-A42Bの場合、RL 1stepあたり1000万円程度かかっているようだ。
おそらくインフラは高度に最適化されている。
現時点で2モデル合計でコストが約300万ドルに到達し、日本円にして約4.7億円(ドル円157円換算, pro 68B / flash 81B Tokens)🙄DeepSWEやコーディング系のベンチは順調にスコアが向上している。また、noticesに記載されているインシデントの報告が興味深く、インフラ周りのエラーや、学習に悪影響を与えるタスクやデータセット単位での除去なども情報共有されており大変興味深い。PostTrainingデータセットなどMixtureも公開されている。
Scaling laws in large language models and toy models, Nicolas Zucchet, 2026.09
Paper/Blog Link My Issue
#Article #Tutorial #NLP #LanguageModel #Slide #Scaling Laws #reading #Author Thread-Post Issue Date: 2026-09-16 Comment
元ポスト:
Introducing System One Models & Jev, TypeSafe AI, 2026.09
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #AIAgents #Blog #Coding #SoftwareEngineering #reading #KeyPoint Notes #Reference Collection #Reading Reflections #SystemOneModel Issue Date: 2026-09-16 Comment
細かいことは全くわからないが、LLMのようなチャットモデルは超人的な性能なのになぜAGIに繋がっていないのかが常々疑問で、code+AIに特化したモデルを開発したとのことで、それはどのようなものかというと、
LLMは人間の好みとなる応答を返すように、autoregressiveにテキストを生成するが、
本ブログで紹介されているシステムSystemOneは意思決定に最適化し、並列で生成され、自由なテキストを返せないが構造化出力を高速かつ安価に生成可能で、キャリブレーションされた確信度を常に返す、
というもののようである。
着眼点はとてもおもしろいのだが、どの程度高度な推論をすることができるのだろうか?
現代では高度な推論は計算コストである程度賄っているため、安価で高度な推論もできるのでれば大きなブレイクスルーだが、その技術はLLM側にも適用できる可能性があり、結局いつかLLM側に追いつかれる、という可能性がある。
逆に高度な推論ができないのであれば、適用可能なスコープは限定的となる。
RLCDという技術はすでに先行事例があったようだ:
利用規約でJevに関するベンチマークスコアや性能を公開することが禁止されているようである:
所見:
JamC-QAのスコアは(GPT-5.6-lunaより)低く、日本特有の知識などには弱い可能性がある:
- 『JamC-QA』: 日本の文化や風習に特化した質問応答ベンチマークの構築・公開(前編), SB Intuitions, 2025.09
色々な動向を鑑みるに、Encoderか、Decoderかはさておき(利用者から見たらどちらでもよい気がするので)、
- zero-shotで様々なタスクに利用可能で
- latencyが非常に速くて
- コストが安価なモデル
という3つの要素が重要に思える。
chatはできないが、構造化出力/関数出力等が可能(なことで様々な分類タスク等に適用できる)というのは、latencyの速さとコストの安価さを得るための手段。エンコーダ、デコーダも手段の話。
過去にPFNがJevに相当する機能を開発しサービス化までしていた、という話がある(関連技術は幅広く特許を取得しているようである)。
なぜ需要を掘り起こせなかったのか、という点は考えてみるとおもしろいのかもしれない。
個人的にはいまJevが流行っぽい兆しを見せているのは、時期的なものが大きい気がしており、
- (Reasoningモデルの台頭によって) LLMのlatencyが悪い
- 多くのワークフローに組み込む場合に得たい出力が(おそらく)構造化出力(で、めちゃめちゃ賢い判断はそこまで必要とされない)
- モデルのトークン利用料が増加し、(おそらく)運用コストが課題となってきた
という課題に世の中が直面し始めて、課題感として持たれ始めていること、が背景としてある気がしており、ちょうどタイミング的に「安い、速い、(そこそこ)賢い」のJevが世の中に刺さったのではないか、という気がしている。
[Paper Note] FLASHREINFORCE: CRITIC-FREE SINGLE-ROLLOUT ASYNCHRONOUS RL FOR AGENTIC LANGUAGE MODELS, Hu+, ResearchGate, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #ReinforcementLearning #AIAgents #PostTraining #read-later #Asynchronous Issue Date: 2026-09-15 Comment
元ポスト:
解説:
DeepSeek-V4.1-Flash, DeepSeek AI, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #OpenWeight #read-later #VisionLanguageModel #Reference Collection #Author Thread-Post #Decoder-Decoder Issue Date: 2026-09-10 Comment
元ポスト:
所見:
え?もしかしてEncoder-Decoder???
Causal Encoder-Decoderという名称なので、seq2seqのようなBidirectionalなエンコーダを用いたものではなく、
エンコーダー、デコーダー共にautoregressiveモデルだが、エンコード用途とデコード用途でアーキテクチャやactivation paramなどに違いを持たせた、という感じだろうか。
デコーダ-デコーダアーキテクチャと呼ぶらしい:
関連:
- [Paper Note] You Only Cache Once: Decoder-Decoder Architectures for Language Models, Yutao Sun+, NeurIPS'24, 2024.05
公式ポスト:
ベンチマークスコアはfrontierモデルに匹敵する
HBMの使用量はV4-Flashから1/4, SSD使用量は1/8
合成データはいまだに利用していない:
事後学習のデータ品質改善のROIがアルゴリズム改善のROIを上回る:
関連(こちらは事前学習だが):
- Pretraining progress is mostly coming from data, DWARKESH PATEL AND JERRY HAN, 2026.09
解説:
Artificial Analysisによる評価:
とそれらに対する所見:
所見:
v4.1 flashをhostingするためのコードリポジトリがいくつか新たに公開されたようである:
所見:
JustRL II: Scaling Small LLMs to 128K Reasoning with a Critic, MiniCPM RL Team, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #ReinforcementLearning #Actor-Critic #PostTraining #read-later #LongHorizon #Author Thread-Post #CreditAssignment Issue Date: 2026-09-09 Comment
元ポスト:
関連:
- [Paper Note] JustRL: Scaling a 1.5B LLM with a Simple RL Recipe, Bingxiang He+, ICLR'26, 2025.12
On the Navier–Stokes Millennium Prize Problem, OpenAI, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #GenerativeAI #Blog #Mathematics #Proofs #Initial Impression Notes #Author Thread-Post Issue Date: 2026-09-09 Comment
あのペレルマン氏が証明したポアンカレ予想と並ぶミレニアム懸賞問題の一つである、ナビエストークス方程式の解の存在と滑らかさ、とやらがOpenAIが保有する未公開モデルによって証明されたかもしれないらしい。10000の協調エージェントによって88時間, トークン量は1300億トークンで解に到達したのだとか。
元ポスト:
解説:
Rustによる高速なOptuna実装「Rustuna」の公開, PFN, 2026.09
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #MachineLearning #NLP #read-later #Author Thread-Post Issue Date: 2026-09-08 Comment
元ポスト:
Training frontier knowledge work agents: A 397B RL training guide with SkyRL, Mercor and SkyRL, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #ReinforcementLearning #AIAgents #Blog #PostTraining #read-later #Initial Impression Notes Issue Date: 2026-09-06 Comment
元ポスト:
397Bモデルに対するDPPOによる事後学習によってAPEX-Agentsのスコアを+11.2%を実現するための取り組みと地検が共有されているようである。
関連:
- [Paper Note] APEX-Agents, Bertie Vidgen+, arXiv'26, 2026.01
- [Paper Note] Rethinking the Trust Region in LLM Reinforcement Learning, Penghui Qi+, arXiv'26, 2026.02
LLM-jp-4-VL 9Bリリース, LLM-jp, 2026.09
Paper/Blog Link My Issue
#Article #ComputerVision #Pretraining #NLP #Dataset #OpenWeight #Japanese #OpenSource #VisionLanguageModel #One-Line Notes Issue Date: 2026-09-06 Comment
元ポスト:
モデル: https://huggingface.co/llm-jp/llm-jp-4-vl-9b
RefinedVision:
https://huggingface.co/datasets/llm-jp/RefinedVision
OpenSource AIの定義を満たすためにFineVisionデータセットを精査(e.g. GPT-4oの出力等は利用規約上問題がある)した上で修正(FineVisionは185サブセット, 24M VQAで構成されている)したとのこと。すごい。。。
ライセンス・利用規約上の問題を精査するだけでなく、品質(画像の品質、QAの品質)の観点でも精査の上修正しているようである。
関連:
- [Paper Note] FineVision: Open Data Is All You Need, Luis Wiedmann+, NeurIPS'26, 2025.09
Atlas: A World Model for Spatial Intelligence, World Labs, 2026.09
Paper/Blog Link My Issue
#Article #ComputerVision #Transformer #DiffusionModel #Blog #Proprietary #read-later #3D Reconstruction #WorldModels #SpatialUnderstanding #Author Thread-Post #4D(Scene + Time) Issue Date: 2026-09-06 Comment
元ポスト:
解説:
Claude: Fable 5.1 and Mythos 5.1, Anthropic, 2026.09
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #LanguageModel #Proprietary #VisionLanguageModel #Author Thread-Post Issue Date: 2026-09-04 Comment
元ポスト:
所見:
Introducing K2 Horizon: Frontier Performance, Radically Open, Institute of Foundation Models, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Blog #OpenWeight #OpenSource #One-Line Notes Issue Date: 2026-09-04 Comment
元ポスト:
所見:
HF: https://huggingface.co/collections/IFM/k2-horizon
GPT-5.6-luna級の性能を375B-A23Bで実現されているように見え、データ、レシピ、コード、重みが公開される。
Introducing Muse Spark 1.3, Meta, 2026.09
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Blog #Proprietary #Initial Impression Notes Issue Date: 2026-09-04 Comment
元ポスト:
早くもGPT-5.6-Solと同等以上の性能に到達した模様
long context性能が良さそうに見える:
と思いきや、(Museに限らないが)MRCRのスコアにはコンタミネーションの疑いがある。
Artificial Analysisによる評価:
Terminal Bench 2.1→Terminal Bench 4.0のスコアの減少幅が大きいと言う指摘:
GPT-6 Astra: A new generation of intelligence, 2026.09
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #LanguageModel #AIAgents #Blog #Proprietary #VisionLanguageModel #Initial Impression Notes #Author Thread-Post Issue Date: 2026-09-04 Comment
元ポスト:
GPT-5.6 Solから大幅に性能向上。scaling lawはいつまで続くのだろうか
ベンチマーク上は
- Claude: Fable 5.1 and Mythos 5.1, Anthropic, 2026.09
を超えている。
所見:
アーキテクチャに関する所見:
- [Paper Note] Nanbeige4.2-3B: Unlocking Agentic Capabilities in a Compact Model, Nanbeige Lab+, arXiv'26, 2026.07
- [Paper Note] Mixture-of-Recursions: Learning Dynamic Recursive Depths for Adaptive Token-Level Computation, Sangmin Bae+, NeurIPS'25
より注意深く指示に従い、CUAの能力も大幅に向上しているようである:
CUAによってBlenderで作成されたhouseの例がなかなかすごい
Artificial Analysisによる評価によると、Artificial Analysis Indexでは5.6-Solと同等、Coding IndexでもFable 5と同等であり、OpenAIによるベンチマークスコアとかなり乖離があるように見える。パブリックなベンチマークに対して過剰に適合しているのか。それともArtificial Analysisのベンチマーク群とその重みづけにより算出されるスコアの相性が悪いのか。(まあこれを考えても不毛だけど)
SRE-Benchと呼ばれるモデルがコンパイル済みのバイナリからソフトウェアをリバースエンジニアリングできるかを測定するベンチマークが飽和したとのこと:
SRE-Bench:
https://benchlm.ai/benchmarks/srebench
所見:
Artificial Analysis Indexのスコアが更新されてFable 5.1とAstraのスコアが同じになったようである😅:
Hugging Face のインシデントと今後の道筋, OpenAI, 2026.08
Paper/Blog Link My Issue
#Article #Analysis #NLP #LanguageModel #AIAgents #Blog #read-later #Security #Author Thread-Post Issue Date: 2026-08-30 Comment
元ポスト:
- OpenAI and Hugging Face partner to address security incident during model evaluation, OpenAI, 2026.07
の件の調査結果のようである。
GLM-5.3-Flash: Frontier Intelligence, Flash Cost, Z.AI, 2026.08
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #LanguageModel #Blog #OpenWeight #Initial Impression Notes #Author Thread-Post Issue Date: 2026-08-30 Comment
HF: https://huggingface.co/zai-org/GLM-5.3-Flash
320B-A18BでOpus 4.8相当のベンチマークスコアを達成
アーキテクチャ解説:
- KDA
- FlashKDA: Flash Kimi Delta Attention — high-performance KDA kernels built on CUTLASS, MoonshotAI, 2026.04
- MLA
- [Paper Note] DeepSeek-V3 Technical Report, DeepSeek-AI+, arXiv'24, 2024.12
- DSA
- [Paper Note] DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models, DeepSeek-AI+, arXiv'25, 2025.12
- mHC
- [Paper Note] mHC: Manifold-Constrained Hyper-Connections, Zhenda Xie+, arXiv'25, 2025.12
所見:
本ポストにある通り、中国系のOpenWeightモデルは
- linear attention
- sparse attention
- mHCのようなResidual Streamに対する工夫
- Muon
などを採用するのがデファクトとなっているように思われる。
所見:
Qwen3.8-Flash-Next: A New Architecture, Towards Ultimate Cost-Efficiency, Qwen Team, 2026.08
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #LanguageModel #OpenWeight #VisionLanguageModel #Initial Impression Notes #Author Thread-Post Issue Date: 2026-08-30 Comment
ベンチマークスコアはOpus 4.6超え。パラメータは125B-A6B、51Bの N-gram Embeddings。Gated Delta Net layerとQwen Sparse Attention と呼ばれる Layerを3:1の比率で積み上げていっているようである。N-gram Embedding、MTPも導入されている。また、Gated Residualと呼ばれる技術により、Residual Streamからの読み込み/書き込みを制御している。
- 関連:
- [Paper Note] Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models, Xin Cheng+, arXiv'26, 2026.01
HF:
https://huggingface.co/Qwen/Qwen3.8-Flash-Next?spm=a2ty_o06.30285417.0.0.1d73c921FsyOPe&file=Qwen3.8-Flash-Next
technical report:
https://github.com/QwenLM/Qwen3.8-Flash-Next/blob/main/tech_report.pdf
解説:
所見:
Scaling Laws simulate the entire training trajectory at Marin, Larry Dial, 2026.08
Paper/Blog Link My Issue
#Article #Pretraining #NLP #LanguageModel #Post #Scaling Laws Issue Date: 2026-08-22 Comment
詳細はMarin ProjectのIssue 8435を参照のこと。
https://github.com/marin-community/marin
Marin:
- Introducing Marin: An Open Lab for Building Foundation Models, marin-community, 2025.05
RL creates split personas, LW, 2026.08
Paper/Blog Link My Issue
#Article #Analysis #NLP #LanguageModel #ReinforcementLearning #Blog #PostTraining #Personality #reading #Author Thread-Post Issue Date: 2026-08-22 Comment
元ポスト:
所見:
Scaling Activation Oracles to Trillion-Parameter Models: Oracles improve with model size, data size, and data quality, Transluce, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #read-later #Author Thread-Post Issue Date: 2026-08-22 Comment
元ポスト:
GEN-1.5: Embodied Foundation Models are One-Shot Learners, Generalist, 2026.08
Paper/Blog Link My Issue
#Article #Zero/Few/ManyShotPrompting #FoundationModel #In-ContextLearning #Blog #read-later #Robotics #Initial Impression Notes #Author Thread-Post Issue Date: 2026-08-20 Comment
元ポスト:
Embodied AIのFoundation Modelの話で、とうとう一つのデモンストレーションからタスクを学習できる(In-Context Learning)ようになったようである。
関連:
- GEN1: Scaling Embodied Foundation Models to Mastery, Generalist AI Team, 2026.04
所見:
解説:
Cua: Scale computer-use 2.0 with open-source drivers, cross-OS fleets, and benchmarks for training, evaluation, and data generation, trycua, 2026.08
Paper/Blog Link My Issue
#Article #ComputerVision #Tools #NLP #Infrastructure #AIAgents #ComputerUse #Author Thread-Post #SandboxEnvironment Issue Date: 2026-08-20 Comment
元ポスト:
DFlash 2: Keep Drafting Parallel, Inco AI, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #DiffusionModel #read-later #SpeculativeDecoding #Author Thread-Post Issue Date: 2026-08-19 Comment
元ポスト:
関連:
- [Paper Note] DFlash: Block Diffusion for Flash Speculative Decoding, Jian Chen+, arXiv'26, 2026.02
AI Control: An Assessment of Frontier Practices, Guidelight, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Blog #Proprietary #Safety #read-later #Author Thread-Post Issue Date: 2026-08-19 Comment
著者ポスト:
元ポスト:
GLM-5.3: Frontier Coding with Emergent Cyber Capabilities, Z.ai, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #OpenWeight #One-Line Notes Issue Date: 2026-08-15 Comment
GDPValでGPT-5.6-Sol, Fable5超え。ベンチマークスコアだけ見ると、フロンティアモデルにほぼ追いついたと言って良さそうに見える。残る砦はOpus 5
所見:
所見:
スケーリング則に関するLiterature、考察、GLM-5.3のその中での位置付けについて述べられている。ポスト中で言及されている Roberts et al. (2025)は以下
関連:
- [Paper Note] Compute Optimal Scaling of Skills: Knowledge vs Reasoning, Nicholas Roberts+, ACL'25 Findings, 2025.03
- Deconstructing Scaling Laws: The Triad of Optimization, Architecture, and Data, 苏剑林, 2026.07
weightが公開:
https://huggingface.co/zai-org/GLM-5.3
DeepSeek Harness, Deepseek AI, 2026.08
Paper/Blog Link My Issue
#Article #Tools #NLP #LanguageModel #AIAgents #Coding #SelfImprovement #SoftwareEngineering #One-Line Notes #Reading Reflections #Author Thread-Post #AgentHarness Issue Date: 2026-08-14 Comment
元ポスト:
モデル、ツール、スキル、セッション、sandbox、ファイルシステム、ループ、オーケストレーション、UI、全てがPluginとして実装されたpluggableなハーネスとのこと。
元ポスト:
高い拡張性を持つため、self-improveするハーネスと相性が良さそう。
所見:
Introducing Grok 4.6, SpaceXAI, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Proprietary #One-Line Notes #Author Thread-Post Issue Date: 2026-08-14 Comment
元ポスト:
GPT-5.6-Sol, Fable5等のフロンティアモデルと同等のベンチマークスコア
CursorBench 3.2において、パレート最適:
Model Card:
https://media.x.ai/v1/website/card-4p6-4cd2dc57.pdf
1.5T級のモデルで、1.2節にモデル学習の概要が記述されているが、極めてgenericな内容である。他はベンチマークの評価結果やjailbreakに対する堅牢性などの話がメイン。
Introducing Muse Glimmer: An Open Agentic Model That Runs on Your Device, Meta, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #OpenWeight #Initial Impression Notes #Author Thread-Post Issue Date: 2026-08-10 Comment
HF: https://huggingface.co/meta-models/Muse-Glimmer-30B
Museシリーズから初のOpenWeightモデルがリリースされ、ライセンスはApache 2.0
所見:
Alexandr Wang氏によるポスト:
ザッカーバーグ氏によるポスト:
Muse Spark 1.2もオープンになるとのこと。
所見:
アーキテクチャ解説:
Incident Report: unsanctioned agent behaviour during cyber testing, AISI, 2026.08
Paper/Blog Link My Issue
#Article #AIAgents #Blog #read-later #Security Issue Date: 2026-08-10 Comment
元ポスト:
所見:
所見:
関連:
- OpenAI and Hugging Face partner to address security incident during model evaluation, OpenAI, 2026.07
- [Paper Note] Chunky Post-Training: Data Driven Failures of Generalization, Seoirse Murray+, arXiv'26, 2026.02
- [Paper Note] Natural Emergent Misalignment from Reward Hacking in Production RL, Monte MacDiarmid+, arXiv'25, 2025.11
Defending Against the Training–Inference Numeric Mismatch in RL (Especially Linear Attention) — and Whether It Helps Async RL, Yichuan Wang in collaboration with the TorchTitan team, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #ReinforcementLearning #Blog #PostTraining #read-later #train-inference-mismatch #Initial Impression Notes #Asynchronous Issue Date: 2026-08-10 Comment
元ポスト:
linear attentionモデルにおいて、初めてRLにおけるtrain-inference mismatchを完全に解消した実装とのことで、非常にインパクトが大きそうに見える。
VISTA: A Visual Harness for Reasoning in an Interactive World, Han+, 2026.08
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #LanguageModel #AIAgents #Reasoning #read-later #2D (Image) #3D (Scene) #memory #LongHorizon #Author Thread-Post #AgentHarness Issue Date: 2026-08-10 Comment
元ポスト:
From LR to ELR: A Better Heuristic for Pretraining Dynamics, Hy Pretrain Team, 2026.08
Paper/Blog Link My Issue
#Article #Pretraining #read-later #Author Thread-Post Issue Date: 2026-08-10 Comment
元ポスト:
Introducing Muse Code and Muse Spark 1.2, Meta, 2026.08
Paper/Blog Link My Issue
#Article #Proprietary #read-later #Author Thread-Post Issue Date: 2026-08-10 Comment
元ポスト:
ザッカーバーグ氏によるポスト:
Alexandr Wang氏によるポスト:
データ収集をオプトインするとtokenのコストが1/10未満になる。
GPT 5.6 Terraと同等程度のArtificial Analysis Index:
Meta Superintelligence Lab立ち上げからここまで、すさまじいスピード感である。
Qwen3.8-Max: A New Bar for Coding and Cowork, Qwen Team, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Proprietary #VisionLanguageModel #Author Thread-Post Issue Date: 2026-08-09 Comment
2.4T-A95B モデルが翌週にopenになるとのこと。
元ポスト:
言語モデル/coding agentとしては、Opus4.8と同等以上のスコアに見え、VLMとしては、ほとんどのベンチマークでFrontier Model(Fable5, GPT5.6-sol)を上回るスコアを示しているようである。
object detectionでSoTA:
数学と理論計算機科学における10の進展, OpenAI, 2026.08
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #GenerativeAI #Blog #Mathematics #ScientificDiscovery #Initial Impression Notes Issue Date: 2026-08-09 Comment
元ポスト:
歴史的な出来事になる可能性がある
Deconstructing Scaling Laws: The Triad of Optimization, Architecture, and Data, 苏剑林, 2026.07
Paper/Blog Link My Issue
#Article #Tutorial #Embeddings #NLP #LanguageModel #Blog #Optimizer #Architecture #MoE(Mixture-of-Experts) #Scaling Laws #memory #reading #Data #needs-revision Issue Date: 2026-08-08 Comment
元ポスト:
以下読んだ内容の個人的な理解の要約。誤りを含む可能性があるので元文献を読むことをおすすめします。めちゃめちゃ勉強になります。
- モデルの学習プロセスを与えられたデータD, アーキテクチャA, optimizer Oの下で、損失関数を最小化するプロセスとして定式化し、整理すると以下の3つの観点に分離できる
- L(E | D, A, O) = データ誤差 + 最適化誤差 + アーキテクチャ誤差 + 最適なアーキテクチャ・optimizerで学習したときにデータDが到達しうるloss
- ここで、Eはある理想的な分布(i.e., 無限に巨大なテストセット)であり、DはEのサンプリング結果にすぎない。
- L(E | D, A, O) は与えられたD, A, Oの下でモデルが理想分布E上で到達できる損失値を表している。
- 式(1)で示された不等式によって、ある制約のもとで、べき乗則の組み合わせの最小値を求めることができる。
- この不等式を用いて、L(E | D, A, O)に基づいて表現される Scaling Law(機械学習が持つ合理的な仮定に基づいて、学習に伴う様々な変数と最終的に到達しうるlossの関係性を表現した式)を整理していくことで、変数間の関係性を整理することができる。
- 記事中では、最適化誤差、アーキテクチャ誤差、データ誤差について、様々な合理的な仮定に基づいて Scaling Law をボトムアップに構築し、その際の考え方や、導き出した Scaling Law に実際の値をあてはめることで、既に文献で報告されている Scaling Lawと紐づけた考察が実施されている。
- 最適化誤差(学習率η、バッチサイズB、学習ステップ数Tの間の関係性):
- まず最適化誤差について着目し、合理的な仮定として「学習するほど効果が良くなる」という仮定のもと、ステップ数T, 学習率η, バッチサイズBを導入し、その関係性を記述する際の考え方を述べている(ステップ数が多いほど良い、学習率が大きいほどよい、学習はノイズの影響を受け、バッチサイズが小さいほどノイズは大きく、学習率が大きいほどノイズも大きい)。値が大きければプラスの効果をもたらすものはlossが下がると考えられるので負の指数を仮定し、値が大きいほどlossが増大すると考えられるものは正の指数を仮定し、その関係性を記述できる(式10)。
- これは式(1)で与えられた形と同じ形をしており、不等式の性質を用いて最適化誤差を最小化する最適な学習率、最適なバッチサイズ等を求めていくと、最適な学習率が与えられた上での、あるいは最適な学習率・最適なバッチサイズが与えられた上での Scaling Lawの式の形式が得られ、実際に理論的な解析から導かれた指数を代入し、下記研究で実験的に得られたScaling Lawとの比較を通じて考察をしている(たとえば、最適なバッチサイズは学習サンプル数Kの1以下のいあるべき乗に比例する、等)。
- Microsoft Law
- [Paper Note] Scaling Optimal LR Across Token Horizons, Johan Bjorck+, arXiv'24, 2024.09
- Step Law
- [Paper Note] Predictable Scale: Part I, Step Law -- Optimal Hyperparameter Scaling Law in Large Language Model Pretraining, Houyi Li+, arXiv'25, 2025.03
- アーキテクチャ差(パラメータ数N, 幅W, 深さHの間の関係性)
- 続いてアーキテクチャ差についても同様に合理的な仮定からスタートし(パラメータ数Nが大きいほどlossは小さくなる等)、同様に合理的な仮定のもと、式(1)を用いて関係性を整理していくことで、既存のScaling Lawとの関係性が考察されている。
- Kaplan Law
- [Paper Note] Scaling Laws for Autoregressive Generative Modeling, Tom Henighan+, arXiv'20, 2020.10
- Chinchilla Law
- [Paper Note] Training Compute-Optimal Large Language Models, Jordan Hoffmann+, NeurIPS'22, 2022.03
- 最適化誤差とアーキテクチャ誤差を統合した際の議論
- DeepSeek Law
- [Paper Note] DeepSeek LLM: Scaling Open-Source Language Models with Longtermism, DeepSeek-AI+, arXiv'24, 2024.01
- スパース性 / Memory:
- MoEやMemory (Embedding)等の、モデルの計算量とパラメータ数を分離する方法に関する Scaling Lawについても考え方が述べられている。
- たとえば、Denseモデルに対するScaling Lawでは計算量はおおむねパラメータ数Nに比例するという仮定があるが、MoEではそれに対して、総パラメータ数と活性化パラメータ数の比(スパース度S)を新たに導入し、計算量をおおむね活性化パラメータ数のみに依存するものと仮定する。
- スパース度Sを増やしても計算量は増えないが、損失は減るためスパース度を増やすことは(理論上は)基本的に有利に働く。
- 活性化パラメータ数N_act, 総パラメータ数N_totalを導入した過程からアーキテクチャに関するScaling Lawの式を整理すると、最終的にDenseの場合と同じ形式が現れ、N_act, N_totalから導き出される有効パラメータカウント N_eff のパラメータ数を持つDenseモデルと等価である、という見方もできる、などである。
- Ling Law
- [Paper Note] Towards Greater Leverage: Scaling Laws for Efficient Mixture-of-Experts
Language Models, Changxin Tian+, arXiv'25
- データ誤差
- 最後にデータ誤差に関する Scaling Lawについても考察されている。
- ただし、データに関しては様々な要因から影響を受けるだけでなく、かつデータそのものを表現する際に、他のものと比較して境界があいまいで、明確に単一のスカラーで定量化可能な変数を持ちずらく、統一された形式を得ることが難しい、ということも説明されている。
- [Paper Note] Prescriptive Scaling Laws for Data Constrained Training, Justin Lovelace+, arXiv'26, 2026.05
- [Paper Note] Scaling Data-Constrained Language Models, Niklas Muennighoff+, NeurIPS'23
下記ポストも非常に勉強になる:
2 つの設定で ARC-AGI-3 ベンチマークのスコアが 3 倍に, OpenAI, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #One-Line Notes #Compression #Reading Reflections #Author Thread-Post #AgentHarness Issue Date: 2026-08-08 Comment
元ポスト:
ARC-AGI-3のベンチマークを測定する際に、ARC-AGI-3が提供いているオフィシャルのシンプルなハーネスではなく、Response APIで実施されているような reasoningの保持と圧縮をするようなハーネスに変更したら、スコアが3倍以上になったよ、という話のようである。
それはそう、という感じではあるのだが、シンプルなハーネスでそのモデルが持つ強みを発揮しきれないのであれば、公平な比較になっていないよね?という話でもある。モデルの能力を測定するための変数が増えすぎて、公平な比較をするのがどんどん難しくなってきている。
LFM2.5-Encoders: Fast at Long Context, Even on CPU, Liquid AI, 2026.07
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #MultiLingual #OpenWeight #Encoder #One-Line Notes #Reading Reflections #Author Thread-Post Issue Date: 2026-08-06 Comment
元ポスト:
CPUでのinferenceにおいて、ModernBERTよりもlong context (8k付近)でのスループットが3.3倍高いEncoder。context長は8192。
HF: https://huggingface.co/LiquidAI/LFM2.5-Encoder-350M
日本語にも対応しているようだが、日本語ModernBertなどと比較して日本語でこのダウンストリームタスクの性能はどうなるだろうか
Introducing PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models, Kimi Team, 2026.07
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #Dataset #Evaluation #VisionLanguageModel #One-Line Notes Issue Date: 2026-08-05 Comment
元ポスト:
Vision系の新たなベンチマーク。42種類のベンチマークのフロンティアモデルが失敗する事例に基づいて評価対象とするatomicな能力を定義し、それらのatomicなスキルを独立して評価可能なサンプルを作成し評価するベンチマーク。サンプルは与えられた情報のみから、評価対象とするatomicな能力を駆使すれば成功できるverifiableなタスクとして定義されているようである。能力ごとにモデルのスコアが算出可能。
実例としては、たとえば、魚が泳いでいる複数の池のイラストが与えられて、真ん中の池には何匹の魚がいる?といったクエリに応答するなどである。これには localization の能力が求められる(Countingも必要な気がするが)。
Mixture-of-Kittens: our open-source MoE megakernel for NVL72s, Cursor, 2026.08
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #LanguageModel #Blog #MoE(Mixture-of-Experts) #read-later #Initial Impression Notes #Author Thread-Post Issue Date: 2026-08-05 Comment
元ポスト:
主要なOpenWeight LLM(アーキテクチャ)のスループットが軒並み2倍以上になっているので、これはかなりインパクトがでかい話に見える
関連:
- DeepEP: an efficient expert-parallel communication library, Zhao+, DeepseekAI, 2025.09
- MoonEP, MoonshotAI, 2026.07
ポイント解説:
所見:
著者ポスト:
How much science is verifiable? Results from replicating ICML 2026 oral papers, SAI, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Blog #ScientificDiscovery #read-later #Reproducibility #Science #Initial Impression Notes Issue Date: 2026-08-03 Comment
元ポスト:
ICML 2026のOralとして採択された論文の再現実験を通じて得られた知見がまとめられているようで、非常に面白そう。
On-policy distillation isn't a free-lunch, Bhavin Jawade, 2026.07
Paper/Blog Link My Issue
#Article #Tutorial #NLP #LanguageModel #Distillation #Post #PostTraining #On-Policy #reading #Initial Impression Notes Issue Date: 2026-08-03 Comment
元ポスト:
OPD/OPSDのfailure modeが非常に分かりやすくまとまっている
Expenditure Horizon: Measuring Optimization Ability, with an Application to NanoGPT, METR, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Evaluation #reading #One-Line Notes #Author Thread-Post Issue Date: 2026-08-03 Comment
元ポスト:
費用対効果を人間とAI Agentそれぞれでplotすることで、人間とAI Agentが同じ支出で出せるパフォーマンスを出せる点(expenditure horizon)を見つけるというのがアイデアで、これにより低予算下ではAIの方が効果的で、高予算下では人間の方が効果的といった分析が可能となる。
nanogpt speedrunを通じた分析結果なども載っている。
DeepSeek-V4-Flash, Deepseek, 2023.07
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #LanguageModel #AIAgents #OpenWeight Issue Date: 2026-08-02 Comment
Artiflcial Analysisによる評価:
GLM-5.2, Muse Spark 1.1, Gemini3.6-Flash, GPT-5.6-lunaと同等程度のスコアにもかかわらず、スコアに対するパラメータ比率で圧倒的にパレート最適に位置付けられる。
Epoch Capabilities IndexでOpenWeightモデルでKimi K3に次ぐ2位、全体でOpus 4.6に次ぐ7位
NVIDIA Nemotron 3 Embed Ranks #1 Overall on RTEB, Advancing Agentic Retrieval, Nvidia, 2026.07
Paper/Blog Link My Issue
#Article #Embeddings #InformationRetrieval #NLP #LanguageModel #RepresentationLearning #RAG(RetrievalAugmentedGeneration) #MultiLingual #OpenWeight #One-Line Notes Issue Date: 2026-07-31 Comment
元ポスト:
HF: https://huggingface.co/collections/nvidia/nemotron-3-embed
LLMベースのretrieval, STSタスク特化のembeddingモデルで、最大32k contextをサポート。多言語対応している。
RTEB Multilingualと呼ばれるベンチマークでSoTA:
https://mteb-leaderboard.hf.space/benchmark/RTEB(beta)
- Introducing RTEB: A New Standard for Retrieval Evaluation, Liu+, 2025.10
解説:
Autoregressiveなモデルをbidirectionalなattentionに変換した上で、contrastive learning+高品質データでFinutuning。小規模モデルの作成には、pruning, NAS, 蒸留を2回繰り返すことで実現。
Auto-Routing Models, dari.dev, 2026.07
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #LanguageModel #Blog #SmallModel #Initial Impression Notes #Orchestration Issue Date: 2026-07-25 Comment
元ポスト:
HF: https://huggingface.co/dari-ai/router-slm
Sakana FuguのようなLLMプールの中からターン単位で適切なLLMを選択するオーケストレータ(ルータ)で、QwenのLoRA Weightとして学習された重みが公開されているようである。
関連:
- [Paper Note] TRINITY: An Evolved LLM Coordinator, Jinglue Xu+, ICLR'26, 2025.12
- Sakana Fugu: A Multi-Agent Orchestration System as a Foundation Model, sakana.ai, 2026.04
- Sakana Fugu: One Model to Command Them All, SakanaAI, 2026.06
- [Paper Note] Sakana Fugu Technical Report, Yujin Tang+, arXiv'26, 2026.06
Introducing Claude Opus 5, Anthropic, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Proprietary #VisionLanguageModel #One-Line Notes #Author Thread-Post Issue Date: 2026-07-25 Comment
元ポスト:
coding, knowledge workでのベンチマークスコアはFable5超えで、コストはFable5のおよそ半分
いよいよベンチマークではClaude一強という感じになってきた:
Fable5のPromptingに関する話:
- A Field Guide to Fable: Finding Your Unknowns, Claude, 2026.07
Context Engineeringの話:
- The new rules of context engineering for Claude 5 models, Thariq, 2026.07
脆弱性を検知する能力が高い:
[Paper Note] LLaDA2.2, InclusionAI, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #DiffusionModel #MoE(Mixture-of-Experts) #read-later #One-Line Notes Issue Date: 2026-07-25 Comment
HF: https://huggingface.co/inclusionAI/LLaDA2.2-flash
元ポスト:
LLaDA2.2シリーズとして初めてのAgent指向なdLLMとのこと。MoEアーキテクチャ採用。ベンチマークスコアはARモデルよりも少し劣る面があるが、スループットは1.64倍。
stack-v3-full, HuggingFaceCode, 2026.07
Paper/Blog Link My Issue
#Article #Pretraining #NLP #Dataset #LanguageModel #Blog #Coding #reading #One-Line Notes #Author Thread-Post Issue Date: 2026-07-24 Comment
元ポスト:
114 TB, 770言語, 224Mリポジトリ, 約5Tトークンの重複除去やフィルタリング済みGithubから収集されたソースコードで、制限付きライセンスのコードは一切含まないデータセット。V2では2023年時点のスナップショットに基づいており、V3は2025年8月時点までのスナップショットとのこと。たとてば、C++は15倍、TypeScript は7.5倍、Rustは7倍、Pythonは4.8倍程度のトークンがあるらしい。全体としては8.9倍のトークン量。
また、V2ではdeduplicationにおいて正規表現にバグがあったようで、そちらも修正されているようである。
Stack V2:
- [Paper Note] StarCoder 2 and The Stack v2: The Next Generation, Anton Lozhkov+, arXiv'24
所見:
FRONTIER-BENCH V0.1: A benchmark to measure and evolve with the frontier of agent work, FRONTIER-BENCH, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Evaluation #Blog #Live #reading #One-Line Notes #Author Thread-Post Issue Date: 2026-07-24 Comment
元ポスト:
Terminal Benchを構築したチームによる新たなベンチマークで、GPT-5.6-Sol (Codex) でもスコアは34.4%。タスクは今後も更新される。
タスクは、ソフトウェア、ML、科学、オペレーション、セキュリティ、ハードウェア、メディアなどのドメインによって構成されるようである。
Terminal Bench:
- [Paper Note] Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces, Mike A. Merrill+, arXiv'26, 2026.01
OpenAI and Hugging Face partner to address security incident during model evaluation, OpenAI, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Alignment #AIAgents #Evaluation #Blog #Safety #Attack #Video #Security Issue Date: 2026-07-22 Comment
Hugging Face側のブログ:
Security incident disclosure — July 2026
https://huggingface.co/blog/security-incident-july-2026
元ポスト:
video: https://youtu.be/87DyyMV0kCY
関連:
- Incident Report: unsanctioned agent behaviour during cyber testing, AISI, 2026.08
- [Paper Note] Chunky Post-Training: Data Driven Failures of Generalization, Seoirse Murray+, arXiv'26, 2026.02
- [Paper Note] Natural Emergent Misalignment from Reward Hacking in Production RL, Monte MacDiarmid+, arXiv'25, 2025.11
所見:
Inside TPU and GPU Clusters: The Anatomy of Collective Communication, Aleksa Gordić, 2026.07
Paper/Blog Link My Issue
#Article #read-later #Author Thread-Post Issue Date: 2026-07-19 Comment
元ポスト:
- Inside vLLM: Anatomy of a High-Throughput LLM Inference System, Aleksa Gordić blog, 2025.08
Announcing Bonsai 27B: The First 27B-Class Model to Run on a Phone, PrismRL, 2026.07
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #LanguageModel #MultiModal #Blog #OpenWeight #VisionLanguageModel #Initial Impression Notes #Author Thread-Post Issue Date: 2026-07-19 Comment
元ポスト:
HF: https://huggingface.co/collections/prism-ml/bonsai-27b
Bonsaiシリーズ:
- Announcing 1-bit Bonsai: The First Commercially Viable 1-bit LLMs, 2026.03
- Introducing Ternary Bonsai: Top Intelligence at 1.58 Bits, PrismML, 2026.04
- Introducing 1-bit and Ternary Bonsai Image 4B: Image Generation for Local Devices, PrismML, 2026.05
1-bit, ternary weightによって、27B級モデルがエッジデバイス上で動作する。
Kimi K3: Open Frontier Intelligence, Moonshot AI, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #OpenWeight #VisionLanguageModel #reading #One-Line Notes #Reference Collection Issue Date: 2026-07-17 Comment
元ポスト:
Artificial Analysisによる評価:
Artificial Analysis IndexでOpus 4.8超え!?
各ブロックの出力を重みつきで足し合わせることで柔軟にどのブロックにattendするかを決定するattention residualと呼ばれる技術が導入されているように見える。
また、MoEのexpert数をスケールさせ、896 experts, 16 activated expertsに変更。
学習レシピの洗練化と合わせてK2との比較で2.5倍のスケーリング効率が改善され、投入した計算コストをより効果的に知能に変換しているとのこと。
やはり
- [Paper Note] Slicing and Dicing: Configuring Optimal Mixtures of Experts, Margaret Li+, arXiv'26, 2026.05
でも示されているようにexpert数を増やすのが今のところ良さそうに見える。
どうやら2.8Tモデルらしい:
design arenaでFable5超えのSoTA:
writingに関するベンチマークでSoTA:
Latent MoE
- [Paper Note] LatentMoE: Toward Optimal Accuracy per FLOP and Parameter in Mixture of Experts, Venmugil Elango+, arXiv'26, 2026.01
KDA
- [Paper Note] Kimi Linear: An Expressive, Efficient Attention Architecture, Kimi Team+, arXiv'25, 2025.10
Linear TransformerとDelta Net
- [Paper Note] Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention, Angelos Katharopoulos+, ICML'20
- [Paper Note] Linear Transformers Are Secretly Fast Weight Programmers, Imanol Schlag+, arXiv'21, 2021.02
所見:
Latent MoEによってこれほどのsparsityを実現できているのではという所見:
GDPValでも3位:
Kernel optimizationにおいてもFable5と同等性能という報告:
Next.jsのコーディングベンチマークでもFable5超えのSoTAとのこと:
DeepSWEでGPT-5.6-sol, fable5に次ぐ3位:
アーキテクチャを公開されている情報から再構築した図:
公式ブログの図ではValueにはConvがかかっていないように見えたが、はたして。
テクニカルレポート:
https://github.com/MoonshotAI/Kimi-K3/blob/main/k3_tech_report.pdf
HF:
https://huggingface.co/moonshotai/Kimi-K3
アーキテクチャのポイント:
テクニカルレポートまとめ(スレッド):
解説スレッド:
解説:
関連:
- AgentENV, kvcache-ai, 2026.07
- MoonEP, MoonshotAI, 2026.07
- [Paper Note] Attention Residuals, Kimi Team+, arXiv'26, 2026.03
- FlashKDA: Flash Kimi Delta Attention — high-performance KDA kernels built on CUTLASS, MoonshotAI, 2026.04
- [Paper Note] Kimi Linear: An Expressive, Efficient Attention Architecture, Kimi Team+, arXiv'25, 2025.10
- MLA
- [Paper Note] DeepSeek-V3 Technical Report, DeepSeek-AI+, arXiv'24, 2024.12
- Latent MoE
- [Paper Note] LatentMoE: Toward Optimal Accuracy per FLOP and Parameter in Mixture of Experts, Venmugil Elango+, arXiv'26, 2026.01
- MoonViT
- [Paper Note] Kimi-VL Technical Report, Kimi Team+, arXiv'25
KDAの更新ルールに位置情報が直接エンコードされるためRoPEを必要としない:
WSDよりもcosine decayの方が一貫して優れていた...?どういう条件の実験だろうか:
- [Paper Note] MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies, Shengding Hu+, COLM'24
Quantile Balancingについて理解したい
Inkling: Our open-weights model, THINKING MACHINES, 2026.07
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #LanguageModel #MultiModal #SpeechProcessing #Blog #Reasoning #OpenWeight #MoE(Mixture-of-Experts) #VisionLanguageModel #UMM #KeyPoint Notes #Reference Collection #AudioLanguageModel #Author Thread-Post Issue Date: 2026-07-16 Comment
HF: https://huggingface.co/thinkingmachines/Inkling
元ポスト:
THINNING MACHINESによる最初のOpenWeightモデル。975B-41B
- フルスクラッチで学習したReasoningモデル
- 1M context window
- text, image, audio, video 45Tトークンで学習
- バランスよくさまざまな領域で性能を発揮するように訓練し、Tinker上でのfinetuningやカスタマイゼーションの良い基盤として機能することを目指した
- vision, audioドメインに関してはencoder freeアーキテクチャを採用
- audio signalの入力は dMel spectrogramsと呼ばれる手法を採用
- [Paper Note] dMel: Speech Tokenization made Simple, Richard He Bai+, arXiv'24, 2024.07
- 画像は40x40のパッチに分割され、4つのhMLPと呼ばれるレイヤーでエンコーディング
- [Paper Note] Three things everyone should know about Vision Transformers, Hugo Touvron+, ECCV'22, 2022.03
- IFの訓練には、Rubric basedなgraderとclaims graderの2種類のgraderを用いることで、helpfulnessとhallucinationを同時に低減
- Rubric basedなgraderはチェックリストに基づいてスコアリング
- claims graderはfactualな主張をagentic web searchを通じてverificationする
- アーキテクチャはDeepSeek V3を踏襲し、256のexpertsと2つのshared expertを採用し、6つのexpertsがactivateされる
- SWAとGlobal attentionの比率は5:1でKV Headは8つ (GQA)
- **相対位置エンコーディングを用いることでRoPEよりもlong contextに対してより高い外挿性能を示した**
- [Paper Note] Self-Attention with Relative Position Representations, Peter Shaw+, NAACL'18
- K, Vのprojection後、**およびattentionとMLPが残差ストリームに合流する前にshort convolutionを導入**
- QKV projection後に convolution を導入するアーキテクチャは下記研究で提案
- [Paper Note] Primer: Searching for Efficient Transformers for Language Modeling, David R. So+, NIPS'21, 2021.09
- optimiserはMuonとAdamWのハイブリッドで、前者は巨大な行列の重みに対して適用し、そのほかは後者を利用
- 重み自体が多様体上に存在するように制約することが有効であったことに着想を得て、weight decayを学習率の2乗に連動させることでモデルの重みの大きさを安定させたとのこと
- Modular Manifolds, Jeremy Bernstein+, THINKING MACHINES, 2025.09
- [Paper Note] Why Gradients Rapidly Increase Near the End of Training, Aaron Defazio, arXiv'25, 2025.06
- 事後学習としては、まずKimi K2.5を含むOpenWeightモデルで合成データ上でSFTをし、その後合成、あるいは人間が作成したenvironment上で大規模なRLを実施
- RLは非同期RLを異様し、ロールアウト数に対して推論能力が対数線形にスケールした。
- 最終的に30Mロールアウト以上のRLを実施した
- システムメッセージを変更し、トークン単位のコストを調整することでreasoning effortを調整
- Controlling Reasoning Effort in LLMs, Sebastian Raschka, 2026.07
- **276B-A12BのInkling-Smallもプレビュー段階にあり、agenticな能力においてInklingに近い性能を達成しており、今後公開予定**
1M context windowを実現した工夫は特に書かれていなかったように感じるが、よく使われるのはKV CacheをコンパクトにするためのSparse Attention、あるいはLinear Attentionなのに対し、本モデルでは使われていないように見える。linear attentionでなくとも、SWAとGlobal Attentionのハイブリッド、かつGQAによって、KV Cacheの肥大化を実用レベルで抑制できるのだろうか。また、外挿性能に関してはRoPEは採用せず、相対位置エンコーディングのを採用したという点が効いているのだろうか。1Mレベルでのcontextでの評価がなさそうに見えるので性能はよくわからない。
RoPEのlong contextでの限界を示した以下の研究を思い出した:
- [Paper Note] RoPE Distinguishes Neither Positions Nor Tokens in Long Contexts, Provably, Yufeng Du+, arXiv'26, 2026.05
Artificial Analysisによる評価:
アーキテクチャでの目新しい点:
所見:
公式:
所見:
GPT-5.6: Frontier lntelligence that scales with your ambitlon, OpenAI, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #ChatGPT #Proprietary #VisionLanguageModel #Initial Impression Notes #Author Thread-Post Issue Date: 2026-07-10 Comment
元ポスト:
GPT-5.6の変更点まとめ:
Model Guidance: https://developers.openai.com/api/docs/guides/latest-model?model=gpt-5.6
全体的に性能が高いだけでなく、コストパフォーマンスも良いという印象
コストパフォーマンス比:
Terra Ultra並の性能が必要なければ、Lunaのreasoning effortを上げるのがコスパ良いという話:
Lunaが80%の値下げでGPT-5.4-nanoよりも安くなった。触っている感じおそろしく安いくせに、非常に性能が高い。
Separating signal from noise in coding evaluations, OpenAI, 2026.07
Paper/Blog Link My Issue
#Article #NLP #Dataset #LanguageModel #AIAgents #Evaluation #Blog #SoftwareEngineering #One-Line Notes Issue Date: 2026-07-09 Comment
元ポスト:
SWE-Bench Proの約30%にタスクが評価として機能しないタスクが含まれているとのこと(SWE-Bench Verifiedと同じ流れでは)。
これらは、5人の熟練なソフトウェアエンジニアによる監査と、AI Agentによる監査結果を人間がレビューするプロセスの2つを介して同定された。
以下のようなものがある:
- 過剰に制約されたテスト: 実装の制約が強すぎて機能として正しいのにテストが通らず、かつプロンプトでその制約が明示されていない
- requlrementが不足したテスト: プロンプトでの推測することができない要件の漏れ
- 低カバレッジのテスト: 実装が不完全でも通過するテスト
- ミスリーディングなプロンプト: テストが求める要件とは異なる挙動に向かわせるプロンプト
これにより、OpenAIは以前SWE Bench Proを推奨していたがそれを撤回するとのこと。
SWE Bench Verifiedでも同様の事案があった:
- Why SWE-bench Verified no longer measures frontier coding capabilities, OpenAI, 2026.02
そしてSWE Bench Verifiedにおけるコンタミネーションやテストの問題点を改善したSWE Bench Proを構築した、という経緯だったはずだが、そのSWE Bench Proでも問題が見つかったという流れである。
あと、そもそもSWE Bench Proで問題のなかった70%で評価したら現在のモデルのスコアはどうなるのだろうか?
interpreting GPT: the logit lens, nostalgebraist, 2020.08
Paper/Blog Link My Issue
#Article #Analysis #NLP #LanguageModel #Blog #One-Line Notes #Interpretability Issue Date: 2026-07-08 Comment
LLMの中間層のhidden_state(残差ストリーム)に対して、出力層を連結しnext tokenを予測することで、当該中間層でどのようなトークンが想起されているかを可視化する
Verbalizable Representations Form a Global Workspace in Language Models, Anthropic, 2026.07
Paper/Blog Link My Issue
#Article #Analysis #NLP #LanguageModel #One-Line Notes #Interpretability Issue Date: 2026-07-08 Comment
元ポスト:
関連:
- interpreting GPT: the logit lens, nostalgebraist, 2020.08
本文献の本旨であるJ-Spaceの定義、Global Workspace等の発見の話は元ポストを参照のこと。
以下、J-Lensについて元ポストを参考にメモする。
元ポストによると、logit lens
- interpreting GPT: the logit lens, nostalgebraist, 2020.08
と比較して、本文献で提案されているJacobi Lens (J-lens)は、ある中間層での残差ストリームにおける活性値の摂動が、最終層にどのような影響を与えるかを分析することで、当該中間層における残差ストリームがどのようなトークンを将来出力させる傾向にあるかを可視化する手法、とのことである。元ポスト中の具体例による説明が非常にわかりやすい。
logit lensは中間層の残差ストリームに対して、出力層を用いた線形変換を施して残差ストリーム内でどのようなトークンが想起されているかを可視化するが、J-lensは後段の層に与える影響を考慮して可視化する点が異なる。
Hy3, Tencent, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #OpenWeight #One-Line Notes Issue Date: 2026-07-08 Comment
元ポスト:
- Hy3-preview, tencent, 2026.04
の公開後から、50以上のプロダクトからフィードバックを受けより高品質なデータで事後学習を実施したとのこと。
- GLM-5.2: Built for Long-Horizon Tasks, Z.ai, 2026.06
が744B-A40B。Hy3は295B-A21Bなので、半分程度のパラメータ数でフロンティアモデルに近い性能を達成している。
公式:
[Tech] Delta Weight Sync: When RL's Weight Sync Stops Being a Network Problem, Changyi Yang, ChangyiYang's Site, 2026.06
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #LanguageModel #ReinforcementLearning #Blog #PostTraining #reading #Initial Impression Notes #Author Thread-Post Issue Date: 2026-07-07 Comment
RLによる事後学習の際にtrainer側のoptimizerが1 step学習した後にinferenceエンジンに重みをpushするが、BF16でのRLにおける1 stepの更新では多くのモデルの重みに変化はなく(99%程度)、差分だけをpushすればlosslessで2桁程度trafficを削減できて、RDMAが不要でたとえばイーサネットベースのデータセンターを跨いだ環境でもRLが実行できそうだよ、という話のようである。
元ポスト:
報酬ハッキングがモデルの知能向上を食い潰している, Cursor, 2026.06
Paper/Blog Link My Issue
#Article #Analysis #LanguageModel #ReinforcementLearning #AIAgents #Evaluation #Blog #RewardHacking #One-Line Notes #Contamination #Author Thread-Post Issue Date: 2026-07-05 Comment
元ポスト:
SWE Bench Proにおいて、公開リポジトリやリポジトリの履歴にアクセスすることを厳格に禁止したハーネスを用いてproprietaryモデルを評価したところ標準的なハーネスと比較してスコアが大きく低下した。どれだけスコアが減少したかはモデルごとに異なり、たとえばOpus 4.8系のモデルでは8.1--9.1ポイント程度、GPT5.5系では2.6 -- 3.4%程度スコアが低下した。最近のモデルほどスコアが低下する傾向がある、という話のようである。たとえば、731件のOpus 4.8 Maxのtraceを監査用のモデルを用いて調べると、traceの57%において公開リポジトリでマージ済みのPR、または修正済みのソースファイルを見つけ修正をそのまま再現し、9%程度のtraceで.git履歴からバグ修正前後のコミットを検索しパッチを抜き出していた。モデルが協力になるにつれて、自身が評価中であることを認識し、既に与えられたタスクが解決済みであるためのヒントを見出し、RewardHackingのような挙動を示すような傾向にある、という話のようである。
実際にどの程度スコアに影響を与えていたかが見れるのは興味深い。
[Paper Note] Economic Evaluations of Language Models, Wan+, 2026.06
Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #Evaluation #read-later #Author Thread-Post Issue Date: 2026-07-05
Accelerating Transformers Fine-Tuning with NVIDIA NeMo AutoModel, nvidia, 2026.06
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Library #MoE(Mixture-of-Experts) #PostTraining #Finetuning #reading #One-Line Notes #EfficientEvaluation #TrainingFramework Issue Date: 2026-07-05 Comment
わずか数行を追加するだけで、MoEモデルをマルチGPU環境でFinetuningする際のスループットが約3--4倍、メモリ使用量が30%程度削減されるライブラリ。既存のQwen, Nemotron, GPT-OSS, DeepSeek V3などの一般的なMoEアーキテクチャに対して、最適化済みの実装が提供されているとのこと。
repository: https://github.com/NVIDIA-NeMo/Automodel
The Verification Stack, OpenHands, 2026.06
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Blog #Coding #SoftwareEngineering #Verification #reading #One-Line Notes #Author Thread-Post Issue Date: 2026-07-03 Comment
元ポスト:
コードがプッシュされる前にエージェントの作業を評価する小型のcriticモデルと、プルリクエストに対してコードレビュー(スキルを利用)+QAを実施するシステム(実際にエントリーポイントを見つけ、動作させ、証跡を資料としてまとめてレポートをポストするシステム)によってコードの検証プロセスを効率化し、マージまでの時間が平均58%削減され、開発効率が向上する話のようである。
[Paper Note] EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments, ByteDance Seed, 2026.07
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Evaluation #read-later #Initial Impression Notes #Author Thread-Post Issue Date: 2026-07-03 Comment
blog: https://edge-bench.org/
人間が平均で57.2時間かかるようなlong horizonなタスクによるAgentのベンチマーク
Introducing LongCat-2.0, LongCat, 2026.06
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Blog #OpenWeight #read-later #Reference Collection #Initial Impression Notes #Author Thread-Post Issue Date: 2026-06-30 Comment
元ポスト:
- 1M context window
- Sparse Attention
- Muon
- Ngram Embedding
- dynamic activation (33B-56B)
- Multi-teacher OPD
HF:
https://huggingface.co/meituan-longcat/LongCat-2.0
現在はまだ公開されていないがモデルは上記で公開予定
Sparse Attention + 1M Context + MOPD + Muonが標準になっている印象
LongCat Sparse Attentionポイント解説:
所見:
50k基のH800 GPUで学習されているとのこと。
所見:
ポイント解説:
Previewing GPT‑5.6 Sol: a next-generation model, OpenAI, 2026.06
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #ChatGPT #Proprietary #VisionLanguageModel #Initial Impression Notes #Author Thread-Post Issue Date: 2026-06-27 Comment
元ポスト:
OpenAIによる新たなフロンティアモデルで、terminal benchでMythos 5, Fable 5超え。まずは少数のパートナーに提供し、その後数週間以内にGAを目指す、という感じらしい。
所見:
ベンチマーク:
- [Paper Note] Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces, Mike A. Merrill+, arXiv'26, 2026.01
- [Paper Note] ExploitBench: A Capability Ladder Benchmark for LLM Cybersecurity Agents, Seunghyun Lee+, arXiv'26, 2026.05
- CyScenarioBench: Evaluating LLM Cyber Capabilities Through Scenario-Based Benchmarking, IRREGULAR, 2026.06
- [Paper Note] HealthBench Professional: Evaluating Large Language Models on Real Clinician Chats, Rebecca Soskin Hicks+, arXiv'26, 2026.04
- [Paper Note] CyberGym: Evaluating AI Agents' Real-World Cybersecurity Capabilities at Scale, Zhun Wang+, arXiv'25, 2025.06
サイバーセキュリティに関するベンチマークの報告が増えてきたなぁ
Humans Still Beat AI in the Long Horizon: Revisiting Test-Time Scaling in the Agent Era, Mang+, 2026.06
Paper/Blog Link My Issue
#Article #Analysis #NLP #LanguageModel #AIAgents #Coding #read-later #LongHorizon #Initial Impression Notes #Author Thread-Post Issue Date: 2026-06-22 Comment
2週間にわたるopen endなプログラミングコンテストのデータを用いて人間の専門家とAI AgentのElo ratingの変遷を比較すると、序盤は人間に対して大きくリードしスコアは試行回数の対数に対して線形にスケーリングし次第に停滞を始めるが、人間の専門家は4日を超えたあたりから非線形にスコアが進化し、最終的にAI Agentよりも高いスコアを記録する。人間はAI Agentと比較して、継続学習ができていることが示唆され、AI Agentのlong horizonタスクに対する能力の限界が示唆される、という話に見える。
元ポスト:
RL Systems Mind the Gap: Matching Trainer and Generator Throughput, Chen+, 2026.06
Paper/Blog Link My Issue
#Article #ReinforcementLearning #Blog #read-later Issue Date: 2026-06-17 Comment
元ポスト:
所見:
GLM-5.2: Built for Long-Horizon Tasks, Z.ai, 2026.06
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Actor-Critic #OpenWeight #Reference Collection #Critic #LongHorizon #train-inference-mismatch #Initial Impression Notes Issue Date: 2026-06-16 Comment
HF: https://huggingface.co/zai-org/GLM-5.2
1Mコンテキストでフロンティアモデルには少し劣るが非常に高い性能。SWE Bench ProではGPT5.5をoutperform、Terminal Bench/DeepSWEなどでは3--12pt程度GPT5.5が高い。Opus4.8はさらにスコアが高い。
744B-A40B
元ポスト:
Artificial Analysis Intelligence IndexでOpenWeightモデルでSoTA更新:
MiniMax-M3超え
long Horizonのタスクの学習でGRPOではなく、criticベースのPPOを利用:
アーキテクチャ解説:
GLM 5.2では、Reward Hackingを検知した場合、ペナルティを与えるのではなく、ツール呼び出しをブロックしてダミー情報を返し、ロールアウト自体は継続させる。Reward Hackingをすると、ただ損をするという構造に近づけていると思われる。
slimeフレームワークを用いることで10を超えるエキスパートモデルに基づくOPDを2日で終えたとのこと。この記述に基づき、OPDがRLと比較して非常に効率的で、かつエキスパートなモデルは並列で学習をさせておけるよね?という利点に関して推察をしている:
エキスパートなRLでは常にドメイン別のRLを走らせ特化モデルを学習しておき、性能が向上したらOPDで単一モデルに効率的に蒸留することで、モデルに知識を集約するプロセスと、個々のドメインごとに強力なモデルを得るプロセスが分離されて良さそう、という感想を得た。
1M context + linear attentionが標準に:
MTPの学習時において、step 2以後のMTP Layerの出力は、学習時はteacher forcing, 推論時はstep 1のMTP Layerが推定したhidden_stateが用いられるが、これが学習-推論時のgapを生んでしまう。このため、step 1の計算で利用したKV(とsparse attentionのtop-kで洗濯をしたトークンのindex)を全て共有し、step 2以後のMTP Layerで活用し、かつstep 2以後のsparse attentionの計算のオーバヘッドをなくしつつ、学習-推論のgapを無くすことでspeculative decodingの性能を向上させる、といった話題があるようである:
画像分野におけるself-forcingと同じ発想に思う。
- [Paper Note] Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion, Xun Huang+, NeurIPS'25
GRPO, PPOのそれぞれの利点と欠点、およびLong Horizonタスクに適用する価値の説明:
Cursor Benchにおいて、Opus 4.8と同等程度のコスト効率とのこと:
PPOへ最終的に回帰してきたのは一種のbitter lesson:
PPO vs. GRPOに関する所見:
GLM 5.2で利用されたRL:
- [Paper Note] Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning, Zhenyu Hou+, arXiv'26, 2026.07
要はGRPOだと応答単位のrewardから算出されるAdvantageがトークン単位に一律に割り当てられるが、PPOの場合はトークン単位のcredit assignmentが可能(Criticが各時点でのValueを推定し、GAEなどを通じてAdvantageに反映されるため)な点が重要と思われる。
Statement on the US government directive to suspend access to Fable 5 and Mythos 5, Anthropic, 2026.06
Paper/Blog Link My Issue
#Article #Blog Issue Date: 2026-06-13 Comment
元ポスト:
ありゃー、これはやばめかも...
所見:
-
-
強化学習の基礎, Takuya Kubo, 2025.06
Paper/Blog Link My Issue
#Article #Tutorial #ReinforcementLearning Issue Date: 2026-06-12 Comment
めちゃめちゃ分かりやすくて勉強になる。ありがたや🙏
Research ideas you can't be outscaled on., Anthea Li, 2026.06
Paper/Blog Link My Issue
#Article #Blog #Repository #ScientificDiscovery #One-Line Notes #Author Thread-Post Issue Date: 2026-06-11 Comment
元ポスト:
計算リソースやスケールよりも洞察が重要な研究アイデアを共有できるページのようである。興味深い。
Claude Fable 5 and Claude Mythos 5, Anthropic, 2026.06
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #AIAgents #Proprietary #VisionLanguageModel #Reference Collection #Initial Impression Notes #Reading Reflections Issue Date: 2026-06-10 Comment
元ポスト:
Mythos級の性能を持ち、サイバーセキュリティ、生物学、化学、蒸留に対してsafeguardを持つfrontier model
GDPValでSoTA:
フロンティアLLMの構築に関わるクエリは意図的に制限を設ける措置がとられているようだ:
一部の人間にしかAIの能力が解放されない未来に対する懸念:
-
フロンティアモデルの関連に関するリクエストに対しては、通常のsafeguardとは異なり**サイレントに性能が限定される**ようである。これはAIの開発が加速しすぎると重大なリスクが生じるため(February 2026 Risk Report)、とのこと:
-
-
このような性能の低減は、prompt modification, steering, peftなどを通じて行われるとのこと。利用者からしたらpromptの調整や工夫で検知されないようにするしか対策(?)の打ちようがないと思われる。
しかしこの情報をわざわざ公開する意図はなんだろうか。完全に憶測だが
- Mythos級のモデルの性能が良く、半自律的にモデルがモデル自身をよくする仕組みが成立している
- ライバルにモデルを使わせないで、自分たちだけで独占することでMoatを築くフェーズまできた
- 情報を公開しようがしまいが、性能に制限をかけていたら、フロンティアモデル開発者たちにはすぐバレるので、他のユーザたちが混乱するのを避けるために最初から線引きを明確にしておく
- ほほ全てのユーザに影響はないので、一部のフロンティアモデル開発に近しい人間から不満は出るが、全体で見たら気にしなくて良いレベル
- フロンティアモデル開発には使えないと銘打つことで、ライバルよりも本当に性能が良いんだな、という印象を与えることができるマーケティング効果
とかだろうか。
Geminiさんと壁打ちをしたら欠けている視点として以下のような意見を頂戴した(以下の引用部分はGeminiの出力です)
> 規制当局へのポーズ(アライメント):
「自社モデルが、制御不能なさらに強力なAI(AGI/ASI)を勝手に生み出す引き金(ゴーレムが生むゴーレム)にならないよう、防衛策を講じています」という姿勢を政府や規制当局に見せる必要があります。
なるほど
続報:
フロンティアモデルで性能が制限された時に、それらが他のsafeguardと同様ユーザ側に通知されるように変更されるようだ
モデルのそのものの性能などは置いておいて、今回の特定のタスク、プロンプトには恣意的に一定の制限を設ける措置を受け、(Project Glasswingの頃から違和感はあったが)Anthropicが恣意的にAIの能力を供給する姿勢に見え、雲行きの怪しさを感じる
- Project Glasswing Securing critical software for the AI era, Anthropic, 2026.04
Mythos級のモデルでは、全てのpromptと生成結果が、信頼性と安全性の確認のために30日間保持される:
https://support.claude.com/en/articles/15425996-data-retention-practices-for-mythos-class-models
所見: https://simonwillison.net/2026/Jun/9/claude-fable-5/
コーディング関連ベンチマークでは抜きん出ている:
所見:
Fable再公開後のClassifierによる安全マージンについて:
輸出規制解除:
約1ヶ月かかった。
KernelBench MegaでSoTA:
Improving our LLM Pretraining Efficiency, Open Athena, 2026.06
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #Pretraining #NLP #LanguageModel #Optimizer #MoE(Mixture-of-Experts) #KeyPoint Notes #Author Thread-Post Issue Date: 2026-06-06 Comment
元ポスト:
以下の処理によって、事前学習が高速化(FLOPsの改善幅)された知見が共有されている
- DenseからMoEモデルへの移行で実測値3.6倍
- MoEのexpart数を64->256で実測値1.3倍
- optimizerをMuonHにすることで、実測値1.25倍
- **Partial Key Offset (PKO) によって実測値1.2倍改善**
- **modded-nanogptリポジトリ、プルリクエスト169で初めて提案された手法とのこと。**
- **long windowのattentionに対して、keyの半分の次元をオフセット(=前のトークンのkey)、残りの半分の次元を自身のトークンのkeyとすることで、単一のクエリが連続した複数のキーにattendできるようになり、「過去の文脈からあるトークンの継続部分を検索して取得する」といった操作が単一のattention layerによって実現できるようになる**
- (これは知らなかった)
- expertのルーティングを再正規化・スケーリングすることで、実測値1.04倍
今後はHyperConnectionのようなResidual Streamの改善、推論効率向上のためMLA, LatentMoE, Multi Token Prediction, Gated Deltanet, quantizationなどの技術を検証するとのこと。
Expert数が多ければ多いほど性能が改善することは下記研究でも示されている:
- [Paper Note] Slicing and Dicing: Configuring Optimal Mixtures of Experts, Margaret Li+, arXiv'26, 2026.05
MuonH(というよりoptimizerのHyperplaneに基づいたラッパ)は以下(こちらもPercy Liang氏のグループ):
- Fantastic Pretraining Optimizers and Where to Find Them 2.1: Hyperball Optimization, Wen+, 2026.01
Hyper Connection:
- [Paper Note] Hyper-Connections, Defa Zhu+, ICLR'25, 2024.09
- [Paper Note] mHC: Manifold-Constrained Hyper-Connections, Zhenda Xie+, arXiv'25, 2025.12
MLA, LatentMoE, Multi Token Prediction, Gated Deltanet:
- [Paper Note] DeepSeek-V3 Technical Report, DeepSeek-AI+, arXiv'24, 2024.12
- [Paper Note] LatentMoE: Toward Optimal Accuracy per FLOP and Parameter in Mixture of Experts, Venmugil Elango+, arXiv'26, 2026.01
- [Paper Note] Better & Faster Large Language Models via Multi-token Prediction, Fabian Gloeckle+, ICML'24
- [Paper Note] Gated Delta Networks: Improving Mamba2 with Delta Rule, Songlin Yang+, ICLR'25, 2024.12
- [Paper Note] Gated DeltaNet-2: Decoupling Erase and Write in Linear Attention, Ali Hatamizadeh+, arXiv'26, 2026.05
Understanding Self-Distillation and Privileged Information Distillation, Penaloza+, 2026
Paper/Blog Link My Issue
#Article #Tutorial #NLP #LanguageModel #ReinforcementLearning #Blog #Distillation #read-later #On-Policy #SelfDistillation Issue Date: 2026-06-05
CUDA Programming Guide Part 1, Kazuki Fujii, 2026.06
Paper/Blog Link My Issue
#Article #Tutorial #reading #Author Thread-Post Issue Date: 2026-06-05 Comment
元ポスト:
読む
NVIDIA Nemotron 3 Ultra, nvidia, 2026.06
Paper/Blog Link My Issue
#Article #Pretraining #NLP #LanguageModel #OpenWeight #SSM (StateSpaceModel) #MoE(Mixture-of-Experts) #read-later #Reference Collection #LowPrecision #LinearAttention #Author Thread-Post Issue Date: 2026-06-05 Comment
元ポスト:
アーキテクチャ解説:
Mamba2 layer, Latent MoE, GQA
ポイント解説:
HF: https://huggingface.co/collections/nvidia/nvidia-nemotron-v3
所見:
所見:
A Functional Taxonomy of World Models, Fei-Fei Li, 2026.06
Paper/Blog Link My Issue
#Article #Tutorial #ComputerVision #NLP #Post #VideoGeneration/Understandings #Robotics #WorldModels #VisionLanguageActionModel #KeyPoint Notes #TextToVideoGeneration #Reading Reflections #WorldActionModel #Author Thread-Post Issue Date: 2026-06-04 Comment
元ポスト:
以下ポストの内容の要約(と意訳、間違ってたらごめんなさい)
- 世界モデルは現在最も重要だが、最も多義的な概念の一つになっている。
- 様々な分野がWorld Modelを構築していると主張するが、意味するところが実際には大きく異なる
- (実際 [Paper Note] Agentic World Modeling: Foundations, Capabilities, Laws, and Beyond, Meng Chu+, arXiv'26, 2026.04
のような研究も存在し似たような問題意識のもと様々な分野での統一的な分類体系が提案されている)
- 世界モデルという用語のもともとの枠組みは「部分観測マルコフ決定過程 (POMDP)」であり、
- エージェントは行動を実行し、行動は世界の状態に影響を与え、エージェントは観測データを受け取り(≠状態を認識する)、新たな観測データに基づいてアクションが実行される、といったループが繰り返される枠組みである
- ここで、「状態」とは、ある時点における世界で何が起きているかに関する完全なdescriptionであり、エージェントは状態自体を認識することはできず、行動と状態から生じた部分的な観測データのみである。
- 現在様々な世界モデルと呼ばれるものが存在するが、構造としては上記のループを持っており、それらの切り口が異なっているにすぎない。
- 世界モデルのカテゴリ1: Renderer
- Rendererは人間の目に見えるピクセルで「観測」を出力する。
- たとえば、テキストのプロンプトを映像に変換するText-To-Videoモデル、ユーザの入力に応じてリアルタイムにフレームを生成するシステムはレンダラーに相当する。
- これらモデルは観測者にとって「見えるもの」を生成しているにすぎず、実際の3次元構造を明示的に理解しているわけではない(i.e., 見えるもの≠実在するもの)。
- ビジネスとして最も成長(してきており、学習データもインターネット上の動画が活用できるため他の2カテゴリと比べて多い)
- 世界モデルのカテゴリ2: Simulator
- Simulatorは「状態」を出力する。これは実際に人間やコンピュータが相互作用可能な世界の表現である。
- Rendererは単に視覚的なものであるが、Simulatorは実世界の幾何学的・物理的・動的なダイナミクスを理解することが求められる。
- Simulatorは建築家やゲーム開発者などの視覚を超えた(たとえば構造・物理的な)正確性を必要とする職種や、RLの学習の環境として利用できる。
- Simulator は Rendererと次のPlannerの土台となる技術(Simulatorは RendererとPlannnerの双方をバイパスできる)であるが、学習データが最も不足
- 世界モデルのカテゴリ3: Planner
- Plannerは「行動」を出力する。観測と目標が与えられた時に「次に何をすべきか」を出力する。
- Vision Language Action Model / World Action Model は Planner に該当し、これらはロボットが次に何をすべきかを決定できる。
- 現在研究初期段階で、研究所内での閉じられた環境でのデモ中心で、実世界で活用するためにはまだまだ多くの課題が残る。
- これら3つのカテゴリは現在世に出ているWorld Modelの多くを説明しており、区別をする際に役に立つ。
- が、これらカテゴリは独立したものではなく、これらは世界の機能に関する基本的な知識(幾何学、物理学、ダイナミクス)の上に成り立つ。
- これら3つのカテゴリは最近は互いが融合してくる流れにあり、たとえば事前学習された Renderer は、次に何が起こるか・何をすべきか(=Planner)を予測するためのバックボーンとして利用できることが示されてきており、これは Renderer と Plannerが 融合した例と言える。
- (この辺の話はBackboneとしてVision Encoderを持つVLA系全般の研究と、事前学習済みのVision Encoderを用いずに事前学習の方法をそもそも改善するような方向などだろうか)
上記の話に基づくと、たとえばターミナルでのWorld Modelに相当すると考えられる
- [Paper Note] ECHO: Terminal Agents Learn World Models for Free, Vaishnavi Shrivastava+, arXiv'26, 2026.05
は3つのカテゴリのうちにどれに該当するだろうか。
次のアクションを予測できるので、まずPlannerには該当すると思われる。また、ある時点においてターミナル上で何が起きているかの記述(ターミナルの出力)を予測しているので、Simulatorの役割を果たしていると思われる(ただ、ターミナルの出力だけがターミナルの状態を完全に記述した情報なの?定義としてそれでいいの?という疑問はあるのが)。このため、Planner と Simulator が融合した研究と言えるのではなかろうか。
Is Frontier Asynchronous RL Solved?, Luke J. Huang, 2026.05
Paper/Blog Link My Issue
#Article #Survey #NLP #LanguageModel #ReinforcementLearning #Blog #reading #Asynchronous #Author Thread-Post Issue Date: 2026-06-03 Comment
元ポスト:
MAI-Thinking-1: Building a Hill-Climbing Machine, Microsoft, 2026.06
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #Proprietary #read-later #Reference Collection Issue Date: 2026-06-02 Comment
元ポスト:
解説:
解説:
解説:
所見:
Figure 6について言及されている:
Develop Physical AI Reasoning, World, and Action Models with NVIDIA Cosmos 3, nvidia, 2026.05
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #MultiModal #OpenWeight #VideoGeneration/Understandings #Robotics #WorldModels #UMM #reading #Omni #One-Line Notes #WorldActionModel #Author Thread-Post Issue Date: 2026-06-02 Comment
元ポスト:
公式:
encoder-freeなOmniモダリティモデルで、かつ将来の世界の状態、およびactionを予測可能なWorldActionModel
On-Policy Self-Distillation: 言葉で学ぶ LLMの新たな学習パラダイム, ぶち, 2026.03
Paper/Blog Link My Issue
#Article #Tutorial #NLP #LanguageModel #ReinforcementLearning #Blog #PostTraining #On-Policy #Reading Reflections #SelfDistillation Issue Date: 2026-06-01 Comment
元ポスト:
日本語でのOPSD解説で、細かい数式などよりも、何が重要で、なぜ今なのかといった気持ちのところが非常に重点的に説明されている。
後半の今後の課題の、どの程度の能力であればself teacherが成立するのか、どのような情報を与えると良いのか、といった話は、
- [Paper Note] Unmasking On-Policy Distillation: Where It Helps, Where It Hurts, and Why, Mohammadreza Armandpour+, arXiv'26, 2026.05
で模索されている。
また、OPSDの気持ち的な部分だけでなく、(簡単な)数式的な解釈、最近のサーベイなど、より詳細な情報は
- The Imitation Game: State of Policy Distillation in Language Model training, 032-Chinmay Karkar, 2026.05
のブログにまとめられているので参照のこと。
MiniMax-M3, MiniMaxAI, 2026.06
Paper/Blog Link My Issue
#Article #NLP #LanguageModel #MultiModal #OpenWeight #Post #VisionLanguageModel #UMM #One-Line Notes #Reference Collection #Author Thread-Post Issue Date: 2026-06-01 Comment
ベンチマーク上はフロンティアモデルに性能がかなり肉薄しており、10日以内にモデルがオープンになる。
所見:
関連:
- [Paper Note] Learning Dynamics of LLM Finetuning, Yi Ren+, ICLR'25 Outstanding Paper Award
Artificial Analysisによる評価:
OpenWeightでSoTA
MLエンジニアのための本質から理解するLLM推論 KV cache編, Kazuki Fujii, 2026.05
Paper/Blog Link My Issue
#Article #Tutorial #NLP #LanguageModel #LLMServing #One-Line Notes #KV Cache #Author Thread-Post Issue Date: 2026-05-31 Comment
元ポスト:
次:
- MLエンジニアのための本質から理解するLLM推論: LLM Inference Benchmarking, Kazuki Fujii, 2026.05
数式レベルで、図解付きで曖昧性なく、非常に丁寧で、かつ実装面にまで踏み込んだ解説だが、冗長ではなくコンパクトに解説されており、すごい。今度からKV Cacheってなんなんですか?の問いにはこの記事をベースに教えよう。感謝🙏
[Paper Note] LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding, Wang+, 2026.05
Paper/Blog Link My Issue
#Article #ComputerVision #NLP #CVPR #read-later #ObjectLocalization #VisionLanguageModel #2D (Image) #UMM #3D (Video) #text #ObjectDetection #GUI #Author Thread-Post Issue Date: 2026-05-30 Comment
元ポスト:
DeepSWE: Measuring frontier coding agents on original, long-horizon engineering tasks, DeepSWE, 2026.05
Paper/Blog Link My Issue
#Article #NLP #Dataset #AIAgents #Evaluation #Coding #SoftwareEngineering #read-later #One-Line Notes #LongHorizon #Author Thread-Post Issue Date: 2026-05-27 Comment
元ポスト:
所見:
既存のベンチマークのような、githubのPRに基づいたものではなく(memorizationの問題があるため)、ゼロベースで構築。rolloutのtrajectoryを分析して、有効なPRなのに拒否する、あるいは何らかのcheatingをするといった挙動のdetectionもできるとのこと。また、SWE Bench Proと比較して、タスクを解くためのpromptは1/2である一方、タスクを解くために必要なコードの量は5.5倍となっており、より複雑なタスクとなっている。
contamination-freeが主張されているが、データセットは公開されているので、そのうちcontaminationが生じるであろう点には注意。
Introducing 1-bit and Ternary Bonsai Image 4B: Image Generation for Local Devices, PrismML, 2026.05
Paper/Blog Link My Issue
#Article #ComputerVision #DiffusionModel #TextToImageGeneration #SmallModel #One-Line Notes #ImageSynthesis #LowPrecision #Author Thread-Post Issue Date: 2026-05-27 Comment
元ポスト:
HF: https://huggingface.co/collections/prism-ml/bonsai-image
Ternary Weight {-1, 0, 1}による画像生成モデル
Synthetic Persona Pretraining: Alignment from Token Zero, Minder+, 2026.05
Paper/Blog Link My Issue
#Article #Pretraining #NLP #LanguageModel #Alignment #SyntheticData #Blog #Reasoning #Safety #Initial Impression Notes #Author Thread-Post Issue Date: 2026-05-25 Comment
元ポスト:
**事前学習の時点で**Harmful/良性/ニュートラルな文書にReflectionに関するassistantの思考過程(何が間違っていて/間違っていなくて、それはなぜか)をappendすることで、道徳的に推論することを学ぶ。
[Paper Note] Shortcut Learning in Deep Neural Networks, Robert Geirhos+, Nature Machine Intelligence volume 2, 2020.11
Paper/Blog Link My Issue
#Article #NeuralNetwork #MachineLearning #Generalization #Nature Machine Intelligence #ShortcutLearning Issue Date: 2026-05-16 GPT Summary- 深層学習はAIの中心であり、多くの分野で成功を収めているが、その限界も明らかになってきている。本研究では、深層学習の問題をショートカット学習の症状として整理。ショートカットとは、標準ベンチマークでは良好だが実世界には適用できない決定規則を指し、生物と人工の学習システムに共通の特徴である可能性が示唆される。これに基づき、モデル解釈とベンチマーキングに関する推奨事項を提案し、実世界への応用に向けた機械学習の強化を考察。
Aurora: A Leverage-Aware Optimizer for Rectangular Matrices, Tilde Research, 2026.05
Paper/Blog Link My Issue
#Article #Pretraining #NLP #LanguageModel #Optimizer #read-later #Initial Impression Notes Issue Date: 2026-05-12 Comment
元ポスト:
nanoGPT speedrunのSoTAを更新したoptimiserのようである。
EMO: Pretraining mixture of experts for emergent modularity, Ai2, 2026.05
Paper/Blog Link My Issue
#Article #EfficiencyImprovement #NLP #LanguageModel #MoE(Mixture-of-Experts) #read-later #Routing #Initial Impression Notes Issue Date: 2026-05-11 Comment
元ポスト:
従来のMoEモデルを学習する際には全てのトークンが全てのexpertsに対してroutingされるため、能力のごく一部しか必要ないにもかかわらず、experts全体をデプロイする必要があり効率が悪かった。本研究では、MoEモデルを学習する際に、ドキュメント単位で8個のshared experts poolに対してのみtokenがroutingされるように制約することで、特定のexpertsの集合が特定のドメインのexpertsとなることが奨励されmodularityが高まり、必要なexpertsのみをデプロイすることで効率化が図れるようになるので嬉しい、といった話に見える。
Natural Language Autoencoders: Turning Claude’s thoughts into text, Anthropic, 2026.05
Paper/Blog Link My Issue
#Article #Analysis #NLP #LanguageModel #Explanation #Safety #Initial Impression Notes #Author Thread-Post Issue Date: 2026-05-10 Comment
LLM内の数値情報として保持されるactivationの情報をテキストで説明させる技術 Natural Language Autoencoeder (NLA) で、従来のSparseAutoencoderを用いたProbingなどとは異なり、より直接的にテキストによってactivationの情報を出力させる。
手法はシンプルで、autorncoderを用いて、target modelのactivationに関する情報が入力されたときに、
- Activation Verbalizerが、activationを説明するテキストを生成し
- Activation Reconstructorが、生成された説明テキストから元のactivationを復元する
- Activation Verbalizer/Reconstructorをreconstruction lossによって学習する
というもののようである。
このような手法はAI safetyの分野などで活用することができ、たとえば、Opus 4.6はBlackmail testingにおいて、context中でそのような情報を明言していないにも関わらず、NLAによるverbalizationによってそのような疑念を抱いていることが示唆される。
元ポスト:
所見:
The ultimate guide to RL environments: building and scaling them in the LLM era, HuggingFace, 2026.05
Paper/Blog Link My Issue
#Article #Tutorial #NLP #LanguageModel #ReinforcementLearning #Blog #PostTraining #read-later #Environment Issue Date: 2026-05-08 Comment
元ポスト:
Multi-Teacher On-Policy Distillation: A New Post-Training Primitive, Yumo Xu, 2026.04
Paper/Blog Link My Issue
#Article #Multi #Tutorial #NLP #LanguageModel #ReinforcementLearning #Blog #Distillation #PostTraining #On-Policy #One-Line Notes Issue Date: 2026-05-08 Comment
元ポスト:
(multi teacher)オンポリシー蒸留の解説を、気持ち(何かに特化させると、他の部分が劣化していて、多方面に優れたモデルを学習するのが難しい課題を克服したい)だけでなく、
GRPOに対してAdvantage部分を生徒と教師モデルのreverse KLに置き換えることで統合できるよ、という説明と、
なぜreverse KLを使うのかという説明[^1]、
最近の最先端のOpenLLMにおいてmulti teacher オンポリシー蒸留がどのように使われているかが丁寧に説明されている。
[^1]: forward KLだと教師が少しでも確率を持つトークンにおいて生徒の確率が0だと発散するのでスムージングされた分布になってしまい、特定のトークンにフォーカスした分布が形成されづらく、テキスト生成の多峰性と(意味不明な出力をできるだけ回避するという意味での)安全性の観点からreverse KLの相性が良いよ、という話)
関連:
- 【LLM】On-Policy Distillation入門:小規模モデルを「実戦」で育てる技術, Currently Learning そんけいご, Zenn, 2026.02
解説と所見:
