Creativity


Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #PostTraining #autoresearch Issue Date: 2026-08-24 GPT Summary- LLMエージェントは、訓練戦略の内部で反復しながら事後訓練を行い、下流の性能を改善する能力を持つ。しかし、実際には初期の戦略が固定され、訓練後は局所的な調整に陥ることが多い。これに対し、経験駆動のアプローチは実行力を向上させ、指導は初期戦略を効果的に再指向するが、その後の調整は不十分である。重要なのは、エージェントが自発的に戦略を再評価する仕組みが欠けていることである。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #AIAgents #Evaluation #autoresearch #Author Thread-Post Issue Date: 2026-08-22 GPT Summary- 再帰的自己改善(RSI)に関する本研究は、AIシステムが他のAIシステムを自ら改善できるかを探求し、その過程として訓練アルゴリズムの設計が鍵となることを示す。AI4AI-Benchという新たなベンチマークを提示し、エージェントが訓練アルゴリズムを最適化する能力を評価。各タスクにおいてエージェントはコードを書き換え、実行結果を比較。平均スコアは0.166、最良システムで0.250に達したが、既存アルゴリズムとの距離は依然として大きい。タスク群や評価結果を公開し、再現性のある測定を可能にする。 Comment

元ポスト:

Loading…




Paper/Blog Link My Issue
#NLP #LanguageModel #COLM #One-Line Notes #Author Thread-Post #WeightSteering Issue Date: 2026-08-02 GPT Summary- CreativityNeuroを導入し、大規模言語モデルの発散的思考を改善する。これにより、人間の百分位点を14ポイント向上させ、独創性や驚きを顕著に増加させ、モード崩壊を減少させることを示した。特に、DATではアクティベーション・ステアリングと同等の成果を上げつつ、別のタスクには転移しない有効性が確認された。行動データや再訓練なしに創造性を高める方法を提供する。 Comment

元ポスト:

Loading…

関連:
- [Paper Note] Math Neurosurgery: Isolating Language Models' Math Reasoning Abilities Using Only Forward Passes, Bryan R. Christ+, ACL'25, 2024.10

- [Paper Note] Math Neurosurgery: Isolating Language Models' Math Reasoning Abilities Using Only Forward Passes, Bryan R. Christ+, ACL'25, 2024.10

の手法をCreative Thinkingドメインに適用。Creative Thinking分野は構造化されたデータセットを構築することは困難だが、Promptで振る舞いを記述することは可能なことから、Constrativeなプロンプト(creative vs. non-creative, Table1)を利用し、Math Neuro/Wandaでのパラメータの重要度同定手法を適用し、同定したパラメータの重みをスケーリングすることで、Creative Thinking能力を向上させる。

image

Divergent Association Task (なるべく互いの距離が大きくなるようにN個の単語を生成するタスク)によって評価したところ性能が向上し (Figure 2)、720人の人間による評価者を用いた評価では、Originarity, Surprise, Creativityが有意に改善した(**Activation Steeringでは有意な改善は見受けられなかった**)、という話のようである。




Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #SyntheticData #Blog #One-Line Notes #Reading Reflections #Data #autoresearch #Author Thread-Post #AgentHarness Issue Date: 2026-08-19 Comment

元ポスト:

Loading…

Data researchを自動的に実施することに特化したAgentHarness。端的に言うと、あるデータをキュレーション/合成し、decontaminationを実施した上でモデルを学習、評価、実験結果に基づいて改善を繰り返す。これによりClaude Codeを上回る性能を実現している。

image

興味深いのはClaude Codeと比較して、DataSmithを使うと2.6倍思考(reasoning tokenを生成)し、6.6倍のデータセットを試し、48.4倍のsubagent callを1回のsessionで実現する。そして、45倍のコードを記述し、1.8倍の研究アイデアを創出する。
image

decontaminationがどれだけ正確にできているかが鍵になりそうだなと思ったが、本ブログには具体的なアルゴリズムの記述はないように見えた。

が、以下のページには一言記載があり、どうならN-gramベースのmatchingでdecontaminationを実施しているようである。
https://www.datologyai.com/product?utm_source=chatgpt.com

- [Paper Note] Soft Contamination Means Benchmarks Test Shallow Generalization, Ari Spiesberger+, arXiv'26, 2026.02

で指摘されているように、表層ベースのマッチングアルゴリズムだけではSoft Contamination(意味的には重複しているが表層が異なるもの)は無くせない点で、limitationがあると考えられる(ただしこれは本ハーネスだけの問題というより評価全体の問題ではある)。