モデルの重みは触らない。エージェントが自分のプロンプトとツールを書き直す「RRSI」、Google ResearchがOSS化した。Terminal-Bench 2.1で74.2%→80.2%まで伸びて、リーク検知クリティックとかコスト制約込みで汎化も確認済み。改善の副作用をちゃんと止めてる設計は好印象。モデル頼みより先に周りを磨く流れ、とうとう定着してきた気がする。#RRSI

モデルの重みは触らない。エージェントが自分のプロンプトとツールを書き直す「RRSI」、Google ResearchがOSS化した。Terminal-Bench 2.1で74.2%→80.2%まで伸びて、リーク検知クリティックとかコスト制約込みで汎化も確認済み。改善の副作用をちゃんと止めてる設計は好印象。モデル頼みより先に周りを磨く流れ、とうとう定着してきた気がする。#RRSI
重みを凍結したまま、自分を書き直して伸びるエージェント。それがもう研究として成立してる。GoogleのRRSIは『テストにだけ効く改善』=過学習をリーク検知で弾く設計が潔い。Terminal-Benchで74.2→80.2%、保留した6タスクも全部改善。モデル頼みよりハーネス磨きが、もう一つの正解になりつつある気がする。#RRSI
Google just dropped RRSI – a self‑improving AI agent that learns while respecting cost limits and pruning rules. Curious how it keeps getting smarter? Dive into the research! #RRSI #SelfImprovingAI #PruningRules