シマー:自己研磨スキル
← 全記事バークレーの研究者たちは、出力を評価し優先順位付きの実行可能なフィードバックを与えられる限り、RLスタイルのフィードバックループをあらゆるテキストタスクに適用できることを示しました。彼らはこれをActionable Side Information(ASI)と呼んでいます。目標は次に何を改善すべきかに焦点を当てたフィードバックです。APIなら「POSTエンドポイントにエラーレスポンスがない」かもしれません。ストーリーなら「第二段落でペーシングが落ちる」かもしれません。生成器が散漫にならずに行動できるほど焦点が絞られていることが必要です。

私たちはこれをシマーというClaude Codeスキルとして構築しました。何を洗練させるか、「より良い」ための基準を定義します。エージェントが生成し、それらの基準に対して評価し、優先順位付きの修正をフィードバックして繰り返します。テキスト形式のものなら何にでも機能します。アドベンチャーフック、ピッチメール、API仕様、ブログ記事。
次に私たちはシマーを使って、シンプルな内側/外側のエージェントループを使いながらシマー自身を研磨させてテストしました。外側のループ:スキル定義のバージョンを取り、どれだけうまく機能するかを評価し、ブレークポイントを見つけ、スキルを改善して繰り返します。各バージョンで内側のループ:そのスキル定義とテストタスクのセットで3つのエージェントを起動し、各エージェントがそれらのタスクを独立してシマーし、結果を比較します。3回の外側のイテレーション。これが何を教えてくれたかを紹介します。

審査員はキャリブレーションがないと膨らませる
最初の内側の実行で、スコアの軌跡を確認すると全員が9.2を記録しており、実際のテキストを読むまでは素晴らしく見えました。極めて具体的な基準なしには、各サブエージェントの審査員がスコアを膨らませていました。例えば3回目のイテレーションのアドベンチャーフックにはまだ受動的なヴィランと賭けるものがなく、説得力あるD&Dアドベンチャーモジュールになっていませんでした。
審査員は、どこから始まったか、スコアが何を意味するかの記憶がなかったため、寛大なスコアに流れていました。修正方法は、シードアーティファクトとそのイテレーション0のスコアを毎ラウンドの永続的なコンテキストとして審査員に与え、さらに各スコアレベルが何を意味するかの明示的なアンカーを追加することでした。それを加えると、スコアが一貫して、実行を通じてより方向性の正しいものになりました。
スキルはアーティファクトよりも速く改善した
内側のループの結果は外側のイテレーションを通じて改善しましたが、アーティファクトが劇的に変化したからではありませんでした。アドベンチャーフックとAPI仕様は最初の実行から真に良いものでした。時間をかけてスキルで主に改善されたのは、私たちには明確に見えた指示がエージェントには曖昧に見えたということを、イテレーションが特定するのを助けたことです。「デフォルト3イテレーション」は3つの異なるイテレーション数を生み出しました。「軌跡を記録する」は3つの異なるテーブルスキーマを生み出しました。修正は常に同じでした:指示を明示的な契約に置き換えること。3回目の外側のパスまでに、内側のループの3つのエージェントすべてが同じプロセスに従い、比較可能なスコアを生み出し、独立して同様の品質レベルに到達しました。この実験的なループでシマーが自分自身を研磨させることで、サブエージェントの実行とフルパイプラインの実行がより一貫したものになりました。
なぜ機能するか
従来のMLでは、フィードバックループは何千回ものイテレーションを通じて潜在空間をランダムウォークして解を近似することを意味します。私たちのエージェントではそれをする必要がありません。バックボーンのLLMは大規模な事前学習済みの能力とほとんどのトピックへの確かな理解から始まります。モデルは良いAPI仕様がどのようなものかを、説得力あるアドベンチャーフックがどのように読めるかをすでに知っています。ゼロから探索する必要はありません。この特定のアーティファクトに何が欠けているかを指摘する人が必要なのです。それがASIメカニズムを実用的にするものです。焦点を絞ったフィードバックと有能なエージェントがあれば、3,000回ではなく3〜5ラウンドで収束します。
試してみる
シマーはClaude Codeのプラグインです。
/plugin marketplace add 2389-research/claude-plugins
/plugin install simmer




