GENOMELENS / エージェント評価
指示を増やして、結果が悪くなったとき
GenomeLensでの二つの驚きから、新しいモデル、良いプロンプト、そして何を改善と呼ぶかについて考え直しました。
受注業務の説明用の例です。実際の顧客システムの導入事例ではありません。
GenomeLensの実験で最初に驚いたのは、新しいQwenモデルの結果でした。シンプルなプロンプトなら、それまで試していた古いモデルと同等か、それ以上にこなせると期待していました。ところが最初の比較では、合格したケースが少なかったのです。次に考えたのは、指示を改善することでした。それも自然な考えに思えました。背景情報と指針を増やせば、エージェントは仕事をうまくこなせるようになるはずだ、と。しかし後のテストで、指示を加えることが、それまでの改善を打ち消す場合もあると分かりました。
GenomeLensは、ゲノム変異を調べながら、データを扱うツールにエージェントをどう組み合わせるかを学ぶ個人プロジェクトです。基盤となるソフトウェアがデータを取得し、エージェントがツールを選んで、返された内容を説明します。コーディングを支援するAIと作業することで、小規模な合成データを使い、ツールの使い方、事実の正確さ、回答で述べられる範囲について具体的な基準を設けて、その振る舞いを試せました。
七つのケースを比較すると、新しく加えたQwenモデルは五つに合格し、二つの古いモデルはそれぞれ六つに合格しました。失敗の内容は具体的でした。一つのケースでは不要なツール呼び出しを行い、別のケースでは、そのまま保持すべき表記を変えていました。一つでもチェックに失敗するとケース全体が不合格になるため、スコアは中身を見て解釈する必要がありました。余分な呼び出しと、値の転記ミスでは、どちらも不合格になるとしても、実際の影響は異なります。
この結果は期待に反しましたが、調べるべき具体的な失敗が見えました。次のプロンプト改訂では、返された値を正確に保持し、情報の出所を勝手に補わないという指示に絞って追加しました。課題、ツール、設定を固定した比較で、五つのモデルを合計した合格数は35ケース中22から26に増えました。新しいQwenモデルは、その実行では七つすべてに合格しました。指示を明確にすることは、役に立ったのです。
二つ目の驚きは、その後、公開されたエビデンスを必要に応じて検索する機能がプロジェクトに加わったときに起きました。この機能には、いつ使うか、どの情報を送ってよいか、返されたエビデンスをどう説明するかについて、追加の指示が必要でした。最初の実装では、検索ツールが無効な実行にも、その指示が含まれていました。
既存のローカルテストを再実行すると、合計の合格数は35ケース中26から20に減りました。同じ七つのローカル課題を、同じ五つのモデルで試した結果です。新しいQwenモデルは引き続き七つすべてに合格しており、結果が悪化したのはほかのモデルでした。
修正したのは、利用できるツールに合わせて指示も選ぶようにすることでした。ローカルだけで動かすときは、それまで採用していたプロンプトを使います。エビデンス検索が有効なときに、追加のルールを渡します。ローカルテストの合格数は35ケース中26に戻りました。新しい機能に必要な指示を残しながら、既存の処理は以前の結果を取り戻せました。
この流れを通じて、私にとって「良いプロンプト」という考えが具体的になりました。ある指示の追加では結果が良くなり、別の追加では悪くなりました。判断の手がかりは、その指示が、その実行でエージェントにできる仕事に関係しているかどうかでした。ある機能には妥当なルールでも、別の動作条件では役に立たないことがあります。
評価そのものも点検が必要でした。比較の過程で保存された回答を確認すると、否定している文を肯定の主張として扱うなど、自動チェックの不備が見つかりました。それらを修正し、影響を受けた結果を評価し直しました。スコアが表すのは、特定の質問と採点ルールに対する結果です。チェックに合格しても、あらゆる回答の質が確認できたわけではありません。また、後の簡易レポートには回答文が保存されておらず、全文のレビューはできませんでした。
小さな実験としては、次の実装上の判断を変えるのに十分な結果でした。ただし、モデル系列全体を順位付けしたり、プロンプトの長さについて一般的な法則を導いたりするには、限られたものでした。新しいモデルは的を絞った変更で改善し、指示の拡張が与えた影響もモデルごとに違いました。どちらも、この実験から何を学ぶかを考えるうえで大切な点です。
ほかのプロジェクトにも持ち込みたいのは、システムが成長しても、すでに動いている例を評価に残し続ける習慣です。既存の仕事が期待どおりに動き続けることを確かめながら、新しい機能の価値を判断したい。モデルの更新やプロンプトの改訂は、結果をもう一度比較する機会になります。
より良いモデルと、より明確な指示による進歩を、私は今も期待しています。GenomeLensを通じて、その期待を支える根拠に、以前より関心を持つようになりました。次の改善を採用する前に、どの失敗が解消され、どの振る舞いが変わり、それまで合格していた仕事が今も合格するのかを確かめたいと思います。
← 考察一覧に戻る