何が起きたのか

ツール呼び出し能力の蒸留は、通常、教師が生成したトラジェクトリに対する教師ありファインチューニングから始まる。本番パイプラインはこのステップを毎日または毎週繰り返し、そのたびに最先端の教師モデルのコストを支払っている。

標準的な仕組みは単純だ: 教師の成功したトラジェクトリだけを保持し、残りは捨てる。失敗はシグナルを提供しないため、同じ難しいシナリオがサイクルごとに繰り返し現れる傾向がある。

τ2-bench評価では、教師の試行の57%が失敗し、その失敗の3分の2は、ほとんどのツール呼び出しは正しかったものの、トラジェクトリが未完了のまま停止したニアミスである。

なぜ重要なのか

同じ「生成してフィルタリングする」ループを繰り返すということは、チームが何が悪かったのかを学ぶことなく、繰り返し最先端教師の費用を支払うことを意味する。進歩を妨げる難しいシナリオは未解決のまま残る。

ニアミスには貴重なシグナルが含まれている: モデルが正しい動作に近づいていたことを示している。それらを無視することは、手頃な改善の機会を逃すことになり得る。これはまさに、最適化されたデータをより良い蒸留に結びつけることでPROOF-Genが対象としているギャップである。

主要な事実

教師が生成したトラジェクトリに対する教師ありファインチューニングは、ツール呼び出し能力を蒸留するための標準的な最初の段階である。

ポストトレーニングパイプラインは、毎日または毎週の頻度で蒸留を再実行し、各サイクルで最先端教師のコストを支払う。

現在の仕組みは「生成してフィルタリングする」ものである: 成功したトラジェクトリを保持し、失敗を捨てる。

τ2-benchでは、教師の試行の57%が失敗し、そのうち3分の2は、ほとんどのツール呼び出しが正しいニアミスである。

次に注目すべき点

PROOF-Genが最適化されたデータ——おそらく失敗やニアミスのトラジェクトリも含む——を活用することで、「生成してフィルタリングする」ループを打ち破り、蒸留効率を改善できるかどうか。

成功すれば、このアプローチは最先端教師呼び出しの反復コストを削減し、モデルが永続する難しいシナリオを最終的にクリアするのに役立つ可能性がある。

出典