Workspace レベルのサマリー メトリクス、折れ線グラフ、pinned Runs、または baseline run を使って run を比較する方法については、Pin and compare runs を参照してください。Eval Tables では、ログされた表内で、対応付けられた例と Eval Table 固有のスコアを比較します。
- project の Workspace にアクセスします。
- Eval Tables パネルまでスクロールします。
- + ボタンを選択します。
- 追加する run を選択します。
input_columns を使用している場合、W&B はそれらの列を Inputs セクションにまとめて表示します。同様に、共通の output_columns と score_columns は、それぞれ Outputs セクションと Scores セクションでグループ化されます。
次のスクリーンショットは、summer-butterfly-9 run と gentle-flower-8 run を比較する Eval Table を示しています。

参照 run を設定する
複数の Runs を比較する場合、W&B はデフォルトで一番左の run を参照 run に指定します。参照 run は、スコアの差分を計算する際の baseline です。 別の参照 run を選択するには、run にカーソルを合わせてメニューを開き、Set as reference を選択します。集計スコアを表示
W&B は、選択した各 run の各スコア列ごとに集計値を計算します。計算方法は、スコアのデータ型によって異なります。
次のスクリーンショットでは、correct スコアと confidence スコアの集計値を示しています。

スコア差分を比較する
各スコア列について、W&B は基準となる run と、選択した他のすべての run との差分を計算します。 W&B は各差分を次のように計算します。summer-butterfly-9 が参照 run、gentle-flower-8 が比較対象の run であるとします。W&B は信頼度差分を次のように計算します。
差分が正の場合、比較対象の run の値が参照 run より高いことを意味します。差分が負の場合、比較対象の run の値が参照 run より低いことを意味します。
次のスクリーンショットでは、スコア差分が強調表示されています。
