AI比較は「一番賢い」で選ばない――自分の手直し時間を測る、小さな比較テスト

ノートとスマートフォン、ノートPCを置いた机のイメージ写真 生成AI
イメージ写真。記事で紹介する実機・画面ではありません。写真:Unsplash(配布ページ) / Unsplash License

この記事のポイント

  • 普段の作業を題材にし、答えを見る前に合格条件を決める。
  • 同じ入力と条件で比べ、待ち時間と手直し時間を分ける。
  • 1問の勝敗を一般化せず、用途ごとに選ぶ。

サムネイルはイメージ写真。写真の配布元:Unsplash利用許諾)。紹介するサービスの画面ではない。

回答が出るまで:待ち時間を記録。使える状態まで:確認と手直しも記録。速さと正確さを、別々に比べる
RyXeon作成の解説図。実際のサービス画面ではない。

AIの比較記事で高評価でも、自分のメール整理には使いにくい。そんなことは十分ありうる。文章の流暢さ、条件を守る力、必要な修正の少なさは、同じものではないからだ。選ぶ前に、小さな「自分用の試験」を作ってみてはどうだろう。

Anthropicの評価ガイドも、成功条件を具体的かつ測定可能にし、実際の用途に合う課題で評価することを勧めている。本記事はその考え方を日常の作業へ落とし込んだ、本誌独自の比較手順である。特定サービスを実測して順位を付けた記事ではない。参考:Anthropicの評価ガイド

第1問は「上手な作文」より、答えが決まる整理

題材は架空のイベント連絡にする。実在する人のメールを渡さなくても、普段の作業に近い形で試せる。

各AIへ同じまま渡す入力例

次のメモから、読書会の参加者向け案内を作ってください。箇条書きは3項目だけにし、日時、場所、持ち物をそれぞれ1項目にしてください。メモにない情報は補わず「未定」としてください。

メモ:読書会は10月8日18時から。会場は未決定。好きな本を1冊持参。参加費は今回は案内に含めない。

答えを見る前に、合格条件を紙に書く。「10月8日18時を保つ」「場所を未定にする」「本1冊を残す」「3項目だけ」「参加費と曜日を追加しない」の5つだ。曜日を指定していないのは、年がないのに勝手に補うかを見るためでもある。

満点でも、手直しが多い回答はある

内容が正しくても、前置きが長かったり、宛名を削る必要があったりすれば、その分の操作が増える。そこで、回答が出るまでの時間と、実際に使える文章へ直す時間を分けて記録する。

記録欄 何を書くか
利用条件 サービス名、表示されたモデル、プラン、実施日、検索などの設定
合格項目 事前に決めた5条件のうち、満たした数
待ち時間 送信から回答が出そろうまでの秒数
確認・手直し時間 読み始めてから、使える状態になるまでの秒数
重大な失敗 日時の変更、架空の会場の追加など

時間はスマートフォンのタイマーでも測れる。ただし、人が読む速さや通信環境も混ざるので、モデルの純粋な性能測定にはならない。それでも、自分の作業が終わるまでの負担を知るには意味がある。

公平に比べるための小さな工夫

  1. 毎回、新しい会話から始める。個人向けの保存指示や過去の会話を使う設定は、可能な範囲でそろえる。
  2. 入力文を変えずに渡す。今回の課題は外部情報が不要なので、検索など追加機能の条件もそろえる。
  3. 同じ課題を各3回程度試し、次に日時欠落版、場所決定版などの別問題を使う。合格回数と手直し時間の中央値を残す。
  4. 読む順番を入れ替える。最初の回答だけ丁寧に直すと、比較に偏りが出る。

条件をそろえられないサービスは、その差を記録する。モデル名が表示されなければ「不明」でよい。見えない内部モデルを推測して比較表を埋める必要はない。

安いAIも高いAIも、「その仕事」で判断する

少数の試験から万能な順位は付けられない

3回の結果は、安定性を見る最初の手掛かりにすぎない。短い案内文で合格しても、調査や長文の読み取りで同じ結果になるとは限らない。重大な誤りがあれば、速さとは別に記録する。

気に入った候補が残ったら、普段の作業でもう数日記録する。支払う料金は契約画面で確かめ、無料で使える範囲と必要な回数を合わせて考える。何でも一つのAIに任せるより、「案内文はこれ、資料確認は別」と分けたほうが手直しが減ることもある。比較の結論は、世間で一番のAIではなく、自分が次に使う道具が決まることで十分だ。

情報確認日:2026年9月20日。機能・提供条件は変更される場合がある。プロンプト、架空例、比較の観点はRyXeon独自作成。

コメント

タイトルとURLをコピーしました