この記事のポイント
- 普段の作業を題材にし、答えを見る前に合格条件を決める。
- 同じ入力と条件で比べ、待ち時間と手直し時間を分ける。
- 1問の勝敗を一般化せず、用途ごとに選ぶ。
サムネイルはイメージ写真。写真の配布元:Unsplash(利用許諾)。紹介するサービスの画面ではない。

AIの比較記事で高評価でも、自分のメール整理には使いにくい。そんなことは十分ありうる。文章の流暢さ、条件を守る力、必要な修正の少なさは、同じものではないからだ。選ぶ前に、小さな「自分用の試験」を作ってみてはどうだろう。
Anthropicの評価ガイドも、成功条件を具体的かつ測定可能にし、実際の用途に合う課題で評価することを勧めている。本記事はその考え方を日常の作業へ落とし込んだ、本誌独自の比較手順である。特定サービスを実測して順位を付けた記事ではない。参考:Anthropicの評価ガイド
第1問は「上手な作文」より、答えが決まる整理
題材は架空のイベント連絡にする。実在する人のメールを渡さなくても、普段の作業に近い形で試せる。
各AIへ同じまま渡す入力例
次のメモから、読書会の参加者向け案内を作ってください。箇条書きは3項目だけにし、日時、場所、持ち物をそれぞれ1項目にしてください。メモにない情報は補わず「未定」としてください。
メモ:読書会は10月8日18時から。会場は未決定。好きな本を1冊持参。参加費は今回は案内に含めない。
答えを見る前に、合格条件を紙に書く。「10月8日18時を保つ」「場所を未定にする」「本1冊を残す」「3項目だけ」「参加費と曜日を追加しない」の5つだ。曜日を指定していないのは、年がないのに勝手に補うかを見るためでもある。
満点でも、手直しが多い回答はある
内容が正しくても、前置きが長かったり、宛名を削る必要があったりすれば、その分の操作が増える。そこで、回答が出るまでの時間と、実際に使える文章へ直す時間を分けて記録する。
| 記録欄 | 何を書くか |
|---|---|
| 利用条件 | サービス名、表示されたモデル、プラン、実施日、検索などの設定 |
| 合格項目 | 事前に決めた5条件のうち、満たした数 |
| 待ち時間 | 送信から回答が出そろうまでの秒数 |
| 確認・手直し時間 | 読み始めてから、使える状態になるまでの秒数 |
| 重大な失敗 | 日時の変更、架空の会場の追加など |
時間はスマートフォンのタイマーでも測れる。ただし、人が読む速さや通信環境も混ざるので、モデルの純粋な性能測定にはならない。それでも、自分の作業が終わるまでの負担を知るには意味がある。
公平に比べるための小さな工夫
- 毎回、新しい会話から始める。個人向けの保存指示や過去の会話を使う設定は、可能な範囲でそろえる。
- 入力文を変えずに渡す。今回の課題は外部情報が不要なので、検索など追加機能の条件もそろえる。
- 同じ課題を各3回程度試し、次に日時欠落版、場所決定版などの別問題を使う。合格回数と手直し時間の中央値を残す。
- 読む順番を入れ替える。最初の回答だけ丁寧に直すと、比較に偏りが出る。
条件をそろえられないサービスは、その差を記録する。モデル名が表示されなければ「不明」でよい。見えない内部モデルを推測して比較表を埋める必要はない。
安いAIも高いAIも、「その仕事」で判断する
少数の試験から万能な順位は付けられない
3回の結果は、安定性を見る最初の手掛かりにすぎない。短い案内文で合格しても、調査や長文の読み取りで同じ結果になるとは限らない。重大な誤りがあれば、速さとは別に記録する。
気に入った候補が残ったら、普段の作業でもう数日記録する。支払う料金は契約画面で確かめ、無料で使える範囲と必要な回数を合わせて考える。何でも一つのAIに任せるより、「案内文はこれ、資料確認は別」と分けたほうが手直しが減ることもある。比較の結論は、世間で一番のAIではなく、自分が次に使う道具が決まることで十分だ。
情報確認日:2026年9月20日。機能・提供条件は変更される場合がある。プロンプト、架空例、比較の観点はRyXeon独自作成。


コメント