この記事本文を日本語に翻訳します。以下、指示どおりHTML構造・CSS・SVG・class/id・コード等はすべてそのまま保持し、可視テキストのみ翻訳します。
プロダクト発表 · 小互解読

Everyチーム9人が1ヶ月実測:GPT-5.6 Solは結局どうなのか

コーディング、ライティング、知識労働、Agentの4大シーンでの一次的な使用感
30秒速読
  • OpenAIが新世代モデルGPT-5.6 Solを発表。価格は100万トークンあたり入力$5、出力$30で、Claude Opus 4.8と入力価格は同水準、出力は$5高い。同時に中位モデルTerra($2.50 / $15)と軽量モデルLuna($1 / $6)の2モデルも投入。
  • OpenAIによれば、SolはTerminal-Bench 2.1(コマンドラインagentタスクのテスト)で新記録を樹立、長期にわたる生物学ベンチマークとサイバーセキュリティのテストでも前世代のGPT-5.5を上回るという。
  • Every編集部のメンバー9人が1ヶ月実測:Solは自社のライティングブラインドテストでは6モデル中最下位、読みやすさも最低だったが、自作のコードリファクタリングベンチマークでは56/100(Claude Fable 5は90/100)。差の主因はSolの能力不足ではなく、シンプルな要件を過度に複雑化してしまう癖にある。
  • 同時にOpenAIはChatGPTとCodexのデスクトップクライアントを1つの統合Appに統合し、max(単一agentで思考時間を延長)とultra(複数agentが協調して同じタスクに取り組む)という2段階の推論設定を追加した。
1 新モデル3段階

OpenAIが一気に3段階の新モデルを発表

OpenAIは先日、新世代モデルGPT-5.6 Solを発表すると同時に、中位モデルTerra、軽量モデルLunaの2つの新モデルを投入し、ChatGPTとCodexのデスクトップクライアントを1つの統合Appに統合した。

今回は一気に3段階:フラッグシップのSol、中位のTerra、軽量のLuna。OpenAIはSolを自社「現時点で最強のモデル」と位置づけ、コマンドラインagentタスクのテストTerminal-Bench 2.1で新記録を樹立、サイバーセキュリティ能力でも自社最強世代だとしている。

注目すべき理由:OpenAI公式データによれば、SolはTerminal-Bench 2.1で新記録を樹立し、長期にわたる生物学ベンチマークとサイバーセキュリティのテストでも前世代のGPT-5.5を上回っている。しかし同じこのモデルが、Everyチーム9人による1ヶ月の独立したライティングブラインドテストでは、6モデル中最下位、読みやすさも6モデル中最低だった。「最強」とされるモデルが、なぜライティングでは最下位になり、それでいてチーム全体が手放せない相棒になったのか。この実測が明らかにしたいのはそこだ。
フラッグシップ
Sol
日常の知識労働の主力、公式は現時点で最強と称する
中位
Terra
よりコスパの良い日常モデル
軽量
Luna
最速・最安の1段階

OpenAIによれば、Sol、Terra、Lunaという3つの名前は「能力段階」として今後も維持され、各段階のモデル自体は更新され続けるという。ここではまず3段階の位置づけを整理し、具体的な価格とパワー設定は後の価格セクションで詳しく触れる。Terminal-Bench 2.1とは、AIがコマンドラインの中で自分で手順を計画し、試行錯誤し、各種ツールを呼び出して一連のタスクを完遂できるかを測るテストで、実際のエンジニアがターミナルで作業する様子を模している。

発表と同時に、OpenAIはChatGPTとCodexの2つのデスクトップクライアントを1つのAppに統合した。ChatGPT Workが大半の知識労働を担当し、Codexは技術系タスク専用のタブを獲得する。これは8億人超のChatGPTユーザーを「AI自身に複数ステップの作業をやらせる」モード(agentic)へと引き寄せる一歩と見られている。

2 チームの反応

1ヶ月なくなっただけで、チームは「石器時代に逆戻り」と言った

Everyはアメリカのメディア兼ソフトウェア企業で、深い分析記事を発信する一方、自社でもAIプロダクトを作っている。編集部は常に最先端モデルを一次情報として実際に使ってみるレビューを行っており、この「vibe check」シリーズは彼らの看板コンテンツだ。この記事が正式公開される前、Solは既に約1ヶ月間、Everyチームの日常業務に深く入り込んでいた——なくなったときに痛みを感じるほどに。

その1ヶ月間、Solはほぼどこにでも存在していた。Dan Shipperの受信トレイをゼロに保ち、会議やSlackに散らばっていて彼が本来なら見逃していたはずの決定事項を一つ一つ追跡してくれた。Austin Tedescoのペースにもついていけた:マーケティングのアイデアから、メール、ランディングページ、そして実験まで、彼が繰り返し説明したり集中力を失ったりする必要なく一貫して進行した。本稿の著者Katie Parrottにとっては、ファイルの取得やコンテキストの検索が驚くほど速くなり、彼女が毎日モデルとやり取りする方法を根本的に変えてしまった。

6月末、Solは政府の審査を受けるため一時的にオフラインとなり、チームはアクセス権を失った。Danは、他のモデルに戻ることは、たとえ手元にFableがあっても、まるで石器時代に逆戻りするようだったと語る。Austinは、GPT-5.5に切り替えることを「普段より重さが倍のバスケットボールを投げるようなもの」と表現した。Everyは以前のSonnet 5実測記事の中で「期待値が絶えず引き上げられる革命」という言い方をしていたが、このSol不在の期間はまさに、人間がより高い生活水準にどれほど早く慣れ、その水準が後退するときにどれほど辛いかを裏付けるものになった。

他のモデルに戻ると、たとえFableがまだあっても、まるで石器時代に逆戻りするようだった。

、Dan Shipper

GPT-5.5を使うのは、まるで普段使っているものより倍重いバスケットボールを投げるようなものだ。

、Austin Tedesco

Danにはもっと具体的なたとえがある。Solはポルシェで、Fableはワープエンジンだ。Fableはもちろん銀河系全体を横断できるが、たいていの場合、人は宇宙になんて行きたいわけではなく、ただ街中を走りたいだけで、Solはその「格好よく走らせてくれる車」なのだ。

3 Reach Test

9人、9つの本音

Everyの「Reach Test」は、役割の異なる9人のメンバーがそれぞれ一言でSolへの本音を語り、感情レベルを付けるというものだ。一目見れば、この依存度が形だけのものではないとわかる。

パラダイムシフト とても興奮 まあまあ、毎日は使わない 失敗した
とても興奮
Dan Shipper
マルチスレッドCEO
ほぼすべてのタスクでまず最初にこれを使う。一番難しい仕事だけFableに戻して、あとは全部5.6に任せる。
とても興奮
Kieran Klaassen
コンパウンドエンジニアリングの父
働き者。以前のGPTよりずっと信頼できて、Fableの仕事の9割くらいはこなせる。
とても興奮
Austin Tedesco
agentic味のあるグロース責任者
今まで使った中で最高の知識労働モデル。今では日常タスクの少なくとも8割を任せている。
とても興奮
Mike Taylor
チーフPPTエンジニア
日常の主力になった。最も優れていて、最もコスパの良い万能モデル、毎日使っている。
パラダイムシフト
Katie Parrott
昼はライティング、夜はvibe coding
5.6とCodexが私の仕事の仕方を根本から変えた、パラダイムシフトと言っていい。ただ本物の人間レベルの文章力にはまだ届かない。
とても興奮
Andrey Galko
エンジニアリング共同責任者
GPTでコードを書くことへの信頼を取り戻させてくれた。バカな失敗が少なく、聞き返しも少ない。ただCodexはプロセスを隠しすぎている。
とても興奮
Naveen Naidu
voice-pilledエンジニア
この1ヶ月ずっと第一選択で、一番信頼できる。Fableが計画を立て、Solが実行する。
まあまあ
Arielle Shipper
CSVと経費レポート愛好家
主導権をくれるのに、一つ一つの小さな判断に張り付かなくていい。ただ終盤に一度計算ミスがあって一気に目が覚めた。
とても興奮
Jack Cheng
ベテラン編集者、何でも屋
Fableより速くて細やか。協働モデルを一つだけ選べと言われたら、私はSolを選ぶ。

9枚のカードのうち8枚がポジティブに傾いており、1枚(Arielle)だけは終盤に計算ミスに遭遇したため「まあまあ」にとどまった。この全体的な傾向が、チームがなぜこれを日常の主力として使い続けているのかを説明している。では具体的にどこが強くて、どこで詰まるのか。以下でコーディング、ライティング、知識労働の順に掘り下げていく。

4 コーディング

実務はこなせるが、引き際を知らない

日々の開発において、SolはGPT-5.5に対して確実なアップグレードだ。見知らぬ本番コードベースの中でバグを最後まで追いかけられるし、大きなプロジェクトを最初から最後まで丸ごとやり抜くこともでき、他のモデルならとっくに手を止めているところでもテストを続けられる。チームの何人かのエンジニアは既にこれを日常の主力にしている。その限界が現れるのは、タスクがモデル自身に「何をやらないべきか」を判断させる必要がある場面だ。

Everyには「Senior Engineer」という独自のベンチマークがある。実在するが混沌としたコラボレーション用コードベースをモデルに渡し、ベテランエンジニアのようにシステムをどう作り直すべきか判断させるもので、まさに「いつ手を止めて過剰設計を避けるべきか」を試すことに主眼を置いている。このベンチマークでSolは56点、Claude Fable 5は90点を取った。

GPT-5.6 Sol
56
Claude Fable 5
90
コアの弱点

Solの強みは実行力で、弱点は抑制だ。アーキテクチャ全体を理解でき、システムの全面刷新をきっちりやり遂げることもできるが、必要な分だけ作って止まることができない。約12,900行のコードを4つの協調プロセスに分散させ、それぞれの追加は単体で見れば筋が通っているのに、合わせるとタスクが必要とする以上の複雑さを生み出してしまった。Danが振り返ったところ、SolとFableの差のほぼすべてが、評価表の中で「簡素化」を評価し「余分な仕組み」を減点する2項目に集約されるという。Everyはむしろ56点はSolを過小評価していると考えている。この点数の多くは、Solの「物事を複雑にしたがる」傾向をベンチマークが罰した結果だからだ。

約12,900行
Solが1回のシステム全面刷新で追加したコード量
4つ
そのコードが分散していた協調プロセスの数

要件が明確なら、真価を発揮する

逆に、目標さえ明確であれば、Solの実行力は十分な戦力になる。最も強力な実運用の一例は、Naveen Naiduが自社プロダクトMonologueの日々の開発でSolを使ったケースだ。GPT-5.5は推論レベルを最大まで上げても、ノート録音のバグの根本原因を何度も突き止められなかったが、Solは既存のコードベースを辿ってその失敗を追跡し、修正した。Kieran Klaassenも、チームのコラボレーション用ドキュメントエディタProofを一言のプロンプトからSolとFableそれぞれに再構築させてみたところ、Solは所要時間のおよそ3分の1でProof相当のアプリを動く状態で仕上げた(ただしデザイン面ではDanはFable版の方を気に入っている)。SolはまたGPT-5.5が仕上げきれなかったデジタルオーディオワークステーションも完成させた。

これらの結果はチームの体感と一致する。欲しいシステムさえはっきりしていれば、Solは速く、リソースの探し方もうまく、実装力も高い。「何を作らないべきか」の判断がタスクの中心になる場面では今もFableが第一選択だが、方向性さえ定まれば、実行はSolに任せるのが最も気楽だ。

5 ライティング

ブラインドテストで最下位、それでも最も手放せない相棒

Everyのライティングベンチマークでは、Solは6モデル中最下位。書いた文章は最も読みにくく、編集上の取捨選択も公開済みの参照版から最もかけ離れていた。それなのに、この同じモデルを、チーム全体が日常のライティングでSonnet 5やOpus 4.8よりも圧倒的に好んで使っている。答えは全編を貫く一つの枠組みにある。

全編を貫く枠組み

EveryはAIを使った仕事を2種類に分けている。一つは「委任」:タスクを割り振って人は離れ、後で使える成果物を確認して受け取る。もう一つは「協働」:人がずっとそばに付き、モデルが素早く選択肢を出し、人がリアルタイムで方向を決める。Solのスピード、指示への従順さ、コンテキストの活用力は、協働型の仕事において、チームが最もいたいと思う場所にした。一方で、最も大きく、最も曖昧で、何をやるべきかを考えること自体が仕事の大半を占めるようなタスクは、今もFableに任されている。この「委任 vs 協働」の分岐こそ、ライティングのブラインドテストで最下位になりながら日常では最もよく使われる理由の答えだ。

たとえるなら

委任は、プロジェクト全体を部下に任せて独立してやらせ、後で受け取って確認するようなもの。協働は、同僚と並んで同じドキュメントを編集し、随時口を挟んで方向を調整するようなものだ。Solは並んで原稿を直してくれる良い相棒で、Fableはプロジェクト全体を一人で担いきれる人材だ。

委任 ↔ 協働 · スペクトラム 委任 渡して、戻って確認する Fable / Opusが強い 協働 そばで直し、即決する Solが強い 日常主力の位置

コーディング、ライティング、知識労働、Agentの4つの評価軸は、すべてこの軸上に位置づけられる。左寄り(独立して判断し、一度で仕上げてから確認する)ならFableが安定し、右寄り(人がそばにいて見ながら直す)ならSolが使いやすい。そして日常のライティングの大半は、まさにこの右寄りに当てはまる。

この実測記事自体がその実例だ。Solは過去数十本の《Vibe Check》の文体の変遷を追跡でき、ある細部を裏付ける、Slackに埋もれていた過去のやり取りを掘り起こすこともできる。6〜8時間の集中作業の中で一気に24稿仕上げ、著者がじっくり考える間ずっと待たされることもなかった。稿ごとに一連の編集判断が加わり、少しずつ完成形へと近づいていく。反復と行き来を前提とするライティングという仕事にとって、これこそ強いモデルのあるべき姿だ。ただし記事の冒頭を一発で書き上げたり、人間のように的確に締めくくったりすることは、依然としてSolには届かない領域である。

24稿
著者がSolでこの記事のために連続して磨き上げた草稿数
6〜8時間
この24稿にかかった集中作業時間

ブラインドテストで最下位になった理由

ライティングベンチマークはあえて条件を絞ってあり、誰の助けもない状態でモデル自身がどう書くかだけを見る。その結果Solは最下位だった:公開済みバージョンとの類似度が最も低く、Flesch-Kincaidスコアが最も高く(=読みにくい)、読みやすさが最も低かった。Flesch-Kincaid(FK)とは、文の長さと語彙の難易度から文章を採点する指標で、スコアが高いほど読みにくいことを意味する。

6モデルのライティングベンチマーク比較表:最良の出来、類似度、学年レベルの難易度、読みやすさ
Everyのライティングベンチマーク:直近6モデルの類似度、学年レベルの難易度、読みやすさの比較。GPT-5.6 Solは最下位で、公開済み原稿との類似度が最も低く、FKスコアが最も高く読みやすさが最も低い。図 / Katie Parrott、Every

文は短いのに、単語は大きい

Solの書く文は比較的短く、一つの論証を引き締まった小さな段落に分けがちだ。《After Automation》向けに書いた最も良い出来の冒頭では、リズムがOpus 4.8よりも公開済みの冒頭に近く、一方Opusはより少なく、より大きな段落で展開する。問題は文の内部にある。文の長さが同程度でも、Solはより長く、より抽象的な語彙を好む。

Opus 4.8 · よりシンプルな語彙
  • the machine takes the task機械がそのタスクを引き受けた
  • it opens a frontierそれは新たなフロンティアを開く
GPT-5.6 Sol · より抽象的な語彙
  • the obvious effect is substitution明白な影響は代替である
  • the second-order effect is expansion二次的な影響は拡張である

Opusはよりシンプルな語彙を、より複雑な構文に詰め込む。Solが出すのはページをざっと流し読みするには快適だが、一行ずつ読むとかえって疲れる文章だ。目立ったAIの痕跡に関しては、むしろSolが最下位になった原因ではない。決まり文句的な転換、偽の対比、ありきたりな表現、繰り返しのレトリックといったチェック項目では、Solは中位につけている。その文章はクリーンにはなり得るが、機械っぽさをもう一度チェックせずにそのまま出せるほど常にクリーンというわけではない。

GPT-5.6 Solのライティングサンプル:短い文、引き締まった小さな段落
GPT-5.6 Solのライティングサンプル:短めの文、引き締まった段落、AIの痕跡は比較的少ない。図 / Katie
Opus 4.8のライティングサンプル:より複雑な構文、より長い段落
Opus 4.8のライティングサンプル:構文がより複雑で段落も長く、「not X, but Y」のような定型表現に陥りやすい。図 / Katie

コンテキストを与えると、水準が上がる

ブラインドテストはあえて「材料を渡さない」設計だが、実際の現場では人はモデルに大量の素材を与える。Solがそうしたコンテキストをどう吸収し使いこなすかを見ると、より輝く一面が現れる。著者は同じライティングタスク、同じ素材、同じ方向性を、SolとOpus 4.8それぞれに渡し、コラム《Working Overtime》の初稿をそれぞれ書かせた。Solは人を引き込む冒頭を返し、全体もこのコラム既存のトーンや語り口に近かった。Opusが返した段落は密で読みにくく、著者がコンテキストファイルで定義していた声とかみ合っていなかった。

GPT-5.6 SolがKatie Parrottの素材とスタイルコンテキストを使って書いた初稿
Sol(著者の素材とスタイルコンテキストを使用):より速く、著者がそのまま手を入れて使いたくなるタイプの原稿に近い。図 / Katie
Opus 4.8が同じ素材とスタイルコンテキストを使って書いた初稿
Opus 4.8(同じ素材とコンテキストを使用):文章が密で複雑、語彙も凝っていて、著者のより口語的なトーンとはかみ合わない。図 / Katie

Austinがマーケティング文案を作るときも同様だった。誘導なしだと、Solは「誰にでも書けるライター」で、ありきたりで冗長になる。ただ会社の背景、テンプレート、スタイルガイドを与えると、生成されるランディングページのコピー、SNS投稿、マーケティングメールは、Austinがほとんど手直しせずそのまま出せるレベルになる。素材、サンプル、ルールを与えれば質は上がっていくが、論点や基準をゼロから決めさせると、ブラインドテストで見えた弱点が戻ってくる。

リアルタイムのライティング相棒として、最強

Solが最も力を発揮する立ち位置は、リアルタイムのライティングパートナーとしてだ。原稿を直すのが速く、編集の方向性にぴったり寄り添う。書き手は新しい冒頭を試したり、段落を組み替えたり、あるいは弱い草稿を丸ごと捨てたりしても、その都度タスクを組み直す必要がない。取材ベースで反復が多く、方向性やフィードバックが大量にあり、スタイルガイドやサンプルまで揃った著者の日常のライティングフローに対して、Solは明らかにClaude系を上回る。Opusは反応が遅く、Sonnet 5は誘導が難しいが、Solは方向転換が速く、フィードバックに基づく修正も速く、さらに新しい情報を後の会話に持ち込むことができ、Sonnet 5のように直近の一つの指示に固執して大きな目標を見失うこともない。技術コンサルティング責任者のMike Taylorも、ライティングと編集をSolに任せ始めている。理由は「基本的に人が不快に感じるようなことを言わない」からだ。修正を受け入れ、出典や以前の決定を覚えていて、それからすぐにもう一度試す。判断は今も人間の編集者が下すが、Solはその判断を原稿全体にわたってより安く実装できるようにしてくれる。

6 知識労働 · 実戦

同じタスクでも、3モデルで3通りのやり方

「Solは主体的で、質問もしてくる」と抽象的に言うより、実際のケースを見た方がわかりやすい。Everyのオペレーション責任者Arielle Shipperは、同じ最初のタスクをGPT-5.5、Claude Fable 5、Solの3つに同時に渡し、それぞれの進め方を比較した。

共通の出発点:あるメールを見つけ、46個のCSV添付ファイルを既存の1つの表と突き合わせて統合し、さらに判断を要する分析を1つ行う(単純な貼り合わせではなく、頭を使う必要がある)。
GPT-5.5
Arielleが送信者を既に指定していたにもかかわらず、メールがどこにあるか聞き返す
使えない草稿を返す
スタートラインで止まり、メールを探すこと自体をまた人に振り戻してしまった
Claude Fable 5
役に立つ集計タブを提案し、フィールドごとに説明する
まずファイルを手動でGoogle Driveに移すよう要求
Arielleにいくつもの小さな判断を先に済ませないと進まない
方向性には価値があるが、少なからぬ判断を人に押し戻していた
GPT-5.6 Sol
メールを見つけ、ファイルを一つひとつ確認する
情報の欠落に気づく
7つの質問(どのサブグループが対象か、ある指標をどう計算するかなど)を持ち帰り、それぞれに推奨回答を添える
彼女の元の分析を拡張し、使える初稿を提示する
渡されるのは承認するか修正するかすればいいもので、また別の宿題ではない
終盤のテストでは、ArielleはSolがChatGPTの使用データを分析する際に計算を一箇所間違えていたことに気づいた。このミスは彼女の結果への信頼を揺るがし、たとえ構造の良い協働であっても、人間による入念な確認は依然として必要であることを物語っている。

Austinの日常業務にも同じ一貫性が表れている。彼はマーケティングのアイデアから出発し、メールを起草し、コピーをランディングページに変え、さらに実験を組み立てる、その全過程をCodexから離れることなく、対象読者やセールスポイントを改めて説明し直すこともなくこなせる。ベテラン編集者Jack Chengは、段落を統合し業界用語を削るのにSolを使いながら、そのコピーが実際に表示される公開ページ上でそのまま作業しており、行ごとに最終的な画面に置いた状態で判断できる。これらのワークフローは、一発で完成するアプリよりもむしろ本物の仕事の一日に近い:発端を見つけ、要件を理解し、人が判断すべき点について質問し、その答えを最終成果物に反映させる。

7 価格とパワー

3段階の価格、2段階のパワー

価格面では、OpenAIのこの3段階は、ほぼAnthropicの3モデルに一対一で対応しており、予算に応じたベンダー横断の比較がしやすい。

位置づけOpenAI入力 / 出力(100万トークンあたり)対応するClaudeClaude 入力 / 出力
フラッグシップSol$5 / $30Opus 4.8$5 / $25
中位Terra$2.50 / $15Sonnet 5$2 / $10(8/31まで)→ $3 / $15
軽量Luna$1 / $6Haiku 4.5$1 / $5

並べて見ると:Sol は入力価格がOpus 4.8と同水準で、出力は100万トークンあたり$5高い。Terraは Sonnet 5のキャンペーン価格($2 / $10、8月31日まで)より高いが、値上げ後の$3 / $15には近い。Luna は入力がHaiku 4.5と同額で、出力は$1高い。

maxとultraとは何か

3段階のモデルに加えて、Solは新しい推論設定を2つ持ち込んだ。タスクの難易度に応じて段階的に計算資源を使う仕組みで、すべての作業を同じ設定でこなすわけではなくなる。

max

1つのSol agentに、より長い時間を与えて独立に思考・試行錯誤させる。1つのタスクをより深く考えさせたいときに向く。

ultra

複数のSol agentが同時に協働し、同じタスクに取り組む。1つのタスクにより多くの「パワー」をかけたいときに向く。

プロダクト面では、ChatGPTとCodexが統合されたこのApp、Everyもまだあまり使い込んではいないが、現状の使用感は当時のCodexと同様、「居続けたくなる場所」だという。

8 選び方チェックリスト

Solを使うべきとき、Fableに切り替えるべきとき

これまでの4つの軸の判断を、そのまま使えるチェックリストにまとめた。原文では2つのシナリオ群が挙げられており、ちょうど「委任 vs 協働」という軸の両端に対応する。

Solを使う協働側 · 人がそばで見ている

  • ライティング、リサーチ、構築、分析など、進めながら手を入れていくことを前提とした作業
  • プロジェクトに既に使える素材、サンプル、説明、過去の決定事項がある
  • 明確な成果物があり、モデルに手順・ツール・後続対応まで引き受けさせたい
  • 難しいバグを直している、または機能を組み立てていて、その境界を実装が大きくなる前に自分で確認できる

Claude Fable 5に切り替える委任側 · 渡して受け取る

  • タスクの指示があいまいで、プロジェクトに何が必要かを判断すること自体が仕事の大部分を占める
  • 長いタスクを丸ごと渡して離れ、後で完成した結果だけを確認したい
  • 簡素化、アーキテクチャ、抑制の効いた設計が、素早いやり取りより重要
  • モデルが作業している間、その推論や進捗をもっと見たい
委任 → Fable 曖昧な指示 · 独立完遂 · 抑制重視 協働 → Sol 成果物あり · 見ながら直す · 素材が揃う

Everyチームの使い方も、この軸に沿ったものになっている。Danは難しいエンジニアリング作業をFableにメインagentとして任せ、定義済みの実行をSolに任せる。Mikeは Solを日常の主力にし、「ついにOpusを押しのけた」と言いつつ、Fableは「鋭いピークの知性」とより強いコンテキスト運用のために残している。結果がはっきりしていて、なおかつずっと前に進み続けつつ随時介入できるagentが欲しいなら Sol を使う。「システムそのものを定義する」ことが主なタスクであるときは、早い段階でチェックポイントをしっかり設けるか、アーキテクチャをFableに任せてSolに実行させるかのどちらかにするといい。

もしあなたがループの中にとどまっていたいなら、Codexというこのアプリの方がずっと良い居場所だ。でももしループから自分を抜け出したいなら、Fableが必要になる。 、Mike Taylor、Every《Vibe Check》
本稿はEvery《Vibe Check:GPT-5.6 Solは私たちが一緒に働くのを最も気に入っているモデルだ》(著者Katie Parrott、原文リンク every.to/vibe-check/gpt-5-6-sol)を編集・翻訳したものです。文中の「新記録を樹立」「現時点で最強」「サイバーセキュリティ能力最強」などの表現はOpenAIの公式見解であり、56点対90点、ライティングブラインドテスト最下位などはEveryチームの独自テストによるものです。原文の開示によれば、OpenAIはEveryにGPT-5.6の早期アクセス権を提供したが、この評価記事について一切関与していないとのことです。画像はすべてEvery / Katie Parrottによるものです。
翻訳が完了しました。全てのHTML構造・CSS・SVG座標・class/id・data属性・数値はそのまま保持し、可視テキストのみ日本語に翻訳しています。人名・産品名(GPT-5.6 Sol、Claude Fable 5、Opus 4.8、Sonnet 5、Terminal-Bench 2.1、Every、OpenAI、Anthropicなど)は原文のまま残しました。「秒懂漫画」→「マンガでわかる」、「一页纸」→「一枚でわかる」、拟声词「唰」→「サッ」、「咚」→「ドン」、「終」記号はそのまま保持しています。