カスタムフォントと数行のCSSだけで済み、JavaScriptもブラウザの脆弱性も不要だ。
モデルは据え置き。変えたのはハーネス——プライベート推論の保持と、削除に代わるコンパクション(文脈圧縮)で、1ゲームあたりの出力トークンは約6分の1に。
いずれの結果も実運用中のシステムには影響しない。HAWKはまだ未採用で、AESへの攻撃は七ラウンド簡略版にとどまり、完全な十ラウンド版は無傷だ。
同じデータから43.5%と65%〜82%という異なる結論が導き出される理由は、分母の切り分け方の違いにあります。
リリースから11日後に公開された47ページのレポートは効率化に焦点を当てており、同一の計算資源でK2の2.5倍の性能を実現しています。
職業ごとに見ると、AIが使われるタスクは中央値で全体の5分の1にとどまり、29%の職業ではAIが一つも使われていません。知的作業のうち、AIに最初から最後まで任せるケースはわずか6.5%です。
同じモデルでも外側(Harness)を変えるだけでコストが2倍変わる。オープンソースのGLM 5.2はOpus 4.8と同等の性能ながら、1問あたりのコストは3割安い。出題は自社が既にマージ済みのPRを改変したもので、ネット検索では見つからない。
音声トラックを外してもう一度解かせることで、映像だけで正解できてしまう設問をふるい落とす専用ベンチマークも同時に公開しました。
同じ研究を3回検証しても、結果は毎回「中間くらい」を指し示した。筆者本人もChatGPTに映画のあらすじを書かせてみたが、結局は手書きの方がいいと語る。
同一モデルを2回サンプリングした際の指紋距離の中央値は0.140。自社開発のフラッグシップモデルとして宣伝されていたAPIは、オープンソースのQwenとの距離が0.141でした。つまり、そのAPIはオープンソースのQwenと実質的に見分けがつかないということです。
Schemaと呼ばれる外殻が、モデルに各ゲームのルールを実行可能なプログラムとして書かせ、検証を終えてから初めて動かす仕組み。公開25局での自己採点は98.98%だが、ARC Prizeによる独立検証はまだ受けていない。
第三者評価サービスDesign Arenaが同モデルの作品(Webページ約1,000点)を分析した結果、紫グラデーションなどAIにありがちな“定番”が並ぶはずの領域だけが、ぽっかり空白になっていることが分かった。
250グラムの機体が同じ柔軟な翼で水中と空中を移動し、70°の角度と8〜10回の羽ばたきで湖から離水する
約54GBの27Bモデルを約3.9–5.9GBまで圧縮。スマホでローカル実行でき、平均スコアはおよそ9割を維持。まずは核心価値から。技術詳細と割引すべき点は後半へ。
3モデル・20言語を分析:英語は最も慎重かつ深く、ロシア語は最も厳格、ヒンディー語は最も温かく、中国語は全体平均に近い
"大脳"(中央コントローラー)の指令なしに、200個近い普通のスマートキューブが"ひそひそ話"のようにやり取りするだけで、自分たちがどんな形に組み上がったかを把握し、損傷後にはどこへ"再生"すべきかまで判断できる。前半部分はすでに実機のブロックで実証済みだが、損傷箇所の特定と再生は依然として主にシミュレーション上で行われている。
論文には「オープンソース化済み」とあるが、実際にコードリポジトリを確認すると中身は空で、コードは一行も push されていなかった。
サンプルは120万件のセッション、60万以上の組織をカバー:コンテンツ制作がすぐ後に続き16.4%、両者合わせて利用量のほぼ半分を占める。
57.6万サンプル・16モデルで実測:AI推薦パッケージの19.7%が幻覚、43%は同じ偽名を繰り返し生成する。
すべての結果は脳の「デジタルツイン」モデルによるコンピューターシミュレーション予測であり、実際の脳画像を用いた実測検証はまだ行われていない。
500万人・20億時間分のウェアラブルデータで事前学習。エンコーダーを凍結して線形ヘッドを一つ繋ぐだけで、34/35件の健康タスクで教師あり学習ベースラインを上回った。
肝心なのは機能一覧ではない。思考モードで知能を底上げし、効率スタックでコストを圧縮し、ネイティブマルチモーダルで入力を拡張する——三つの技術ラインを同時に締め上げることだ
システムプロンプト・ツール説明・ミドルウェアの3箇所に手を入れ、Deep Agentsスイートは典型で0.80→0.84、最高0.86(Opus 0.87)に到達。
元OpenAI安全責任者が論文約30本を整理:プロンプト修正から自己コード改変まで、DGMはコーディング能力を20%から50%に押し上げた。
ループの起点となる単一トークンだけを微調整し、両モデルとも無限ループ率を1%前後まで低減
全体の1割に満たない領域だが、取り除くとClaudeは会話はできても推論がゼロになる。すでにモデルのデータ捏造の摘発や、テストの見破りに活用されている
被験者151人の実証:記述式問題は選択式問題より得点アップ効果が高い一方、AI質問応答サイドバーはほとんど使われなかった
美国22-25岁开发者就业三年跌19%,同时GitHub新账户涨到史上最快
論文史上初、エージェントが完全無人でRTL全ベンチマークを走破。大半は2〜3回で正解も、最難問だけは82回の反復を要した
23.5万ユーザー、7カ月にわたるセッション分析——専門家の検証済み成功率は初心者のほぼ2倍だが、上位10職種の差はわずか7ポイント以内
Thinking Machinesと共同、専門家ラベル付きデータでオープンソースモデルをファインチューニング。最先端モデル比でエラー率29.8%減、推論コストは14分の1に
ヘルメット型デバイスを装着するだけでリアルタイムに脳磁(MEG)信号をデコード。単語正解率は8%から61%へ跳躍し、v1/v2の学習コードとデータセットも同時にオープンソース化
能力スコアは3つのバージョンが出てどれも信用できないが、目に見える不正行為そのものが安全監視が機能している証拠になった
モデル側の応答は約200ms、総遅延は約550ms。v0.1は192pのみ対応、デモは事前収録でリアルタイム体験ではない
実験室レベルでは量産可能と実証済み。性能+50%、電力効率+70%はいずれも2nm比の予測値で、実測値ではない