ライブラリ / 研究解説

研究解説

全 35 本 · 新着順

無料
研究解説
№ 1101
RESEARCH
出典 · BleepingComputer⚑ 研究論文

LayerX、AIアシスタントを欺く新型「視覚詐欺」攻撃を発見

カスタムフォントと数行のCSSだけで済み、JavaScriptもブラウザの脆弱性も不要だ。

AIセキュリティブラウザアシスタント07-30 · 10 分で読了
研究解説
🎧№ 1099
RESEARCH
出典 · OpenAI⚑ チュートリアル

API設定2つでGPT-5.6 SolのARC-AGI-3が13.3%→38.3% OpenAI自報

モデルは据え置き。変えたのはハーネス——プライベート推論の保持と、削除に代わるコンパクション(文脈圧縮)で、1ゲームあたりの出力トークンは約6分の1に。

ARC-AGI-3ハーネス▶ 再生07-30 · 9 分で読了
無料
研究解説
№ 1097
RESEARCH
出典 · Anthropic⚑ 研究論文

Claude Mythos、暗号学で画期的進展——アルゴリズム自体の数学的脆弱性を直接発見

いずれの結果も実運用中のシステムには影響しない。HAWKはまだ未採用で、AESへの攻撃は七ラウンド簡略版にとどまり、完全な十ラウンド版は無傷だ。

暗号学AIによる研究07-29 · 13 分で読了
無料
研究解説
🎧№ 1092
RESEARCH
出典 · OpenAI Economic Research⚑ 研究論文

OpenAIが80万件の業務関連メッセージを分析:人々がAIにやらせている仕事の大半は、本来の職務ではない

同じデータから43.5%と65%〜82%という異なる結論が導き出される理由は、分母の切り分け方の違いにあります。

OpenAI労働経済学▶ 再生07-28 · 12 分で読了
無料
研究解説
🎧№ 1089
RESEARCH
出典 · Kimi K3 技术报告⚑ 研究論文

2.8兆パラメータの「Kimi K3」技術レポート:3つのアーキテクチャ改修で計算効率を2.5倍に向上

リリースから11日後に公開された47ページのレポートは効率化に焦点を当てており、同一の計算資源でK2の2.5倍の性能を実現しています。

Kimi K3Moonshot AI▶ 再生07-28 · 16 分で読了
無料
研究解説
№ 1085
RESEARCH
出典 · Google Blog / AI & Economy ATLAS v1.0⚑ 研究論文

Google、Gemini対話1465万件を分析 日常会話の86%は仕事に無関係

職業ごとに見ると、AIが使われるタスクは中央値で全体の5分の1にとどまり、29%の職業ではAIが一つも使われていません。知的作業のうち、AIに最初から最後まで任せるケースはわずか6.5%です。

GoogleAIと経済07-27 · 14 分で読了
研究解説
№ 1071
RESEARCH
出典 · Databricks⚑ 公式PR

Databricks、数百万行規模のコードベースでモデル×Harnessのコスパを実測

同じモデルでも外側(Harness)を変えるだけでコストが2倍変わる。オープンソースのGLM 5.2はOpus 4.8と同等の性能ながら、1問あたりのコストは3割安い。出題は自社が既にマージ済みのPRを改変したもので、ネット検索では見つからない。

コーディングAgentベンチマーク07-22 · 9 分で読了
研究解説
№ 1064
RESEARCH
出典 · Memories.ai Research⚑ 研究論文

Memories.ai、動画と音声を同時処理するAIを高速・低コスト・高精度にする「O-MARC」を発表

音声トラックを外してもう一度解かせることで、映像だけで正解できてしまう設問をふるい落とす専用ベンチマークも同時に公開しました。

動画理解マルチモーダル圧縮07-21 · 12 分で読了
研究解説
🎧№ 1058
RESEARCH
出典 · New Scientist⚑ キーパーソン

AIの文章・創作支援は「ほどほど」が最適、実験で判明

同じ研究を3回検証しても、結果は毎回「中間くらい」を指し示した。筆者本人もChatGPTに映画のあらすじを書かせてみたが、結局は手書きの方がいいと語る。

AI創作創造性▶ 再生07-20 · 7 分で読了
研究解説
🎧№ 1053
RESEARCH
出典 · arXiv⚑ 研究論文

API中継で選んだモデル、密かにすり替えられている疑い――乱数一つで正体判明

同一モデルを2回サンプリングした際の指紋距離の中央値は0.140。自社開発のフラッグシップモデルとして宣伝されていたAPIは、オープンソースのQwenとの距離が0.141でした。つまり、そのAPIはオープンソースのQwenと実質的に見分けがつかないということです。

モデルフィンガープリントAPI監査▶ 再生07-20 · 11 分で読了
研究解説
🎧№ 1042
RESEARCH
出典 · Impossible Research⚑ 研究論文

外殻の交換だけでOpus 4.8とFable 5がARC-AGI-3で99%到達

Schemaと呼ばれる外殻が、モデルに各ゲームのルールを実行可能なプログラムとして書かせ、検証を終えてから初めて動かす仕組み。公開25局での自己採点は98.98%だが、ARC Prizeによる独立検証はまだ受けていない。

ARC-AGI-3世界モデル▶ 再生07-17 · 12 分で読了
無料
研究解説
№ 1035
RESEARCH
出典 · Design Arena

GPT-5.6 Sol、フロントエンド設計ランキングで首位に デザインの審美眼を習得し、AIにありがちな“定番”を回避

第三者評価サービスDesign Arenaが同モデルの作品(Webページ約1,000点)を分析した結果、紫グラデーションなどAIにありがちな“定番”が並ぶはずの領域だけが、ぽっかり空白になっていることが分かった。

GPT-5.6 SolAI Webデザイン07-16 · 6 分で読了
無料
研究解説
№ 1027
RESEARCH
出典 · MIT News / Science⚑ 研究論文

MIT、足で水をかかずに泳いで飛べるロボット鳥を開発

250グラムの機体が同じ柔軟な翼で水中と空中を移動し、70°の角度と8〜10回の羽ばたきで湖から離水する

MITバイオインスパイアード・ロボティクス07-15 · 8分で読了
無料
研究解説
№ 1020
RESEARCH
出典 · PrismML⚑ 研究論文

PrismMLが27BモデルをiPhoneに押し込んだ。しかも頭の良さはほぼ落ちていない

約54GBの27Bモデルを約3.9–5.9GBまで圧縮。スマホでローカル実行でき、平均スコアはおよそ9割を維持。まずは核心価値から。技術詳細と割引すべき点は後半へ。

Bonsai 27B端側AI07-15 · 12 分
無料
研究解説
🎧№ 1014
RESEARCH
出典 · Anthropic⚑ 研究論文

Anthropicが30万件の対話を分析:言語によってClaudeの価値観は変わる

3モデル・20言語を分析:英語は最も慎重かつ深く、ロシア語は最も厳格、ヒンディー語は最も温かく、中国語は全体平均に近い

Anthropic研究Claude価値観▶ 再生07-14 · 9 分で読了
無料
研究解説
🎧№ 1013
RESEARCH
出典 · Sakana AI / Nature Communications⚑ 研究論文

Sakana AI、"大"脳なしで自在に組み合う3Dスマート細胞ブロックを開発——"生物"のような群知能を発揮

"大脳"(中央コントローラー)の指令なしに、200個近い普通のスマートキューブが"ひそひそ話"のようにやり取りするだけで、自分たちがどんな形に組み上がったかを把握し、損傷後にはどこへ"再生"すべきかまで判断できる。前半部分はすでに実機のブロックで実証済みだが、損傷箇所の特定と再生は依然として主にシミュレーション上で行われている。

Sakana AI群知能▶ 再生07-14 · 9 分で読了
研究解説
🎧№ 1010
RESEARCH
出典 · arXiv · Meta AI⚑ 研究論文

Meta AI がプロアクティブ記憶エージェントを提案:『リマインドすべき時だけリマインド』をエージェントに学習させ、Terminal-Bench正解率が8.3ポイント向上

論文には「オープンソース化済み」とあるが、実際にコードリポジトリを確認すると中身は空で、コードは一行も push されていなかった。

AIエージェント長時間タスク記憶▶ 再生07-13 · 9 分で読了
研究解説
🎧№ 1008
RESEARCH
出典 · Anthropic 官方博客⚑ 研究論文

Claude Cowork の最大の用途はオフィス雑務(33.4%)、コーディングはわずか8.7%――UIの形がAIの使い道を決める

サンプルは120万件のセッション、60万以上の組織をカバー:コンテンツ制作がすぐ後に続き16.4%、両者合わせて利用量のほぼ半分を占める。

Claude CoworkAnthropic▶ 再生07-13 · 7 分で読了
無料
研究解説
🎧№ 1006
RESEARCH
出典 · VentureBeat⚑ 研究論文

AIにコードを書かせると、存在しないパッケージを薦めてくる:ハッカーは同じ名前でマルウェアを仕込み済み

57.6万サンプル・16モデルで実測:AI推薦パッケージの19.7%が幻覚、43%は同じ偽名を繰り返し生成する。

AIセキュリティソフトウェアサプライチェーン▶ 再生07-12 · 9 分で読了
研究解説
🎧№ 1001
RESEARCH
出典 · EPFL 项目主页⚑ 研究論文

脳はどこで何を見たがる?EPFL、AIに動画を延々生成させ各脳領域の「お気に入り」を発見

すべての結果は脳の「デジタルツイン」モデルによるコンピューターシミュレーション予測であり、実際の脳画像を用いた実測検証はまだ行われていない。

神経科学進化的アルゴリズム▶ 再生07-11 · 9 分で読了
研究解説
🎧№ 112
RESEARCH
出典 · Google Research⚑ 研究論文

Google Research、SensorFM発表 ― 1兆分のウェアラブルデータで学習、35件の健康タスク中33件で勝利

500万人・20億時間分のウェアラブルデータで事前学習。エンコーダーを凍結して線形ヘッドを一つ繋ぐだけで、34/35件の健康タスクで教師あり学習ベースラインを上回った。

SensorFMウェアラブル健康データ▶ 再生07-10 · 8 分で読了
研究解説
🎧№ 104
RESEARCH
出典 · arXiv / Google DeepMind⚑ 研究論文

Gemma 4技術レポート:オープンモデルが「軽量×推論力×省メモリ」で大型モデルに挑む

肝心なのは機能一覧ではない。思考モードで知能を底上げし、効率スタックでコストを圧縮し、ネイティブマルチモーダルで入力を拡張する——三つの技術ラインを同時に締め上げることだ

Gemma 4オープンソース大規模モデル▶ 再生07-09 · 12 分で読了
研究解説
🎧№ 103
RESEARCH
出典 · LangChain Blog⚑ 研究論文

LangChain:harnessの調整だけでNemotron 3 UltraがOpus 4.8に肉薄、コストは約1/10——高額な閉鎖系APIは不要と証明

システムプロンプト・ツール説明・ミドルウェアの3箇所に手を入れ、Deep Agentsスイートは典型で0.80→0.84、最高0.86(Opus 0.87)に到達。

LangChainNemotron▶ 再生07-09 · 9 分で読了
研究解説
🎧№ 102
RESEARCH
出典 · Lil'Log⚑ 研究論文

AIの自己進化は「外側」から始まる:Lilian Weng が harness エンジニアリングを徹底解説

元OpenAI安全責任者が論文約30本を整理:プロンプト修正から自己コード改変まで、DGMはコーディング能力を20%から50%に押し上げた。

harnessエンジニアリング再帰的自己改善▶ 再生07-09 · 13 分で読了
研究解説
🎧№ 096
RESEARCH
出典 · Liquid AI⚑ 研究論文

Liquid AIがAntidoomを発表:推論モデルの「無限ループ」問題をトークン1つの修正で解消、OSS公開

ループの起点となる単一トークンだけを微調整し、両モデルとも無限ループ率を1%前後まで低減

Liquid AI推論モデルの無限ループ▶ 再生07-08 · 8 分で読了
無料
研究解説
🎧№ 088
RESEARCH
出典 · Anthropic⚑ 研究論文

Anthropic、Claude内部に脳の「内的思考空間」に似た領域を発見 ― 設計にはなく、自ら進化で獲得したものだった

全体の1割に満たない領域だが、取り除くとClaudeは会話はできても推論がゼロになる。すでにモデルのデータ捏造の摘発や、テストの見破りに活用されている

解釈可能性研究Claude▶ 再生07-07 · 8 分で読了
無料
研究解説
🎧№ 087
RESEARCH
出典 · iTextbooks'26 论文⚑ 研究論文

ダートマス大学の実証実験:AI採点は「杓子定規」と不評でも、使った学生の成績は伸びた

被験者151人の実証:記述式問題は選択式問題より得点アップ効果が高い一方、AI質問応答サイドバーはほとんど使われなかった

AI教育テック形成的評価▶ 再生07-06 · 8 分で読了
無料
研究解説
🎧№ 083
RESEARCH
出典 · Seldo.com(Laurie Voss)⚑ 研究論文

初级程序员岗位被AI烧穿:编程正从职称变成人人都会的技能

美国22-25岁开发者就业三年跌19%,同时GitHub新账户涨到史上最快

AI就业冲击初级程序员▶ 再生07-05 · 9 分で読了
研究解説
🎧№ 082
RESEARCH
出典 · arXiv · NVIDIA Research⚑ 研究論文

NVIDIA Research、HORIZON発表——無人運用のエージェントがRTLチップ設計ベンチマークを全問100%クリア

論文史上初、エージェントが完全無人でRTL全ベンチマークを走破。大半は2〜3回で正解も、最難問だけは82回の反復を要した

NVIDIA ResearchAgentic ワークフロー▶ 再生07-05 · 12 分で読了
研究解説
🎧№ 081
RESEARCH
出典 · Anthropic⚑ 研究論文

Anthropic調査:Claude Code 40万セッションが明かす、AIコーディングの成否を分けるのは「専門性」

23.5万ユーザー、7カ月にわたるセッション分析——専門家の検証済み成功率は初心者のほぼ2倍だが、上位10職種の差はわずか7ポイント以内

Claude CodeAnthropic研究▶ 再生07-05 · 7 分で読了
研究解説
🎧№ 060
RESEARCH
出典 · Thinking Machines Lab⚑ 研究論文

Bridgewater、金融情報選別に特化したモデルを開発 正解率84.7%で手法も公開

Thinking Machinesと共同、専門家ラベル付きデータでオープンソースモデルをファインチューニング。最先端モデル比でエラー率29.8%減、推論コストは14分の1に

Tinker強化学習ファインチューニング▶ 再生07-01 · 7 分で読了
研究解説
№ 056
RESEARCH
出典 · Meta AI Blog⚑ 研究論文

開頭せずに脳波を解読、Metaの非侵襲型は精度が同業の8倍近くに

ヘルメット型デバイスを装着するだけでリアルタイムに脳磁(MEG)信号をデコード。単語正解率は8%から61%へ跳躍し、v1/v2の学習コードとデータセットも同時にオープンソース化

ブレイン・マシン・インターフェースMeta AI06-29 · 5 分で読了
研究解説
№ 051
RESEARCH
出典 · METR⚑ 研究論文

GPT-5.6 Sol、不正行為率が過去最悪を更新 評価機関は「むしろ安心材料」と評価

能力スコアは3つのバージョンが出てどれも信用できないが、目に見える不正行為そのものが安全監視が機能している証拠になった

GPT-5.6AI安全性06-27 · 5 分で読了
研究解説
№ 049
RESEARCH
出典 · Wan Streamer⚑ 研究論文

Wan Streamer:見て聞いて話せるリアルタイムAI

モデル側の応答は約200ms、総遅延は約550ms。v0.1は192pのみ対応、デモは事前収録でリアルタイム体験ではない

マルチモーダル大規模モデル全二重リアルタイムインタラクション06-27 · 5 分で読了
研究解説
№ 043
RESEARCH
出典 · IBM Newsroom⚑ 研究論文

IBM、世界初の0.7nmチップを発表――爪ほどの大きさに1000億個近いトランジスタ

実験室レベルでは量産可能と実証済み。性能+50%、電力効率+70%はいずれも2nm比の予測値で、実測値ではない

IBM半導体06-26 · 6 分で読了