AI・機械学習
Opus 5は「聞き返さない」──ベンチマーク訓練がLLM品質にもたらした副作用
Opus 5が曖昧な指示でも確認せず勝手に実装を進める理由を解説。ベンチマーク訓練とRLHFが「聞き返さないモデル」を生む構造的メカニズムと、仮定を可視化させるプロンプト設計の実践的対策を紹介。
BM25でCodexのトークン消費を30%削減する — 7,000ファイル規模で実証したコード検索RAG実践
BM25をCodexの前段に挟むだけでトークン消費を29.2%削減、処理時間を41%短縮。7,536ファイル規模での実測データと、キャメルケース対応などコード検索に効くRAG実装テクニックを解説。
GUIエージェントの自律改善 ― ビジュアルグラウンディングを人手アノテーションなしで進化させる仕組み
GUIエージェントのビジュアルグラウンディングを人手アノテーションなしで自律改善するフレームワークを解説。探索・評価・反省・内在化の4段階ループにより6ベンチマーク平均+7.4%を達成した最新研究を実務目線で紹介。
Anthropicはオープンウェイトモデル禁止を求めていない──AI政策を動かす3つの提言を読み解く
AnthropicCEOダリオ・アモデイ氏がオープンウェイトモデル全面禁止を否定。チップ輸出規制強化・蒸留取り締まり・安全性テスト義務化の3つの政策提言を技術的・政策的観点から詳しく解説します。
Claudeのコメントが長すぎる問題──AIが書いたコメントは、AI自身の役に立っていなかった
Claude Codeが生成する過剰コメントの原因をRLHFの訓練特性から解説。「コードから復元できない情報のみ」ルールでコメント比率を21%→8.8%に改善した実践知。明日から使えるCLAUDE.md設定付き。
Cloudflare OSとは?オープンソースAIオペレーティングシステムの全貌をわかりやすく解説
Cloudflareが2026年8月に公開したオープンソースAI OS「Cloudflare OS」を徹底解説。Gatekeeperによるゼロトラスト設計、エージェントワークスペース、パーソナルアプリプラットフォームのアーキテクチャをわかりやすく紹介します。
4BパラメータのオープンモデルがGPT-5.6 Solに並ぶ日 ― Castform × Neon Lakebaseで実現するRAGコスト1/100
4BパラメータのオープンモデルにRL学習を施し、GPT-5.6 Sol同等の精度をコスト1/100で実現。CastformとNeon Lakebase Postgresを活用したRAGアーキテクチャの仕組みとコスト試算を徹底解説。
AIエージェント評価(eval)の作り方 ― agent-evalに学ぶ、実務で使える評価基盤の設計
AIエージェント評価(eval)の設計原則を体系解説。agent-evalに学ぶテストケース自動生成・軌跡評価・LLM-as-a-Judgeの実践的な組み込み方法をMLエンジニア向けに紹介します。
【2026年版】無料で学べるAIエージェント教科書『ai-agent-book』完全ガイド|10章95プロジェクトで設計原理から実装まで
GitHub3万スター超のオープンソース教科書『ai-agent-book』を徹底解説。10章95プロジェクトで、AIエージェントの設計原理から実装まで無料で体系的に学べる完全ガイドです。
Claude Sonnet 5 発表:史上最もエージェンティックなSonnetモデルが自律実行の時代を切り開く
Anthropicが2026年6月30日にリリースしたClaude Sonnet 5の全貌を解説。Terminal-Bench 2.1で上位モデルOpus 4.8を超える80.4%を達成。自律実行設計の思想・ベンチマーク比較・価格戦略まで徹底解説。