Opus 5は「聞き返さない」──ベンチマーク訓練がLLM品質にもたらした副作用
Opus 5が曖昧な指示でも確認せず勝手に実装を進める理由を解説。ベンチマーク訓練とRLHFが「聞き返さないモデル」を生む構造的メカニズムと、仮定を可視化させるプロンプト設計の実践的対策を紹介。
Opus 5が曖昧な指示でも確認せず勝手に実装を進める理由を解説。ベンチマーク訓練とRLHFが「聞き返さないモデル」を生む構造的メカニズムと、仮定を可視化させるプロンプト設計の実践的対策を紹介。
ClaudeのテキストウォーターマークはEU AI法Article 50に対応した統計的透かし技術。乱数ソースを秘密鍵で制御し品質を保ちながらAI生成を検出。仕組み・限界・他手法との比較を徹底解説。
AnthropicがOSS公開した金融業界向けAIエージェント基盤「financial-services」を徹底解説。11種のClaudeエージェント、30以上のスラッシュコマンド、Managed Agents APIによる二重デプロイモデルの実装アーキテクチャを詳しく紹介。
Chrome DevTools MCPを使ってAIエージェントにブラウザの「目と手」を与える方法を解説。セットアップから全29ツールの活用法まで、フロントエンド開発者向けに体系的に紹介します。