タグ: ベンチマーク

Opus 5は「聞き返さない」──ベンチマーク訓練がLLM品質にもたらした副作用
AI・機械学習

Opus 5は「聞き返さない」──ベンチマーク訓練がLLM品質にもたらした副作用

Opus 5が曖昧な指示でも確認せず勝手に実装を進める理由を解説。ベンチマーク訓練とRLHFが「聞き返さないモデル」を生む構造的メカニズムと、仮定を可視化させるプロンプト設計の実践的対策を紹介。

Claude Sonnet 5 発表:史上最もエージェンティックなSonnetモデルが自律実行の時代を切り開く
AI・機械学習

Claude Sonnet 5 発表:史上最もエージェンティックなSonnetモデルが自律実行の時代を切り開く

Anthropicが2026年6月30日にリリースしたClaude Sonnet 5の全貌を解説。Terminal-Bench 2.1で上位モデルOpus 4.8を超える80.4%を達成。自律実行設計の思想・ベンチマーク比較・価格戦略まで徹底解説。