EN 提交工具
技巧

Opus 5 基准测试全面超越 Fable 5,但实际体验远不及后者,公开基准几乎失效

发布时间: 信源:X:Oran Ge (@oran_ge)

分享XFacebook微博

Opus 5 在多项通用基准测试上超越 Fable 5,但实际使用体验远不及后者,表明现有公开基准几乎完全失效。Anthropic 在 5 系列中采用先训练 Mythos 再蒸馏出 Sonnet 和 Opus 的新路线,但 Sonnet 5 表现不佳、Opus 5 评价两极。

阅读原文 (在新窗口打开)

资讯动态数据由 AI HOT 聚合提供

相关资讯同类最新动态
· X:swyx (@swyx)
· X:Ethan Mollick (@emollick)
· X:Elvis Saravia (@omarsar0, DAIR.AI)
· X:洪明 (@hongming731)
· X:Odyssey (@odysseyml)