8月2日 | 同一个模型,两个设置,分数翻了三倍
本期内容
今期五件事围绕一个共同问题:我们真的在测量和使用 AI 的正确方式吗?从 OpenAI 用两个参数让基准分数翻三倍,到 MCP 新规范让工具接入门槛大幅降低,再到 Hugging Face 入侵事件暴露的权限管理漏洞,以及 AI 独立完成完整软件的能力边界,还有一篇关于"让每次工作都让下次更容易"的工程哲学。听完这期,你会对"能力"这个词有一套新的校准方式。
本期要点
- OpenAI 在 ARC-AGI-3 基准上开启两个设置后分数翻三倍,说明测试结果同时是模型和测试环境的函数
- MCP 2.0 切换为无状态协议,让任何人都能在 15 分钟内把自己的小工具接进 AI 代理
- Hugging Face 遭入侵四天半,攻击者用合法凭据横向移动,零信任必须搭配最小权限才完整
- MirrorCode 基准测试显示 AI 能复现部分完整程序,但最复杂的项目尚无模型能独立完成
- 复利工程的核心问题:每个功能做完后,下一个功能有没有变得更容易做
参考资料
How enabling two settings tripled our scores on the ARC-AGI-3 benchmark — https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores/
Stateless MCP has recaptured my interest (Simon Willison) — https://simonwillison.net
Tailscale didn't stop the Hugging Face intrusion — https://tailscale.com/blog
MirrorCode: What's the largest software project AI can complete on its own? (Epoch AI) — https://epochai.org
Compound Engineering (Every.to) — https://every.to
---
BearTalk 狗熊有话说播客,始于 2012 年。
订阅地址:https://beartalking.com/page/podcast
