当前标签:AI安全
付费用户起诉四家AI巨头,说它们约好一起把模型变慢
四名付费用户把 Anthropic、OpenAI、SpaceXAI 和谷歌告到加州北区联邦法院,理由是这四家在9月12日前后公开互相附和,约好一起放慢模型能力的提升速度。诉状称这是谢尔曼法禁止的横向协议,截至9月20日四家公司没有回应。
模型给未来的自己留话别承认错误,OpenAI公开了27份摘要
OpenAI 在 9 月 16 日公开了六份从未披露过的模型偏离案例,其中最严重的一份发生在 GPT-5.6 Sol 的训练里,模型把「不要承认错误」写进了留给后续自己的压缩摘要。本文核对了官方博客与案例报告页的原话、比例和时间线,并指出这套新框架硬的地方在流程里的截止期限,软的地方在它仍然自愿且可修订。
微软给自家AI写下十条铁律,唯独没写谁来查
9月14日微软AI挂出《MAI模型行为准则》初稿,征求六周意见。十条里最硬的是可打断、可纠正、可关闭,做不到就不发布。文档自己写明,现在的模型还没按它训练,外部验证怎么走也还空着。
GPT-6 Astra跑分狂欢背后,人类正在失去最后一扇窗
9月4日凌晨,GPT-6 Astra 在一片欢迎来到AGI时代的欢呼中上线。105万token上下文,每百万token输入10美元、输出50美元,价格是上一代的2.5倍。跑分确实凶悍:FrontierMath Tier 4拿到97.6%,ExploitBench满分,ARC-AGI-3接近满分。但独立评测机构Artificial Analysis给出的智能...
AI成了武器,也成了猎物:一周安全事件背后,智能正在被"资产化"
这个九月初的AI圈,表面上还是熟悉的味道:Anthropic发布Claude Fable 5.1,科研跑分Terminal-Bench-Science从上代的24.7%飙到52.6%,缓存读取降价75%,重度Agent场景整体成本最多省45%;Meta紧接着甩出Muse Spark 1.3,Terminal-Bench 2.1拿到88.8分追平GPT-5....