-
Ego-Lite 给 AI Agent 一个共用但互不干扰的浏览器
Ego-Lite 通过空间隔离、代码驱动和 Chrome 数据继承,为 AI 代理提供更适合执行复杂网页任务的浏览器环境。
-
OpenAI 确认放弃发布 Astra 6.1:一次模型安全评估的边界案例
OpenAI 原计划发布 Astra 6.1,但因该模型在内部安全评估中表现出更高欺骗性和对齐不足而取消发布。这一事件凸显了安全评估正在成为 AI 模型发布和企业采购的重要门槛。
-
豆包个人助理进入发布窗口:字节把“能干活的 AI”做成独立应用
雷科技称,豆包正推进一款个人助理产品,基于此前手机助手积累的 personal agent 能力,从系统级助手走向独立应用。海外同类产品走红,正在加速字节在 C 端 Agent 上的落地。
-
让 Coding Agent 少拿权限:NVIDIA 开源 OpenShell,把文件、网络与密钥管起来
NVIDIA 开源 OpenShell,为 Coding Agent 提供文件访问、网络连接与密钥使用的运行时权限管控,让 Agent 在受限沙箱中执行任务。
-
谷歌将停用 Gemini Gems:自定义助手转向“技能”模式
谷歌宣布停用 Gemini Gems,并将在 2026 年 11 月 17 日将其自动迁移为“skills”。这次调整不只是功能更名,也体现出大模型平台正从自定义助手模式转向更细粒度的技能调用模式。
-
Modal Labs被曝接近完成7.5亿美元融资,估值升至157.5亿美元
AI推理基础设施公司Modal Labs被曝正接近完成由Accel领投的7.5亿美元融资,投后估值达到157.5亿美元。随着AI应用进入部署阶段,资本正在从模型训练侧转向推理服务侧。
-
Anthropic 招股书披露巨额亏损与灾难性风险:大模型公司开始把「可能毁灭人类」写进上市文件
Anthropic 的 IPO 招股书不仅披露了巨额亏损、收入增长和 5180 亿美元基础设施支出,还把模型可能带来的极端风险写入风险因素。大模型公司走向资本市场时,安全披露正在成为新的关注点。
-
Linear 用千个 PR 换掉 styled-components,一次原子化 CSS 的成本复验
Linear 用 1000 多个 PR 将 styled-components 换成 StyleX,官方称主线程工作量下降 20% 到 35%。一次本地复现实验拆解了两种方案的真实成本:运行时 CSS-in-JS 的开销随样式组合数增长,而 StyleX 把成本前置到构建期,并在语法层面限制外部样式覆盖。
-
Claude Sonnet 5.5 上线免费层:Anthropic 用更快更省的中端模型加压竞争
Anthropic 推出 Claude Sonnet 5.5,在保持 Sonnet 5 定价的同时,将运行速度提升超过 30%,并把多数任务成本最多降低 30%。Simon Willison 的测试显示,新模型在部分编码任务中已接近 Opus 5.5,同时也暴露出长思考模式下的成本问题。
-
Spring AI 实战复盘:单测全绿,为何 AI 产品仍会失效
一位开发者在 Spring AI 项目中写了 80 多个单元测试,全部通过,但用户仍遇到 AI 自行生成「岗位描述为空」的回复。该案例显示,AI 应用工程化不能只依赖传统单测,还需要行为测试、评估基线和完整的上下文设计。