-
LangSmith 上手指南:给 RAG 与 Agent 加一套可观测系统
LangSmith 的意义不只是调试工具,而是让 RAG 与 Agent 的执行过程、成本消耗和评估基础变得可见、可控、可追踪。
-
DeepSeek Harness 采用 Cordis 插件架构:让 Agent 系统更像可装配运行时
DeepSeek Harness 将模型、工具、会话、沙箱、Agent 循环等能力全部交给插件,Cordis 只维护上下文、服务注册、事件分发、依赖激活和副作用回收。这套架构把 Agent 系统从固定内核变成可装配运行时,也让多会话隔离、热更新和生命周期回收成为框架层问题。
-
DHH宣称手写代码时代落幕:AI编程正在重写工程师的责任边界
Ruby on Rails 创始人 DHH 在 Rails World 上表示,37signals 已基本停止手写代码。这一表态引发行业对 AI 编程边界与工程师责任的重新审视。
-
Meta 新模型 Muse Spark 用 16 个 AI Agent 并行推理,试图改写大模型竞争规则
Meta 超级智慧实验室推出的 Muse Spark,用 16 个 AI Agent 并行推理替代单线程深度思考,在部分科学推理和工具调用基准上追平或超过 GPT-5.4 Pro、Gemini 3.1 Deep Think。
-
当机器人跳进熔炉:Figure 的退役仪式,变成一场具身智能的注意力竞争
Figure 让退役机器人 F.02 跳入75吨电弧炉,并邀请施瓦辛格参与,将一次设备处理变成全球传播事件。背后反映的是人形机器人行业从技术演示走向品牌化竞争的趋势。
-
开源大模型开始局部领跑:从技术追赶到商业重构
开源权重模型正在从闭源模型的替代品,转变为部分场景中的优先选择。随着差距缩短、成本下降和开放权重生态成熟,AI 行业的技术路线与商业模式都在被重新计算。
-
评估 AI 编程助手时,Token 单价为什么会失真
AstraCode 对 11 个模型进行真实编码任务测试后发现,AI 编程助手的成本不能只看 token 单价,任务步数、通过率、返工和验证成本才是更关键的指标。
-
前OpenAI安全报告负责人离职发声:AI行业需要核电级防护
曾负责OpenAI模型发布安全报告的David Robinson离职后公开表示,AI行业文化已经“根本性损坏”,并呼吁前沿实验室采用类似核电站的多层安全机制。
-
Codex CLI 多会话时代:为什么 Current checkout 与 New worktree 成为 AI 编程的关键选择
Codex CLI 在新会话中提供 Current checkout 与 New worktree 两种执行目录选择,反映出 AI 编程工具正在进入多会话、并行任务的 Git 协作阶段。
-
OpenAI 推出 Decisions API:用低成本“决策层”管理失控的智能体
OpenAI 在 Dev Day 上低调发布 Decisions API,用低成本、高速度的选择式接口补充大模型能力。这一方向与 TypeSafe 的 Jev 相似,也可能成为未来智能体安全监控和多智能体协调的重要决策层。