蚂蚁百灵与 ASystem 团队打通单机 Agentic RL 后训练闭环
蚂蚁百灵与 ASystem 团队合作,用 Ling-3.0-tiny 和 AReno 在 DGX Spark 上跑通单机 Agentic RL 后训练闭环。以井字棋为最小验证任务,用 GSPO 算法训练 400 步后,rollout/rewards_mean 从约 -0.5 升至 0.4。
从 0 到1 带你速通 DeepSeek Harness
数字生命卡兹克发布 DeepSeek Harness 速通教程,帮助开发者快速上手 DeepSeek 的工具链与开发框架。
Claude 接管应用日常维护:388 个 PR 的实践
Boris Cherny 尝试让 Claude 接管应用日常维护,通过 Slack 频道运行崩溃模糊测试、重复代码统一、死代码移除等任务。数周内自动开出 388 个 PR,其中 180 个经审核后合并。
AI 审计代理在 Cloudflare CIRCL 中发现 7 个漏洞
zkSecurity 的 AI 审计代理 zkao 用 Opus 4.6 / GPT-5.3 + skills 发现并确认 7 个真实漏洞,含阈值 RSA float64 精度丢失、CP-ABE 访问控制完全失效(均 Critical)。
Claude 开发者分享两种多智能体模式:Advisor 和 Orchestrator
Advisor 模式(Sonnet 5 执行 + 调用 Fable 5 顾问)组合方案约 92% 性能、63% 成本;Orchestrator 模式(Fable 5 编排多个 Sonnet 5)约 96% 性能、46% 成本。
蚂蚁集团周俊 AICon 演讲:从 Token 数量到 Token 密度,万亿参数模型效率优先
提出从"更多 Token"转向"更高 Token 密度",采用混合线性注意力架构使 256K 长上下文成本从指数级降至线性级,Token 输出减少约 4 倍而能力不降。
《人生设计课》Prompt 实测:用 Claude 设计人生的四个阶段
将斯坦福《人生设计课》理论体系制成 Prompt,分看清现状/找到指南针/寻路/制定奥德赛计划四阶段,最终输出 8000–12000 字《个人人生设计蓝图》。
Krea 2 身份保留功能上线
配套模型和 ComfyUI 节点已上线。
YC CEO 声称每日用 AI 部署 3.7 万行代码,开发者审查发现前端代码大量臃肿低效
Garry Tan 称每天部署 37000 行 AI 代码并连续 72 天发布;开发者审查其网站前端发现 169 次请求、6.42MB 数据、78 个未使用的 JS 控制器等臃肿问题。
Liquid AI 开源 Antidoom:基于最终 Token 偏好优化的推理模型死循环修复方法
FTPO 方法定位循环开始的首个 token 并训练模型选连贯替代项,将循环率从 10.2% 降至 1.4%(LFM2.5)乃至 22.9%→1%(Qwen3.5),全部代码与数据集已开源。
人们如何使用 Claude Cowork
基于 120 万次会话样本:业务流程与运营占 33.4%(整理报告/核对表格),内容创作 16.4%,软件开发仅 8.7%。多用于跨团队衔接性任务。
Elvis Saravia 通过 HITL 和 DialAgent 提升 agentic loops 可靠性
所有 Claude/Codex agent 会话经 @DialAgent MCP 服务器,为 agent 提供专属号码,循环处理 PR 时通过简短电话将决策升级给人类。
在 Claude Code 中选择 Claude 模型与努力级别
模型决定能力范围,努力级别还控制读文件数、验证步骤与多步任务推进深度;已掌握上下文仍出错应换更强模型,因跳读/未跑测试出错应提高努力级别。
