用户一动代码 AI编程代理就掉链子
SWE-Touch 基准向编码代理任务中注入与目标冲突的反编辑,九种模型在 SWE-bench Verified 上平均解决率下降 7.7 个百分点,失败主因是代理对工作空间动态变化缺乏感知
SWE-Touch 基准向编码代理任务中注入与目标冲突的反编辑,九种模型在 SWE-bench Verified 上平均解决率下降 7.7 个百分点,失败主因是代理对工作空间动态变化缺乏感知
Linux 基金会发布 SAFE 征求意见稿,开放安全 AI 联盟牵头把智能体安全事故变成生态共享防御,但事故数据本身包含提示词、工具调用等敏感内容,共享粒度与责任边界仍无答案
微软开源 Orchard 智能体框架,把基于 Kubernetes 的训练环境做成可复用服务,并能在 Codex、OpenClaw 等真实 harness 里端到端训练,Orchard-SWE 以约 30 亿激活参数逼近大十倍的前沿系统
Kotlin 迎来 15 岁生日并发布首个公开 AI 编码代理基准:105 个来自开源仓库的真实工程任务,按解决率、token 成本和延迟排名,语言社区开始把 AI 工具质量当生态竞争力
AgentHPOBench 用 30 个可执行 ML 任务评估 LLM 作为序列超参数优化器,单轮干预尚可,持续迭代与日志诊断仍是短板
Data Turnstile 用分步生成+验证反馈为小模型造函数调用训练数据,Qwen3-0.6B 单轮准确率 67.4% 提升至 75.9%,代价是生成延迟
FriendBench 对比 26 个多模态模型与人类判断熟人/陌生人,准确率无显著差异但模型偏向陌生人,视觉模态仅对人类有增益
Qwen3.8-Max 演示模型自主构建 GitHub Issue 状态机、跑 CI、合并 PR 的自进化编程闭环,无人值守自动编程的鲁棒性仍缺公开数据
OpenAI 将 openai/git 的性能与正确性改进推送到上游,AI 厂商从用工具转向改工具,CI 脚本需重新验证
GitHub 实测两阶段大小写折叠方案吞吐 23 GiB/s,是融合单趟的 2.6 倍,热点循环里分支开销比内存访问更致命