欢迎访问本站,持续更新中…

用户一动代码 AI编程代理就掉链子

SWE-Touch 基准向编码代理任务中注入与目标冲突的反编辑,九种模型在 SWE-bench Verified 上平均解决率下降 7.7 个百分点,失败主因是代理对工作空间动态变化缺乏感知

智能体安全事故要共享了 防御跟得上吗

Linux 基金会发布 SAFE 征求意见稿,开放安全 AI 联盟牵头把智能体安全事故变成生态共享防御,但事故数据本身包含提示词、工具调用等敏感内容,共享粒度与责任边界仍无答案

微软开源Orchard 智能体研究缺的不是模型是环境

微软开源 Orchard 智能体框架,把基于 Kubernetes 的训练环境做成可复用服务,并能在 Codex、OpenClaw 等真实 harness 里端到端训练,Orchard-SWE 以约 30 亿激活参数逼近大十倍的前沿系统

Kotlin 15岁 出了个专属AI编程基准

Kotlin 迎来 15 岁生日并发布首个公开 AI 编码代理基准:105 个来自开源仓库的真实工程任务,按解决率、token 成本和延迟排名,语言社区开始把 AI 工具质量当生态竞争力

让AI当调参师 多轮迭代还是短板

AgentHPOBench 用 30 个可执行 ML 任务评估 LLM 作为序列超参数优化器,单轮干预尚可,持续迭代与日志诊断仍是短板

开源函数调用数据框架 小模型追上大模型

Data Turnstile 用分步生成+验证反馈为小模型造函数调用训练数据,Qwen3-0.6B 单轮准确率 67.4% 提升至 75.9%,代价是生成延迟

多模态AI看人熟不熟 视觉信息没帮上忙

FriendBench 对比 26 个多模态模型与人类判断熟人/陌生人,准确率无显著差异但模型偏向陌生人,视觉模态仅对人类有增益

Qwen3.8-Max发布 自进化编程是噱头吗

Qwen3.8-Max 演示模型自主构建 GitHub Issue 状态机、跑 CI、合并 PR 的自进化编程闭环,无人值守自动编程的鲁棒性仍缺公开数据

GitHub源码处理提速 一趟扫描反而更慢

GitHub 实测两阶段大小写折叠方案吞吐 23 GiB/s,是融合单趟的 2.6 倍,热点循环里分支开销比内存访问更致命