Cloudflare开源Agent平台 权限跟着数据走
Cloudflare 开源内部 Agent 平台 Cloudflare OS:agent 默认零权限,Gatekeeper 持有凭证执行策略,观察日志记录数据流向,授权必须考虑数据接下来去哪
Cloudflare 开源内部 Agent 平台 Cloudflare OS:agent 默认零权限,Gatekeeper 持有凭证执行策略,观察日志记录数据流向,授权必须考虑数据接下来去哪
Neon 与 Castform 合作展示:4B 开源模型经 RL 后训练后检索准确率对齐 GPT-5.6 Sol,成本降低百倍,把推理成本转移到训练端
SWE-Touch 基准向编码代理任务中注入与目标冲突的反编辑,九种模型在 SWE-bench Verified 上平均解决率下降 7.7 个百分点,失败主因是代理对工作空间动态变化缺乏感知
Linux 基金会发布 SAFE 征求意见稿,开放安全 AI 联盟牵头把智能体安全事故变成生态共享防御,但事故数据本身包含提示词、工具调用等敏感内容,共享粒度与责任边界仍无答案
微软开源 Orchard 智能体框架,把基于 Kubernetes 的训练环境做成可复用服务,并能在 Codex、OpenClaw 等真实 harness 里端到端训练,Orchard-SWE 以约 30 亿激活参数逼近大十倍的前沿系统
Kotlin 迎来 15 岁生日并发布首个公开 AI 编码代理基准:105 个来自开源仓库的真实工程任务,按解决率、token 成本和延迟排名,语言社区开始把 AI 工具质量当生态竞争力
AgentHPOBench 用 30 个可执行 ML 任务评估 LLM 作为序列超参数优化器,单轮干预尚可,持续迭代与日志诊断仍是短板
Data Turnstile 用分步生成+验证反馈为小模型造函数调用训练数据,Qwen3-0.6B 单轮准确率 67.4% 提升至 75.9%,代价是生成延迟
FriendBench 对比 26 个多模态模型与人类判断熟人/陌生人,准确率无显著差异但模型偏向陌生人,视觉模态仅对人类有增益
Qwen3.8-Max 演示模型自主构建 GitHub Issue 状态机、跑 CI、合并 PR 的自进化编程闭环,无人值守自动编程的鲁棒性仍缺公开数据