谁在评价AI的考试卷 LLM当裁判靠谱吗
arXiv 论文提出用 LLM 评判对话代理基准的质量,从一致性、复杂度、策略覆盖度三个维度打分,但评判者本身也是 LLM,评估偏差与循环依赖问题尚未解决
arXiv 论文提出用 LLM 评判对话代理基准的质量,从一致性、复杂度、策略覆盖度三个维度打分,但评判者本身也是 LLM,评估偏差与循环依赖问题尚未解决
合成临床基准数据缺失率高达 79.44%,仅 12.75% 的行可操作;论文验证单纯增加数据密度无效,结构化修订才能提升真实度,合成数据质量终于有了可量化指标
GitHub 将恶意包预警从 npm 扩展至八个主流包生态,复用现有导入器处理 OpenSSF 数据,全自动发布预警的代价是数据质量风险,团队需要建立自己的告警响应闭环
QuanTiMedAI 用 605 个参数在心脏骤停死亡风险预测上达到 AUROC 0.852,代理 LLM 引导特征发现与量子循环网络的组合值得关注,但泛化与可复现性仍是空白
LitmusChaos 半年发布六次版本,安全补丁与可观测性功能合并发布,混沌实验自动化的团队每月都要面对升级验证负担
孟加拉语街景 OCR 基准 BanglaWild 显示最强系统约 60% 错误来自视觉误识别,同家族大模型未必优于小模型,选型应关注错误归因而非参数规模
GitHub 法律团队用 Copilot CLI 自建合同起草工具与 DMCA 分析工作流,工具开发门槛从写代码降到讲清流程,内部工具资产归属与治理成为新的工程问题
PAST-Bench 用 26 场景 204 任务验证 agent 经验保留是否真正带来行为提升,发现相同收益可能缺乏路径证据,记忆系统真正难的是过时状态的更新与回滚
PromptArmor 披露 Atlassian Rovo 零点击数据外泄:关闭 web search 后 URL 读取工具仍在,间接提示注入把 Jira/Confluence 数据拼进攻击者 URL
Oracle Always Free 计算额度从 4 OCPU/24GB 减为 2 OCPU/12GB,8 月 18 日强制终止超限实例,ARM 配额是租户级池且 stop 不释放配额