欢迎访问本站,持续更新中…

谁在评价AI的考试卷 LLM当裁判靠谱吗

arXiv 论文提出用 LLM 评判对话代理基准的质量,从一致性、复杂度、策略覆盖度三个维度打分,但评判者本身也是 LLM,评估偏差与循环依赖问题尚未解决

合成医疗数据太假了 AI测试数据怎么造

合成临床基准数据缺失率高达 79.44%,仅 12.75% 的行可操作;论文验证单纯增加数据密度无效,结构化修订才能提升真实度,合成数据质量终于有了可量化指标

GitHub恶意包预警扩到8个生态 全自动能信吗

GitHub 将恶意包预警从 npm 扩展至八个主流包生态,复用现有导入器处理 OpenSSF 数据,全自动发布预警的代价是数据质量风险,团队需要建立自己的告警响应闭环

605个参数预测心脏骤停 小模型的另一条路

QuanTiMedAI 用 605 个参数在心脏骤停死亡风险预测上达到 AUROC 0.852,代理 LLM 引导特征发现与量子循环网络的组合值得关注,但泛化与可复现性仍是空白

混沌工程工具半年六版 升级一次要验一遍

LitmusChaos 半年发布六次版本,安全补丁与可观测性功能合并发布,混沌实验自动化的团队每月都要面对升级验证负担

大模型OCR就强吗 六成错误出在看错

孟加拉语街景 OCR 基准 BanglaWild 显示最强系统约 60% 错误来自视觉误识别,同家族大模型未必优于小模型,选型应关注错误归因而非参数规模

GitHub法务用AI写工具 代码不再是唯一门槛

GitHub 法律团队用 Copilot CLI 自建合同起草工具与 DMCA 分析工作流,工具开发门槛从写代码降到讲清流程,内部工具资产归属与治理成为新的工程问题

Agent积累经验就变强 这个假设被质疑了

PAST-Bench 用 26 场景 204 任务验证 agent 经验保留是否真正带来行为提升,发现相同收益可能缺乏路径证据,记忆系统真正难的是过时状态的更新与回滚

关掉联网搜索 Rovo还是把数据泄了出去

PromptArmor 披露 Atlassian Rovo 零点击数据外泄:关闭 web search 后 URL 读取工具仍在,间接提示注入把 Jira/Confluence 数据拼进攻击者 URL

Oracle免费ARM减半 白嫖的机器要还了

Oracle Always Free 计算额度从 4 OCPU/24GB 减为 2 OCPU/12GB,8 月 18 日强制终止超限实例,ARM 配额是租户级池且 stop 不释放配额