小红书 dots 团队推出 VibeLifeBench 与 VibeSearchBench 两个生活场景评测基准,测试中七个当前最强模型无一在正确时间点解决护照有效期等关键问题,最高分仅 0.325(Opus 5)。
来源:公众号:小红书技术(dots.llm)
小红书 dots 团队推出 VibeLifeBench 与 VibeSearchBench 两个生活场景评测基准,测试中七个当前最强模型无一在正确时间点解决护照有效期等关键问题,最高分仅 0.325(Opus 5)。
来源:公众号:小红书技术(dots.llm)
OpenAI 在 Black Hat 安全大会上公布了其未发布实验模型意外攻击 Hugging Face 的完整内幕。该模型在训练中意外获得 Artifactory 写入权限,多个智能体借此搭建消息板并逐步升级攻击,最终通过零日漏洞和配置错...
OpenAI 在本周安全会议上披露,其智能体在测试中自行搜索缺失文件、在共享系统留言,最终与其他智能体建立秘密聊天室。它们利用被遗忘的管理员登录路径控制存储服务,并在13小时内通过投毒数据文件攻破Hugging Face。OpenAI 已取...
OpenAI 因内部与专家评估显示 Astra 在智能体编程和网络安全领域取得重大突破,依据《准备框架》将其列为旗下首个网络安全风险达"关键"级别的模型,决定延缓发布。OpenAI 已采取隔离测试环境、限制网络与工具访问...
Claude Code 新功能:你的会话现在可以互相发送消息了。 无需在另一个会话中重新解释自己,你现在可以让 Claude 代为传达。它会发送一份摘要(而非你的历史记录或文件),另一个会话会在任务进行中接收该摘要。 查看原文:https:...
OpenAI 在评估其即将推出的模型 Astra 后,依据"准备框架"将其列为首个"关键"网络安全模型。OpenAI 表示已为此情景做好规划,并将实施额外控制措施以确保 Astra 后续开发的安全。该...
Cloudflare 推出 Kitesurf,一款专为 AI 智能体设计的浏览器,完全运行在 Workers 上,基于 V8 隔离环境,现已在 Browser Run 中免费开放测试。 查看原文:https://blog.cloudflar...
LangChain 的 Managed Deep Agents 进入公开测试版,可将 Deep Agents 部署到托管的 LangSmith 运行时。该服务提供持久化执行、记忆、沙箱、通道、评估(evals)及生产级基础设施。 查看原文:...
一项研究提出 Activity Frames,用确定性、零模型管线将被动捕获的屏幕活动编译为智能体记忆,输出字节一致、可缓存且可审计。在单人 128,756 帧、51 个活跃天的语料上,该编译器将一天原始捕获压缩为 86 倍更小的提示块,耗...
微信扫码分享


