🤖 AI 速览

今天的重点有两条:Moonshot 开放 Kimi K3,2.8 万亿参数把开源模型的能力和部署门槛一起抬高;同时,Agent 落地开始从演示转向生产,行业更关注审计、留痕、合规和贴近真实任务的评测,而不是单纯分数。
📋 文章元数据
发布时间
2026-07-28
类型
ai-daily
字数
3709
阅读时长
18 min

2026-07-28 AI日更 | Kimi K3 开放权重冲到 2.8 万亿参数,Agent 开始从可用走向可审计 链接到标题

今天的重点有两条:Moonshot 开放 Kimi K3,2.8 万亿参数把开源模型的能力和部署门槛一起抬高;同时,Agent 落地开始从演示转向生产,行业更关注审计、留痕、合规和贴近真实任务的评测,而不是单纯分数。

📖 本期 Watch List 深度导读 链接到标题

今天最值得盯紧的,是“Agent 从能用走向可沉淀、可审计、可合规”这条主线:FlowEvo 把成功工作流编译成可复用技能,LoRA 直接把文档知识烘焙进参数里,Humanly 则把人机共写的过程留痕做实;再加上文档生成播客的忠实度和版权合规评测,说明落地问题已从演示转向生产。第二条线是评测范式升级:从静态正确率转向偏好、共识与操作一致性,LLM 基准、MeSH 检索、野火风险评估都在提醒我们,指标是否对准真实任务,比分数本身更重要。最后,多模态安全继续升温,VLM 越狱与跨模态防护值得安全团队重点跟进。

🌐 X 平台 AI 热点快讯 链接到标题

话题 1:ChatGPT Work Surpasses Codex in Active Users Amid Rapid Growth 链接到标题

  • 分类:AI · News
  • 概况:热度时间:2 days ago,相关帖子数:7400
  • 是什么事:ChatGPT Work 的活跃用户数在快速增长中超过了 Codex。
  • 为什么重要:这反映出面向工作场景的 AI 产品正在获得更强的用户采用,说明 AI 工具的价值正从代码生成扩展到更广泛的办公与协作场景。
  • 讨论概况:X 上的讨论主要集中在 ChatGPT Work 增长是否意味着企业端需求更强、Codex 的定位是否被边缘化,以及这是否预示着 AI 产品正从开发者工具转向通用生产力平台。

话题 2:Neurosurgeon Claims Muscle Building Shortens Life, Sparks Fitness Debate 链接到标题

  • 分类:AI · News
  • 概况:热度时间:,相关帖子数:33
  • 是什么事:一位神经外科医生声称,刻意增肌可能缩短寿命,引发 X 上关于健身、肌肉与健康风险的争论。
  • 为什么重要:这类争议涉及医疗知识传播与健康建议可信度,AI 在生成、检索和推荐健康内容时需要更准确地区分观点、证据与误导信息。
  • 讨论概况:讨论焦点主要集中在“增肌是否真的有害”、证据是否充分、不同训练方式对寿命和代谢健康的影响,以及医生观点是否被断章取义。

话题 3:Coffee Shop Guy Sips in Peace, No Screens in Sight 链接到标题

  • 分类:AI · News
  • 概况:热度时间:,相关帖子数:50
  • 是什么事:一名男子在咖啡馆里安静喝咖啡、全程没有使用任何屏幕的画面在 X 上引发关注。
  • 为什么重要:这类内容之所以与 AI 领域相关,是因为它折射出公众对数字设备、算法推荐和智能界面过度侵入日常生活的反思,也凸显了人们对更克制、更少打扰的技术体验的需求。
  • 讨论概况:X 上的讨论主要集中在三点:有人把它看作“数字戒断”或慢生活的理想样本;有人认为这只是一个被美化的瞬间,不代表真实日常;也有人借此讨论 AI 和移动设备是否正在让人们更难获得专注与安静。

话题 4:Moonshot AI Releases Kimi K3 Open Weights with 2.8 Trillion Parameters 链接到标题

  • 分类:AI · News
  • 概况:热度时间:21 hours ago,相关帖子数:27000
  • 是什么事:Moonshot AI 发布了 Kimi K3 的开放权重版本,并将约 1.4TB 的模型文件以宽松许可放到 Hugging Face 上。
  • 为什么重要:这标志着超大规模前沿模型开始以开放权重形式进入市场,可能推动开源生态、模型可获取性和中美 AI 竞争格局的变化,也让大模型能力扩散与部署门槛问题更受关注。
  • 讨论概况:X 上讨论主要集中在三点:其一,Kimi K3 以 2.8 万亿总参数、百万级上下文和多模态能力刷新开放权重模型规模;其二,它在编码和长上下文任务上的表现是否足以对标闭源前沿模型;其三,开放权重是否会带来战略优势、合规与安全风险,以及 1.4TB 模型对推理基础设施的现实门槛。

话题 5:NVIDIA Launches Open Secure AI Alliance After Major Breach 链接到标题

  • 分类:AI · News
  • 概况:热度时间:14 hours ago,相关帖子数:19000
  • 是什么事:NVIDIA 在遭遇重大安全事件后,宣布发起一个面向开放与安全的 AI 联盟。
  • 为什么重要:这对 AI 领域重要,因为它把模型、基础设施和供应链安全提升到行业协作层面,可能影响后续 AI 产品的安全标准与合规方向。
  • 讨论概况:X 上的讨论主要集中在联盟是否能真正改善 AI 安全、是否只是危机后的公关回应,以及开放协作与安全封闭之间如何平衡。

话题 6:Why No $2000 AI Subscriptions for Power Users? 链接到标题

  • 分类:AI · News
  • 概况:热度时间:18 hours ago,相关帖子数:1600
  • 是什么事:X 上有讨论质疑为何主流 AI 公司尚未面向重度用户推出每月约 2000 美元的高端订阅服务。
  • 为什么重要:这关系到 AI 产品的商业化路径、算力成本回收以及专业用户对更高性能、更大额度和更稳定服务的付费意愿。
  • 讨论概况:讨论焦点在于高价订阅是否有真实市场需求:支持者认为开发者、企业和内容生产者愿为更强模型与更高限额付费;质疑者则认为价格过高、企业 API 已满足需求,且可能加剧 AI 工具的使用门槛和资源分化。

话题 7:Caitlin Clark Sets WNBA Record with 38.3 Points-plus-Assists Average 链接到标题

  • 分类:AI · Sports
  • 概况:热度时间:,相关帖子数:328
  • 是什么事:WNBA球员凯特琳·克拉克创下场均得分加助攻38.3的新纪录,引发X平台热议。
  • 为什么重要:该事件本身属于体育领域,但其高热度体现了体育数据分析、实时内容推荐和AI驱动的赛事传播在公众讨论中的影响力。
  • 讨论概况:X上的讨论主要集中在克拉克的历史地位、数据含金量、对WNBA关注度的提升,以及是否应将她视为联盟当前最具影响力的球员。

话题 8:Vukic Crushes Svajda in DC Open Upset 链接到标题

  • 分类:AI · Sports
  • 概况:热度时间:,相关帖子数:55
  • 是什么事:在华盛顿公开赛中,Vukic 爆冷击败 Svajda,成为当天的一个冷门赛果。
  • 为什么重要:这类体育热点对 AI 领域的重要性在于,它体现了模型对实时赛事、冷门结果和舆情变化的快速理解与摘要能力,也可用于训练体育新闻生成和趋势分析。
  • 讨论概况:X 上的讨论主要集中在这场冷门是否出乎预期、Vukic 的状态是否更好,以及 Svajda 失利的原因;部分讨论也在比较双方排名、赛前预测和比赛关键分。

话题 9:LeBron James Signs with 76ers for Two-Year Deal at Age 41 链接到标题

  • 分类:AI · Sports
  • 概况:热度时间:1 day ago,相关帖子数:172000
  • 是什么事:X 上热议称勒布朗·詹姆斯以两年合同加盟费城 76 人,相关话题迅速发酵。
  • 为什么重要:这类高热度体育突发消息是 AI 新闻理解、谣言识别、热点聚类和实时摘要能力的典型测试场景,也反映模型对社交媒体快速传播内容的处理能力。
  • 讨论概况:讨论主要集中在消息是否属实、勒布朗若加盟后对 76 人争冠格局的影响、年龄与竞技状态是否还能支撑高强度贡献,以及“最佳下家”式的转会猜测和球迷调侃。

话题 10:Lando Norris Wins Hungarian Grand Prix in McLaren Masterclass 链接到标题

  • 分类:AI · Sports
  • 概况:热度时间:1 day ago,相关帖子数:378000
  • 是什么事:兰多·诺里斯在匈牙利大奖赛夺冠,迈凯伦展现出强势的比赛表现。
  • 为什么重要:这类高热体育事件对AI领域重要,因为它是检验模型实时热点识别、跨领域摘要和舆情聚合能力的典型场景。
  • 讨论概况:X上的讨论主要集中在诺里斯的个人表现、迈凯伦的整体竞争力和战术执行,也有人在争论这场胜利更多来自车手发挥还是车队策略,以及其他车队表现不佳的原因。

话题 11:Arsenal Eye Vinicius Junior After Premier League Title Win 链接到标题

  • 分类:AI · Sports
  • 概况:热度时间:2 days ago,相关帖子数:607000
  • 是什么事:有消息称阿森纳在英超夺冠后有意引进皇马前锋维尼修斯·儒尼奥尔。
  • 为什么重要:这类高热度体育转会传闻常被用于AI新闻摘要、舆情分析和内容生成,也考验AI对未证实信息的识别与去偏能力。
  • 讨论概况:X上的讨论主要集中在传闻是否可信、阿森纳能否承担转会和薪资成本、维尼修斯是否会离开皇马,以及若交易成真会如何改变英超竞争格局;也有人认为这只是炒作。

话题 12:Mizkif Runs YouTube Ads on Asmongold’s Videos to Promote Defamation Video 链接到标题

  • 分类:AI · Entertainment
  • 概况:热度时间:,相关帖子数:124
  • 是什么事:Twitch/YouTube主播 Mizkif 被指在 Asmongold 的视频前投放 YouTube 广告,用于推广一段涉及诽谤指控的视频。
  • 为什么重要:该事件本身并非核心 AI 技术新闻,但涉及平台广告投放、内容推荐与名誉争议,反映出算法分发和广告系统可能被用于放大创作者纠纷。
  • 讨论概况:X 上讨论焦点集中在 Mizkif 的做法是否属于恶意营销或骚扰、视频内容是否构成诽谤,以及 YouTube 是否应对类似定向投放和争议内容推广加强审核。

话题 13:UK Takeaway Order Delivers Handful of Limp Fries Instead of Loaded Bowl 链接到标题

  • 分类:AI · Entertainment
  • 概况:热度时间:,相关帖子数:27
  • 是什么事:英国一名顾客点的外卖被送成了一小把软塌塌的薯条,而不是预期中的丰盛碗餐,引发社交平台热议。
  • 为什么重要:这类外卖翻车事件之所以值得关注,是因为它反映了平台配送、订单识别和自动化客服等环节的可靠性问题;如果未来更多环节由 AI 参与,类似错误会直接影响用户体验与信任。
  • 讨论概况:X 上的讨论主要集中在这是商家配错、平台出错还是配送环节失误,也有人调侃实际收到的食物与订单图片反差过大,并借机吐槽外卖质量不稳定。

话题 14:Once Human Players Share Stunning Post-Apocalyptic Photos for Second Anniversary 链接到标题

  • 分类:AI · Entertainment
  • 概况:热度时间:,相关帖子数:48
  • 是什么事:《Once Human》玩家在二周年之际在 X 上分享了大量末日风格的精美截图和摄影作品。
  • 为什么重要:这类话题体现了 AI 时代游戏中的高质量视觉生成、拍照模式和用户创作生态如何放大社区传播,也反映了 AI 驱动的内容生产对游戏营销与创作门槛的影响。
  • 讨论概况:X 上的讨论主要集中在截图的画面表现、末日美术风格和二周年内容是否足够;同时也有人讨论这些作品是否使用了 AI 辅助工具或仅来自游戏内拍摄。

话题 15:Tesla Robotaxis Go Silent on Turn Signals and Hazards 链接到标题

  • 分类:AI · News
  • 概况:热度时间:,相关帖子数:233
  • 是什么事:X 平台上热议特斯拉 Robotaxi 在行驶中疑似未正确使用转向灯和危险警示灯,引发对其道路表现的关注。
  • 为什么重要:这件事关系到自动驾驶系统的基础交通规范遵守与安全可信度,也会影响外界对 Robotaxi 商业化成熟度和监管可接受性的判断。
  • 讨论概况:讨论焦点集中在这是系统性缺陷还是个别场景失误;支持者认为仍处测试和迭代阶段,反对者则认为连基础信号都处理不稳说明自动驾驶距离真正可用还有差距。

今日 X 上的 AI 舆情小结 链接到标题

今天 X 上关于 AI 的舆论主线,明显从“模型谁更强”转向了“AI 正如何走向产品化、平台化与基础设施化”:ChatGPT Work 增长、Kimi K3 开放权重、以及高价订阅的讨论,都在说明用户和市场更关心 AI 能否真正进入办公、协作和重度生产场景。相对一致的共识是,AI 的价值边界正在从开发者工具扩展到通用生产力平台,而开放模型、长上下文和更强算力供给会继续推动生态扩散。分歧则集中在两点:一是开放权重到底是战略优势还是安全与合规风险,二是高端订阅究竟能否形成真实付费市场,还是只会加剧资源分化与使用门槛。潜在风险也因此更突出,包括模型能力快速扩散带来的安全与滥用问题、AI 联盟是否沦为危机公关、以及自动驾驶和健康类内容中因判断失误或误导信息引发的现实后果。

💡 大佬观点(Influencer Insights) 链接到标题

好的,基于你提供的多位 AI 大佬过去 24 小时的推文汇总,我为你整理出以下分析报告:


AI 大佬日度观察:技术、趋势与资源洞察 链接到标题

1. 共同关注的技术趋势 链接到标题

  • Anthropic 模型“全家桶”成为绝对焦点: 随着 @claudeai 的一系列公告,大佬们的讨论高度集中在 Anthropic 的新模型和定价策略上。

    • Claude Opus 5 发布@dotey 详细解析了 Opus 5 的发布,强调其定位是“以 Fable 5 一半的价格,提供接近其前沿智能”,并在代码、自动化等多项关键评测中表现亮眼,尤其适合同一时间处理多项复杂任务的 Agent。
    • Fable 5 权限下放@zhixianio 重点关注到 Claude Fable 5 将于 7 月 20 日开始包含在 Max 和 Team 等高级订阅方案中,这标志着 Anthropic 最强模型正快速向更广泛的付费用户普及。
  • 开源模型“体量竞赛”与实用性的博弈

    • Kimi K3 发布震撼开源界@dotey@ruanyf 都迅速关注到月之暗面开源了 2.8T 参数的 MoE 模型 Kimi K3。@ruanyf 通过亲身测试肯定其性能“真的接近 Fable 5”,并指出参数激增是其能力飞跃的主因,同时提醒其 API 定价(国内 20元/100元每百万Token)已是国内最贵。
    • 小模型的惊艳表现与局限@zhixianio 深入测试了 MiniCPM-o 4.5 (9B) 的音视频全双工能力,直言“很难想象这是一个 9B 模型能达到的效果”。但他对 Gemma 4 12B Coder 的实际编码测试表明,在处理“长篇、有状态、一次成型”的复杂程序时,12B 参数的“天花板”仍然明显,不如他日常使用的 Qwen 35B MoE。
  • 端侧模型(On-device Model)崭露头角@zhixianio 成为此方向的旗手,他的推文表明端侧模型已不再仅是概念。他不仅在播客《认知有县》中正式讨论该话题,还积极测试 Google 的 Gemma 4 QAT(量化感知训练)模型系列(包括 E4B 和 12B Coder),并称赞其在特定任务上的性能和 Google 对端侧的重视。他甚至在设想“模型卡带”这种极具前瞻性的未来交互形态。

  • AI 视频与自动化工具向“蓝海”迈进@Pluvio9yte 的推文主线完全围绕“AI视频 + 自媒体变现”,他将此定位为“一片蓝海”。他开源了 55 个 AI 视频 Skill,并深度整合 Codex、Hyperframes、HeyGen 等工具,构建了从内容生成到数字人克隆的全自动化工作流,这是当前 AI 应用层探索的一个生动缩影。

2. 值得注意的独特观点 链接到标题

  • 模型协作的“悖论”与最佳实践@dotey 对当时流行的 /advisor 模式(让弱模型设计,强模型当顾问)提出了尖锐质疑。他认为这种做法逻辑上难以成立,并提出了自己的最佳实践:“让聪明的模型去设计,让弱一点的模型去执行,最后聪明的模型去验收”,这才是性价比最高的组合方式。

  • 结构化输出的“创造力陷阱”@vista8 分享了一篇重要论文的结论:要求大模型输出 JSON 或 XML 格式,会显著降低其回答的多样性。测试中,当要求模型“随便说个词”时,使用 JSON 格式输出“serendipity”的概率高达 64%。这提醒开发者,在追求结构化数据的便利性时,可能无意中扼杀了模型的创意。

  • AI 是“十倍效率”,而非“四天工作制”@ruanyf 转述了一篇名为《今天可以放假吗》的文章,引出了一个深刻的社会问题:当 AI 让白领工作效率倍增,一周的工作几小时就能完成,那么员工是否应该享受更多假期?他认为,除了个人技能的提升,AI 带来的全社会生产效率提升,最终应体现在平均薪资或福利的增长上,而非毫无变化。

  • AI 时代的“游戏感”与“游戏化”@nishuang 通过对比 CapWords多邻国,精准区分了产品设计中的“游戏感”和“游戏化”。他认为前者是激发好奇心和内啡肽的游戏感,后者是依靠多巴胺奖励驱动苦力活的游戏化。在用户愈发精明的当下,能带来发自内心愉悦的“游戏感”设计,将优于简单的积分奖励系统。

  • Claude Code 的战略性“收敛”@Pluvio9yte 引述的数据显示,Anthropic 为 Opus 5 删掉了 Claude Code 80% 的系统提示词。这不仅意味着 Claude Code 正与其自家最强模型进行深度、高效的绑定,也可能预示着它将减少对其他模型的兼容性,以追求极致性能和互操作性。

  • “免费小狗”与开源维护的负担@ruanyf 分享了 SQLite 作者 Richard Hipp 拒绝外部 PR 的理念。他将每个 PR 比喻为一只“免费小狗”,意味着在接受贡献的同时也承担了未来 25 年甚至更久的维护、文档和测试的道义责任。这为正在蓬勃发展的开源 AI 社区提供了关于可持续性的冷思考。

3. 推荐的工具与资源 链接到标题

  • AI 音视频创作

    • Suno: @vista8 推荐的一种音乐生成玩法:哼唱上传旋律,再让 AI 扩展成完整歌曲,可绕过版权限制。
    • ChatCut: @Pluvio9yte@teach_fireworks 对比测试后发现,它在精细调整的 MG 动效和节奏变化上优于 video-use,更适合作片。
    • HeyGen + Hyperframes + Codex 工作流: @Pluvio9yte 全部开源,用于低成本、零基础的自媒体变现,特别是通过数字人克隆和声音克隆技术。
  • 开发与效率工具

    • Bento PPT / Skill: @vista8 基于此开发了 HTML PPT Skill (npx skills add joeseesun/qiaomu-bento-ppt),能将内容一键生成可协作、动态的网页 PPT。
    • BaoCut (v0.8.2): @dotey 亲自迭代的视频画面翻译功能上线,支持 Agent 自动化操作,并能将结果导出至剪映二次编辑。
    • Mole: @gkxspace 推荐的 Mac 清理优化工具,其 CLI 可免费通过 brew install mole 安装。
    • eSIM Wallet: @AI_Jasonyu 推荐的免费手机卡管理软件,适合管理多张 eSIM 卡的用户。
  • 自媒体与变现工具

    • 小红书爆款封面 Skill: @pyang1235005 开源,@AI_Jasonyu 等大佬强烈推荐。它通过 Agent 分轮次引导,提供 10 种构图风格来生成封面,对点击率提升巨大。
    • PayPal 中国: @gefei55 分享的“信息差”,透露其已支持国内个人身份证注册并接入网站向全球用户收付美元,并分享了从注册到提现的完整合规路径。
    • GEO 知识库: @yaojingang 发布的 GEO 公开课资料合集,包含数据仓库、工具和 Skill,适合服务于出海企业 SEO 的用户。
  • AI 前沿与学习

    • 前沿 AI 论文精选 (Newsletter): @vista8 强烈推荐的周更资源,是快速跟上 AI 模型发展步伐的最佳途径之一。
    • 《AI 也有潜意识》: @vista8 推荐的文章,涉及 Anthropic 最新研究成果,探索模型在输出之外更深的内部状态。
    • 硬核 AI 知识点系列: @vista8 制作的科普视频,例如 RLHF、Multi-Head Attention 等,适合深度学习基础知识。

📚 附录:今日 Watch List 更新源列表 链接到标题

时间窗口:最近 3 天;覆盖 22 个源;共 33 条更新

Y Combinator Podcast (B_intro+search) 链接到标题

  • Jensen Huang: The Mindset That Built NVIDIA
    • 发布时间:2026-07-28 05:29 北京时间
    • 摘要:- 您可能已经听说过 OpenClaw(以前称为 Clawdbot/Moltbot)。
      • 引起轰动的开源人工智能助手可以在您自己的设备上运行,与您已经使用的消息应用程序连接,并且超越聊天功能,实际执行管理电子邮件、日历、文件、工作流程等任务。
      • 现在来认识一下它背后的人。
      • YC 的 Raphael Schaad 与 OpenClaw 的创始人 Peter Steinberger 坐下来,讨论了病毒式个人 AI 代理背后的“顿悟”时刻、为什么本地优先代理可以取代当今的许多应用程序,以及个人代理将如何重塑软件的未来。
    • EN 要点:
      • NVIDIA started with the wrong technology, learned the right one from three textbooks bought at Fry’s, and went on to invent most of the major breakthroughs in m…

Stratechery by Ben Thompson (A_full) 链接到标题

  • Vacation: Week of July 27
    • 发布时间:2026-07-27 18:00 北京时间
    • 摘要:- Stratechery 于 7 月 27 日这一周放假。
      • 不会有每周文章或更新。
      • 下一次更新将于 8 月 3 日星期一进行。
      • Sharp Tech 和 Greatest of All Talk 也将重新……。
    • EN 要点:
      • Stratechery is on vacation the week of July 27
      • There will be no Weekly Article or Updates
      • The next Update will be on Monday, August 3
      • Sharp Tech , and Greatest of All Talk   will also return the week of August 3

OpenAI Blog (A_full) 链接到标题

  • How AI is expanding what people do at work
    • 发布时间:2026-07-27 11:30 北京时间
    • 摘要:- 人工智能改变了人们所做的工作。
      • 对来自美国的超过 800,000 条消息进行分析
      • ChatGPT 用户,我们的新研究表明,16.8% 的工作相关消息和 43.5% 的职业特定消息与另一职业相关的任务有关。
      • 小企业主可以独立起草副本、审查合同或进行基本财务分析。
      • 销售人员可以使用人工智能来探索曾经交给分析师的客户数据集。
    • EN 要点:
      • New OpenAI research shows how AI is expanding what workers do, with ChatGPT users taking on tasks across roles and reshaping job boundaries.

ArXiv cs.AI (B_intro+search) 链接到标题

  • FlowEvo: Self-Evolving Agents through the Co-Evolution of Workflows and Executable Skills

    • 发布时间:2026-07-27 12:00 北京时间
    • 摘要:- arXiv:2607.21596v1 公告类型:新。
      • 摘要:大型语言模型代理越来越多地通过构建结合推理、工具使用和代码执行的推理时间工作流程来解决复杂的任务。
      • 虽然此类工作流程能够灵活解决问题,但在执行过程中发现的有用过程通常是暂时的:它们有助于解决当前任务,但不会以可以系统地有利于未来任务的形式保留。
      • 我们推出 FlowEvo,这是一个无需培训的框架,可将成功的跟踪编译成可重复使用的技能记录。
    • EN 要点:
      • arXiv:2607.21596v1 Announce Type: new
      • Abstract: Large language model agents increasingly solve complex tasks by constructing inference-time workflows that combine reasoning, tool use, and code execu…
      • While such workflows enable flexible problem solving, the useful procedures discovered during execution are often transient: they help solve the current task bu…
      • We present FlowEvo, a training-free framework that compiles successful traces into reusable skill records
  • Risk Is Not the Target: A Monotonic Framework for Evaluating Wildfire Operational Risk Signals

    • 发布时间:2026-07-27 12:00 北京时间
    • 摘要:- arXiv:2607.21597v1 公告类型:新。
      • 摘要:使用 F1 分数或 IoU 等标准机器学习指标评估野火风险系统存在根本缺陷:这些指标评估事件预测的准确性,而不是评估连续风险信号的操作一致性。
      • 这项工作提出了一种新颖的单调评估框架,用于衡量预测风险评分的增加是否始终对应于观察到的操作负载的增加,例如火灾数量、干预时间和部署的资源。
      • 此外,我们还比较了法国滨海阿尔卑斯省的三种结构不同的方法:基于专家的 DFE 指数、基于 GRU 的预测模型和 FARS(将预测人工智能与基于 LLM 的推理相结合的混合多智能体系统)。
    • EN 要点:
      • arXiv:2607.21597v1 Announce Type: new
      • Abstract: Evaluating wildfire risk systems using standard machine-learning metrics such as F1-score or IoU is fundamentally flawed: these metrics assess event p…
      • This work proposes a novel monotonic evaluation framework that measures whether increases in a predicted risk score consistently correspond to increases in obse…
      • Moreover, we compare three structurally different approaches on the French Alpes-Maritimes department: the expert-based DFE index, GRU- based predictive models,…
  • Securing Multimodal AI through Internal Information Decomposition

    • 发布时间:2026-07-27 12:00 北京时间
    • 摘要:- arXiv:2607.21600v1 公告类型:新。
      • 摘要:多模态大语言模型引入了单模态系统中不存在的攻击面:对手可以跨模态分发恶意意图以逃避单模态防护措施。
      • 这促使使用跨模式一致性作为检测信号,而不是单独检查每种模式。
      • 我们的主要观察结果是,良性输入会从纯文本推理和纯视觉推理中诱导出兼容的预测行为,这些行为在融合时会稳定下来,而对抗性操作会破坏这种一致性,从而导致异常的多模式行为。
    • EN 要点:
      • arXiv:2607.21600v1 Announce Type: new
      • Abstract: Multimodal large language models introduce attack surfaces absent in unimodal systems: adversaries can distribute malicious intent across modalities t…
      • This motivates using cross-modal consistency as a detection signal rather than inspecting each modality in isolation
      • Our key observation is that benign inputs induce compatible predictive behavior from text-only and vision-only reasoning that stabilizes when fused, whereas adv…
  • From Frame-Level Recognition to Event-Level Confirmation: Repair Traces and Runtime Failure Analysis of Public-Space Gesture Interaction

    • 发布时间:2026-07-27 12:00 北京时间
    • 摘要:- arXiv:2607.21601v1 公告类型:新。
      • 摘要:公共空间手势交互通常被评估为帧级识别问题,但部署的系统暴露了不同的故障边界。
      • 在景区亭、展厅、服务终端,用户体验的是一个有意的动作是否成为一个稳定的交互事件,而不是单个手标框是否正确。
      • 我们称之为认知与互动之间的差距。
    • EN 要点:
      • arXiv:2607.21601v1 Announce Type: new
      • Abstract: Public-space gesture interaction is often evaluated as a frame-level recognition problem, but deployed systems expose a different failure boundary
      • In scenic kiosks, exhibition halls, and service terminals, users experience whether an intended action becomes a stable interaction event, not whether individua…
      • We call this the recognition-to-interaction gap
  • Transferable Latency Prediction for Fast LLM Screening on Heterogeneous Edge Devices

    • 发布时间:2026-07-27 12:00 北京时间
    • 摘要:- arXiv:2607.21602v1 公告类型:新。
      • 摘要:准确的延迟预测对于在异构边缘设备上部署大型语言模型 (LLM) 至关重要,其中推理延迟受到模型架构、提示行为、运行时后端、硬件利用率、动态电压和频率缩放 (DVFS) 以及热变化的影响。
      • 本文提出了一种用于面向部署的 LLM 选择的运行时感知延迟预测框架。
      • 该框架将每个推理请求表示为硬件运行时模型提示配置,将推理分为预填充和解码阶段,并通过门控预测模型自适应地将静态描述符与动态硬件遥测融合。
    • EN 要点:
      • arXiv:2607.21602v1 Announce Type: new
      • Abstract: Accurate latency prediction is critical for deploying large language models (LLMs) on heterogeneous edge devices, where inference latency is affected…
      • This paper presents a runtime-aware latency prediction framework for deployment-oriented LLM selection
      • The framework represents each inference request as a hardware-runtime-model-prompt configuration, separates inference into prefill and decode phases, and adapti…
  • AgentKVShift: Efficient KV Cache Reuse for Agentic Memory Systems

    • 发布时间:2026-07-27 12:00 北京时间
    • 摘要:- arXiv:2607.21604v1 公告类型:新。
      • 摘要:记忆增强的 LLM 代理通过代理记忆系统维护数百次交互的上下文,该系统使用 LLM 生成的元数据(例如摘要、关键字和标签)主动管理检索到的内容。
      • 从推理成本的角度来看,每次检索都会触发将这些结构化内存单元完全重新编码为键值 (KV) 状态,这决定了预填充延迟。
      • 现有的免训练 KV 重用方法通过有选择地重新计算一小部分标记来缓解这一问题,但它们是为 RAG 风格的原始段落而设计的,并且会降低结构化代理记忆的性能。
    • EN 要点:
      • arXiv:2607.21604v1 Announce Type: new
      • Abstract: Memory-augmented LLM agents maintain context across hundreds of interactions through agentic memory systems that actively curate retrieved content wit…
      • From an inference cost standpoint, every retrieval triggers a full re-encoding of these structured memory units into Key-Value (KV) states, which dominates pref…
      • Existing training-free KV reuse methods mitigate this by selectively recomputing a small fraction of tokens, but were designed for RAG-style raw passages and de…
  • TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward

    • 发布时间:2026-07-27 12:00 北京时间
    • 摘要:- arXiv:2607.21606v1 公告类型:新。 -摘要:强大的文本到图像生成模型的最新进展使得开发测试时方法变得越来越重要,这些方法可以修改采样轨迹以生成更忠实于复杂构图提示的图像。
      • 我们提出了 TILT,这是一种无需训练的框架,用于通过测试时奖励对齐生成组合文本到图像。
      • 我们将组合失败解释为联合分布和单一概念分布之间的重叠模式,并定义有利于所有概念共同存在的样本的奖励。
    • EN 要点:
      • arXiv:2607.21606v1 Announce Type: new
      • Abstract: Recent advances in powerful text-to-image generation models have made it increasingly important to develop test-time methods that modify the sampling…
      • We present TILT, a training-free framework for compositional text-to-image generation via test-time reward alignment
      • We interpret compositional failures as overlap modes between joint and single-concept distributions, and define a reward that favors samples where all concepts…
  • Spectral Flow Certificates for Depth-Aware Long-Range Propagation in Graph Neural Networks

    • 发布时间:2026-07-27 12:00 北京时间
    • 摘要:- arXiv:2607.21607v1 公告类型:新。
      • 摘要:图神经网络通过本地消息传递来传播信息,但图拓扑本身可以默默地阻止任何数量的训练解决远程任务。
      • 当我们在新图上部署 GNN 时,在训练开始之前,目前没有廉价的方法可以知道图的结构是否允许信息在遥远的节点之间传输足够远的距离。
      • 我们通过提出谱流证书(SFC)来解决这一差距,这是在几秒钟内根据图的归一化拉普拉斯算子计算出的单个标量,不需要模型训练,也不需要标记数据。
    • EN 要点:
      • arXiv:2607.21607v1 Announce Type: new
      • Abstract: Graph Neural Networks propagate information through local message passing, but the graph topologies themselves can silently prevent any amount of trai…
      • When we deploy GNNs on new graphs, there is currently no inexpensive way to know, before training begins, whether the graphs’ structures will allow information…
      • We address this gap by proposing Spectral Flow Certificates (SFCs), single scalars computed from the graphs’ normalised Laplacians in seconds, requiring no mode…
  • Coupled Hierarchical Search over Topology and Execution for Agentic Workflow Synthesis

    • 发布时间:2026-07-27 12:00 北京时间
    • 摘要:- arXiv:2607.21609v1 公告类型:新。
      • 摘要:虽然结构化工作流程使大型语言模型 (LLM) 能够解决复杂的问题,但庞大的组合搜索空间严重阻碍了其创建的自动化,经常导致不灵活且占用大量资源的离线训练依赖性。
      • 为了解决这个问题,我们将工作流生成概念化为一种相互交织的拓扑和执行搜索范例,其中更广泛的拓扑层决定了子任务边界,而较低级别的执行结果则主动重塑拓扑本身。
      • 在此基础上,我们引入了 HierFlow,这是一种免训练、测试时的分层搜索架构,通过将反馈引导的拓扑调整与快速、受 MCTS 启发的树搜索相结合以实现子工作流程优化,从而实现代理工作流程设计的自动化。
    • EN 要点:
      • arXiv:2607.21609v1 Announce Type: new
      • Abstract: Although structured workflows empower Large Language Models (LLMs) to tackle complex problems, automating their creation is severely hindered by a vas…
      • To address this, we conceptualize workflow generation as an intertwined topology-and-execution search paradigm, where the broader topological layer dictates sub…
      • Building on this foundation, we introduce HierFlow, a training-free, test-time hierarchical search architecture that automates agentic workflow design by mergin…
  • SCOPE and SCION: A Benchmark and an Auditable Reference Pipeline for Schema Induction and Fusion from Text

    • 发布时间:2026-07-27 12:00 北京时间
    • 摘要:- arXiv:2607.21610v1 公告类型:新。 -摘要:模式图是基于模式的信息提取和知识图构建的上游瓶颈,但大多数提取系统都假设模式已经可用。
      • 我们引入了 SCOPE(模式构建和本体归纳管道评估),这是一个仅训练文本的基准,用于从原始文本进行语料库到模式的归纳和可选的模式融合,由 24 个公共信息提取源(15 个 RE 和 9 个 EE)构建而成,标准化为仅评估的黄金模式图;其核心事件提取目标涵盖事件类型和事件内参数角色,并单独报告事件间链接。
      • 我们提出了 SCION(带有本体规范化的模式构建和归纳),这是一个可审计的参考管道,而不是一个新的提取架构;它从训练文本构建候选空间,并在严格的 JSON 合约下将命名、合并、过滤、验证和保守融合限制为与候选相关的证据。
    • EN 要点:
      • arXiv:2607.21610v1 Announce Type: new
      • Abstract: Schema graphs are an upstream bottleneck of schema-grounded information extraction and knowledge graph construction, yet most extraction systems assum…
      • We introduce SCOPE (Schema Construction and Ontology-induction Pipeline Evaluation), a train-text-only benchmark for corpus-to-schema induction and optional sch…
      • We present SCION (Schema Construction and Induction with Ontology Normalization), an auditable reference pipeline rather than a new extraction architecture; it…

ArXiv cs.CL (B_intro+search) 链接到标题

  • Adversarial Style Optimization: Enhancing VLM Jailbreaks by GRPO-based Stylistic Triggers Optimization

    • 发布时间:2026-07-27 12:00 北京时间
    • 摘要:- arXiv:2607.21619v1 公告类型:新。
      • 摘要:多模态大型语言模型(MLLM)已经取得了令人印象深刻的性能,但其安全性仍然容易受到越狱攻击。
      • 现有的基于内容的越狱通常不一致,并且针对快速发展的 MLLM 表现出令人不满意的性能,无法利用非基于内容的漏洞。
      • 与之前的研究不同,我们凭经验发现 MLLM 的理解能力和安全能力之间表现出风格上的不一致:MLLM 可以稳健地理解内容,而不管视觉风格如何,但它们的防御机制可以很容易地被特定的风格触发因素绕过。
    • EN 要点:
      • arXiv:2607.21619v1 Announce Type: new
      • Abstract: Multimodal Large Language Models (MLLMs) have achieved impressive performance, but their safety alignment remains vulnerable to jailbreak attacks
      • Existing content-based jailbreaks are often inconsistent and show unsatisfying performance against the rapidly evolving MLLMs, failing to exploit non-content-ba…
      • Unlike previous research, we empirically find that MLLMs exhibit a Stylistic Inconsistency between their comprehension ability and safety ability: MLLMs can rob…
  • A Consensus-Based Framework for Relative Preference Evaluation of Large Language Models

    • 发布时间:2026-07-27 12:00 北京时间
    • 摘要:- arXiv:2607.21632v1 公告类型:新。
      • 摘要:法学硕士的传统基准主要依赖于静态数据集和客观评分指标,当多个答案可接受时,这些指标通常无法捕获响应质量的差异。
      • 在这种情况下,仅靠正确性不足以区分清晰度、完整性和有用性不同的响应。
      • 本文介绍了一种基于共识的评估框架,该框架衡量模型生成的响应之间的相对偏好,而不是绝对正确性。
    • EN 要点:
      • arXiv:2607.21632v1 Announce Type: new
      • Abstract: Traditional benchmarks for LLMs primarily rely on static datasets and objective scoring metrics, which often fail to capture differences in response q…
      • In such settings, correctness alone is insufficient to distinguish between responses that vary in clarity, completeness, and usefulness
      • This paper introduces a consensus-based evaluation framework that measures relative preference among model-generated responses rather than absolute correctness
  • Evaluation design conditions the expert-vs-auto MeSH gap: a controlled comparison of bag-of-words and BiomedBERT on the Cohen benchmark

    • 发布时间:2026-07-27 12:00 北京时间
    • 摘要:- arXiv:2607.21685v1 公告类型:新。
      • 摘要:系统回顾从阅读数千份摘要开始,以确定少数相关的摘要,然后使用分类器对阅读进行优先级排序。
      • 他们的输入通常会通过医学主题词 (MeSH) 进行增强,这些主题词要么由专家索引器在出版后数周或数月分配,要么由自动工具立即分配。
      • 据我们所知,这两者尚未作为分类器特征直接进行比较,并且之前的工作没有询问比较的结果是否取决于分类器的评估方式。
    • EN 要点:
      • arXiv:2607.21685v1 Announce Type: new
      • Abstract: A systematic review begins with someone reading thousands of abstracts to identify the few that are relevant, and classifiers are used to prioritise t…
      • Their inputs are often augmented with Medical Subject Headings (MeSH), assigned either by expert indexers weeks or months after publication or by automatic tool…
      • To our knowledge the two have not been compared directly as classifier features, and no previous work has asked whether that comparison’s outcome depends on how…
  • Humanly: A Configurable and Traceable Environment for Human-AI Collaborative Writing

    • 发布时间:2026-07-27 12:00 北京时间
    • 摘要:- arXiv:2607.21758v1 公告类型:新。
      • 摘要:教师、会议主席和公众读者都根据有限的证据来判断写作,只看到完成的文件,而不是生成它的过程。
      • 仅最终文本无法揭示文档是通过人类打字、人工智能生成还是人类与人工智能混合协作生成的。
      • 现有的流程跟踪工具有所帮助,但许多工具都与主机文档历史记录相关,提供粗略的活动记录,并对写入环境提供有限的控制。
    • EN 要点:
      • arXiv:2607.21758v1 Announce Type: new
      • Abstract: Teachers, conference chairs, and public readers all judge writing from limited evidence, seeing only a finished document and not the process that prod…
      • Final text alone cannot reveal whether a document was produced through human typing, AI generation, or mixed human-AI collaboration
      • Existing process-tracking tools help, but many are tied to host-document histories, provide coarse activity records, and offer limited control over the writing…
  • Probing Latent Colombian Identity Inferences in Qwen2.5-7B with Natural Language Autoencoders

    • 发布时间:2026-07-27 12:00 北京时间
    • 摘要:- arXiv:2607.21774v1 公告类型:新。
      • 摘要:大型语言模型可以从微妙的语言线索中推断出人口统计属性,即使这些属性没有明确说明。
      • 这项试点研究检验了 Qwen2.5-7B-Instruct 在处理哥伦比亚语-西班牙语和英语提示时是否在内部代表哥伦比亚身份、社会经济地位或刻板印象相关信息。
      • 我们使用自然语言自动编码器 (NLA) 来描述每个提示的四个位置四分位数中第 20 层的残余流激活。
    • EN 要点:
      • arXiv:2607.21774v1 Announce Type: new
      • Abstract: Large language models may infer demographic attributes from subtle linguistic cues even when those attributes are not explicitly stated
      • This pilot study examines whether Qwen2.5-7B-Instruct internally represents Colombian identity, socioeconomic status, or stereotype-related information when pro…
      • We use Natural Language Autoencoders (NLA) to verbalize residual-stream activations from layer 20 across four positional quartiles per prompt
  • Khondo: A Multimodal Benchmark for Document Packet Splitting of Bangla Forms

    • 发布时间:2026-07-27 12:00 北京时间
    • 摘要:- arXiv:2607.21780v1 公告类型:新。
      • 摘要:文档包,即多个文档连接成一个文件,在政府和行政工作流程中很常见,但将它们拆分成组成文档很困难,特别是对于资源匮乏的语言。
      • 我们引入 Khondo(孟加拉语,拆分/分段的意思),这是孟加拉国政府表格上文档包拆分的第一个基准。
      • 与之前的英语和基于 OCR 文本的数据集不同,Khondo 是双语(孟加拉语 - 英语)和视觉原生的;其中模型直接在页面图像上运行。
    • EN 要点:
      • arXiv:2607.21780v1 Announce Type: new
      • Abstract: Document packets, multiple documents concatenated into a single file, are common in government and administrative workflows, yet splitting them into t…
      • We introduce Khondo (Bangla for split/segment), the first benchmark for document packet splitting on Bangladeshi government forms
      • Unlike prior English and OCR-text-based datasets, Khondo is bilingual (Bangla–English) and vision-native; where models operate directly on page images
  • Agentic Evaluation of Copyright Law Compliance

    • 发布时间:2026-07-27 12:00 北京时间
    • 摘要:- arXiv:2607.21799v1 公告类型:新。
      • 摘要:大型语言模型 (LLM) 代理越来越多地执行商业任务,这些任务涉及检索图像等外部内容,并在适当的情况下复制该内容。
      • 法学硕士代理人应遵守法律,包括版权法。
      • 然而,目前我们缺乏足够的框架来评估它们是否在实践中这样做。
    • EN 要点:
      • arXiv:2607.21799v1 Announce Type: new
      • Abstract: Large language model (LLM) agents increasingly perform commercial tasks that involve retrieving external content such as images and, where appropriate…
      • LLM agents should comply with the law, including copyright law
      • Presently, however, we lack adequate frameworks to assess whether they do so in practice
  • Data Quality over Capacity: Internalizing Documents into LoRA Adapters for Closed-Book QA

    • 发布时间:2026-07-27 12:00 北京时间
    • 摘要:- arXiv:2607.21861v1 公告类型:新。
      • 摘要:我们研究通过 LoRA 将文档直接烘焙为 4 位 Gemma-4-e4b 模型的权重,因此系统可以回答有关语料库闭卷的问题:无需检索,也无需上下文窗口预算。
      • 在从单个文档到 99 个文档的语料库的大约 100 次训练中,我们发现一旦适配器容量足够,训练数据质量就成为闭卷准确性的主导杠杆,超过 LoRA 排名、学习率和两种替代架构的总和;容量本身就是一扇硬门,低于此门,任何数据干预都无济于事。
      • 一次管理通行证(缩短规范 1-6 个单词跨度的黄金答案并删除琐事)将 15 个文档语料库的闭卷准确率从 57.7% 提高到 85.7%,比任何架构变化都要大。
    • EN 要点:
      • arXiv:2607.21861v1 Announce Type: new
      • Abstract: We study baking documents directly into the weights of a 4-bit Gemma-4-e4b model via LoRA, so a system can answer questions about a corpus closed-book…
      • Across roughly 100 training runs from single documents to a 99-document corpus, we find that once adapter capacity is adequate, training-data quality is the dom…
      • A single curation pass (shortening gold answers to canonical 1-6 word spans and dropping trivia) moved closed-book accuracy from 57.7% to 85.7% on a 15-document…
  • Leveraging External Knowledge for Historical Document Restoration via Retrieval-Augmented Large Language Models

    • 发布时间:2026-07-27 12:00 北京时间
    • 摘要:- arXiv:2607.21936v1 公告类型:新。
      • 摘要:历史文献是无价的知识档案,但往往由于物理老化和损坏而难以辨认。
      • 虽然基于掩码语言建模的现有恢复方法有效地利用了本地上下文,但它们难以恢复需要外部历史知识的命名实体。
      • 为了解决这一限制,我们引入了一种新颖的历史文档恢复框架,该框架利用具有检索增强生成(RAG)的大型语言模型。
    • EN 要点:
      • arXiv:2607.21936v1 Announce Type: new
      • Abstract: Historical documents act as invaluable knowledge archives but often suffer from illegibility due to physical deterioration and damage
      • While existing restoration methods based on masked language modeling effectively utilize local context, they struggle to restore named entities that require ext…
      • To address this limitation, we introduce a novel framework for historical document restoration that leverages large language models with retrieval-augmented gen…
  • On Improving Faithfulness of Podcasts from Documents

    • 发布时间:2026-07-27 12:00 北京时间
    • 摘要:- arXiv:2607.21961v1 公告类型:新。
      • 摘要:大型语言模型 (LLM) 越来越多地用于生成长篇对话内容,例如从文本源生成播客。
      • 虽然这些系统产生流畅且引人入胜的叙述,但它们经常引入无根据的信息。
      • 在这项工作中,我们首次对基于文档的播客生成的忠实度进行了系统研究,其中必须在长格式、多发言者转录的对话轮流中保持基础。
    • EN 要点:
      • arXiv:2607.21961v1 Announce Type: new
      • Abstract: Large language models (LLMs) are increasingly used to generate long-form conversational content such as podcasts from textual sources
      • While these systems produce fluent and engaging narratives, they often introduce ungrounded information
      • In this work, we present the first systematic study of faithfulness in document-grounded podcast generation, where grounding must be maintained across conversat…

ArXiv cs.LG (B_intro+search) 链接到标题

  • Cloud-Native Evaluation-as-a-Service: A Microservices Architecture for Scalable AI Monitoring with Conformal Guarantees

    • 发布时间:2026-07-27 12:00 北京时间
    • 摘要:- arXiv:2607.21623v1 公告类型:新。
      • 摘要:我们提出了 EaaS,一种云原生参考架构,它将 AI 评估方法操作为六种无状态 Kubernetes 微服务:使用有限样本校正自适应预测集的保形预测、校准评估、通过 RFF 近似最大平均差异进行漂移检测、使用引导程序置信区间进行公平性监控、基于 DAG 的管道编排器以及结果存储 API。
      • 我们验证了四个关键的方法论问题。
      • 首先,经验覆盖率与 K=50 随机校准/测试分割的边际保形保证一致,平均覆盖率在标称目标的 1.4 个百分点以内。
    • EN 要点:
      • arXiv:2607.21623v1 Announce Type: new
      • Abstract: We present EaaS, a cloud-native reference architecture that operationalizes AI evaluation methods as six stateless Kubernetes microservices: conformal…
      • We validate four key methodological concerns
      • First, empirical coverage is consistent with the marginal conformal guarantee across K=50 random calibration/test splits, with mean coverage within 1.4 percenta…
  • On the Depth Scalability of Logic Gate Networks

    • 发布时间:2026-07-27 12:00 北京时间
    • 摘要:- arXiv:2607.21633v1 公告类型:新。
      • 摘要:逻辑门网络(LGN)通过布尔运算的组合来实现计算,但与经典布尔电路不同,现有的 LGN 并不能可靠地从增加的深度中受益。
      • 我们确定了两个不同的原因:深度松弛 LGN 中的优化崩溃,以及拓扑引起的限制,即使在跳过偏置初始化和直通估计稳定训练时,该限制仍然存在。
      • 因此,仅可训练性是不够的;更深的层还必须接收支持有用计算的信息。
    • EN 要点:
      • arXiv:2607.21633v1 Announce Type: new
      • Abstract: Logic Gate Networks (LGNs) implement computation through compositions of Boolean operations, yet unlike classical Boolean circuits, existing LGNs do n…
      • We identify two distinct causes: optimization collapse in deep relaxed LGNs and a topology-induced limitation that persists even when skip-biased initialization…
      • Thus, trainability alone is insufficient; deeper layers must also receive information that supports useful computation
  • MotifRole-Diff: Risk-Optimal Role-Aware Corruption for Masked Molecular Graph Diffusion

    • 发布时间:2026-07-27 12:00 北京时间
    • 摘要:- arXiv:2607.21634v1 公告类型:新。 -摘要:用于分子图生成的掩码离散扩散通常对无损图到序列表示中的所有标记应用统一的损坏计划,隐式地将结构异质分子组件视为重建同样困难且同样重要。
      • 然而,不同的分子图令牌角色在去噪难度及其对解码分子的影响方面表现出很大的差异,从而激发了特定于角色的腐败策略。
      • 我们引入了 MotifRole-Diff,这是一种角色感知的损坏过程,它根据经验测量的去噪难度和图级扰动影响来分配掩蔽率,同时保留模型架构、干净的序列空间和无损分子图解码器。
    • EN 要点:
      • arXiv:2607.21634v1 Announce Type: new
      • Abstract: Masked discrete diffusion for molecular graph generation typically applies a uniform corruption schedule to all tokens in a lossless graph-to-sequence…
      • However, different molecular graph token roles exhibit substantial variation in denoising difficulty and their influence on the decoded molecule, motivating rol…
      • We introduce MotifRole-Diff, a role-aware corruption process that allocates masking rates according to empirically measured denoising difficulty and graph-level…
  • Toward User-Conditioned Evaluation of Personal LLM Agents under Temporal Interventions

    • 发布时间:2026-07-27 12:00 北京时间
    • 摘要:- arXiv:2607.21635v1 公告类型:新。
      • 摘要:个人代理维护随每个用户一起发展的记忆、学到的技能、工具配置和策略状态。
      • 现有的代理基准测试通常单独评估这些功能:工具基准测试固定 API 下的调用,内存基准测试测试回忆或遗忘,安全基准测试测试静态策略合规性。
      • 我们认为个人代理评估需要不同的协议:在不同的持久用户条件状态下重放相同的时间干预,并测量故障如何在代理组件之间传播。
    • EN 要点:
      • arXiv:2607.21635v1 Announce Type: new
      • Abstract: Personal agents maintain memories, learned skills, tool configurations, and policy state that evolve with each user
      • Existing agent benchmarks often evaluate these capabilities in isolation: tool benchmarks test invocation under fixed APIs, memory benchmarks test recall or for…
      • We argue that personal-agent evaluation requires a different protocol: replaying the same temporal intervention across different persistent user-conditioned sta…
  • Measuring the Dependency Gap: Diagnosing Inter-Column Fidelity in Tabular Generative Models

    • 发布时间:2026-07-27 12:00 北京时间
    • 摘要:- arXiv:2607.21636v1 公告类型:新。 -摘要:合成表格数据的价值不仅在于保留每列的边际分布,还在于保留列之间的依赖关系,这种结构在欺诈和临床风险等不平衡领域中为少数类别携带了许多判别信号。
      • 然而,我们表明,最常用于证明合成表格数据的指标在很大程度上对列间依赖性视而不见:独立建模每列(因此破坏所有依赖性)的基线被逻辑回归 C2ST 判断为与真实数据无法区分,并且成对趋势得分仅部分敏感。
      • 我们引入了一种依赖性感知保真度诊断,它将强分类器双样本测试 (XGB-C2ST) 分解为边际、依赖性和数字分类交叉分量,锚定在最坏情况的完全因子化参考(所有依赖性都被破坏)和最佳情况的真实数据预言之间。
    • EN 要点:
      • arXiv:2607.21636v1 Announce Type: new
      • Abstract: Synthetic tabular data is valued for preserving not only each column’s marginal distribution but the dependencies between columns – structure that ca…
      • Yet the metrics most commonly used to certify synthetic tabular data are, we show, largely blind to inter-column dependency: a baseline that models every column…
      • We introduce a dependency-aware fidelity diagnostic that decomposes a strong classifier two-sample test (XGB-C2ST) into marginal, dependency, and numerical-cate…
  • Quasi-Monte Carlo Initialization for Meta-Reinforcement Learning

    • 发布时间:2026-07-27 12:00 北京时间
    • 摘要:- arXiv:2607.21637v1 公告类型:新。
      • 摘要:本文探讨了现代基准环境中元强化学习的准蒙特卡罗(QMC)权重初始化的功效。
      • 使用各种抽样方法来限制基于群体的搜索,并从一组基线任务中聚合最佳先验。
      • 当外推到类似的看不见的连续控制环境时,与现代正交 (SB3) 默认值相比,QMC 元先验显示了训练收敛性的改进。
    • EN 要点:
      • arXiv:2607.21637v1 Announce Type: new
      • Abstract: This paper explores the efficacy of quasi-Monte Carlo (QMC) weight initialization for meta-reinforcement learning within modern benchmark environments
      • Various sampling methods are used to bound a population-based search and aggregate an optimal prior from a baseline set of tasks
      • The QMC meta-priors show improvements in training convergence compared to modern orthogonal (SB3) defaults when extrapolated to similar unseen continuous contro…
  • Toward Goal-Agnostic Joint-Embedding Predictive Control of Partial Differential Equations

    • 发布时间:2026-07-27 12:00 北京时间
    • 摘要:- arXiv:2607.21644v1 公告类型:新。 -摘要:我们提出了一个围绕联合嵌入预测架构(JEPA)构建的偏微分方程(PDE)的目标无关控制框架。
      • 小型 2D ViT 编码器和动作条件潜在动力学在没有奖励或下游目标的情况下进行离线训练,冻结并由模型预测路径积分 (MPPI) 控制器重复使用。
      • 我们发现,如果可用,控制目标更适合应用于显式物理可观察量(提供单射性),而不是最小化学习的潜在空间中的原始欧几里德距离($L^2$)。
    • EN 要点:
      • arXiv:2607.21644v1 Announce Type: new
      • Abstract: We present a goal-agnostic control framework for partial differential equations (PDEs) built around a joint-embedding predictive architecture (JEPA)
      • The small 2D ViT encoder and action-conditioned latent dynamics are trained offline without a reward or downstream goal, frozen, and reused by a model-predictiv…
      • We find that when available, the control objective is better applied to an explicit physical observable (provided injectivity) than to minimizing raw Euclidean…
  • Multi-Horizon Consistency as Geometry: When Latent Dynamics Contract, and When They Do Not

    • 发布时间:2026-07-27 12:00 北京时间
    • 摘要:- arXiv:2607.21645v1 公告类型:新。
      • 摘要:多水平潜在一致性是视频预测器和世界模型中常见的训练旋钮,但从业者很少知道它对过渡几何有何作用。
      • 我们将 lambda(多步潜在一致性的权重)视为诊断控制,并测量经验扩展代理 L20,q95 以及 Horizo​​n-20 预测误差 E20。
      • 在 Moving-MNIST(关键对上的 n=6 个种子)上,将 lambda 从 0 提高到 0.8,将 L20 从 4.96 +/- 2.01 削减到 1.01 +/- 0.06(配对 t p=0.005,Wilcoxon p=0.031)并将 E20 减半(0.365 到 0.177,配对 t p=1.1e-13)。
    • EN 要点:
      • arXiv:2607.21645v1 Announce Type: new
      • Abstract: Multi-horizon latent consistency is a common training knob in video predictors and world models, but practitioners rarely know what it does to transit…
      • We treat lambda, the weight on multi-step latent agreement, as a diagnostic control and measure an empirical expansion proxy L20,q95 together with horizon-20 pr…
      • On Moving-MNIST (n=6 seeds at the critical pair), raising lambda from 0 to 0.8 cuts L20 from 4.96 +/- 2.01 to 1.01 +/- 0.06 (paired t p=0.005, Wilcoxon p=0.031)…
  • Adjustment Speed as a Safety Constraint for Nonstationary Reinforcement Learning

    • 发布时间:2026-07-27 12:00 北京时间
    • 摘要:- arXiv:2607.21646v1 公告类型:新。 -摘要:确保非平稳条件下强化学习的安全性需要确定学习系统是否能够在所需的恢复范围内安全地适应预测的环境变化。
      • 现有的安全强化学习方法通​​常假设固定环境,并且没有明确将适应速度视为安全问题。
      • 然而,当环境随着时间的推移而变化时,延迟适应可能会导致短暂的不安全行为。
    • EN 要点:
      • arXiv:2607.21646v1 Announce Type: new
      • Abstract: Ensuring safety in reinforcement learning under nonstationarity requires determining whether a learning system can safely adapt to forecasted environm…
      • Existing safe reinforcement learning methods typically assume stationary environments and do not explicitly consider adaptation speed as a safety concern
      • However, when environments evolve over time, delayed adaptation may result in transient unsafe behavior
  • A Drift Stable Quantum Federated Learning for Intelligent Services

    • 发布时间:2026-07-27 12:00 北京时间
    • 摘要:- arXiv:2607.21647v1 公告类型:新。
      • 摘要:量子联邦学习使分布式客户端能够在不共享本地数据的情况下训练量子神经网络,使其有望成为隐私感知智能服务。
      • 此上下文中的智能服务是指对隐私敏感的分布式决策系统,例如欺诈检测和基因组分类,其中可靠且公平的客户端级学习与聚合模型的准确性同样重要。
      • 然而,异构客户端数据和嘈杂的量子优化通常会导致不稳定的本地更新、客户端漂移以及客户端之间的性能不公平。
    • EN 要点:
      • arXiv:2607.21647v1 Announce Type: new
      • Abstract: Quantum federated learning enables distributed clients to train quantum neural networks without sharing local data, making it promising for privacy-aw…
      • Intelligent services in this context refer to privacy-sensitive distributed decision systems, such as fraud detection and genomic classification, where reliable…
      • However, heterogeneous client data and noisy quantum optimization often cause unstable local updates, client drift, and unfair performance between clients