{
  "title": "2026-07-09 AI日更 | 从国家安全到编码评测：AI 落地开始要求可问责、可复核",
  "url": "https://miaok.ong/ai-daily/ai-daily-2026-07-09/",
  "date": "2026-07-09T07:00:00+08:00",
  "lastmod": "2026-07-09T07:00:00+08:00",
  "type": "ai-daily",
  "kind": "page",
  "language": "zh",
  "description": "今天的主线不是单纯模型竞速，而是 AI 进入更高风险场景后的治理与验证。OpenAI 明确政府和国家安全合作原则，编码评测、研究审计和论文生成也转向去噪与可追溯。与此同时，垂直智能体继续深入 CAD、长篇记忆和检索工作流，专业落地更依赖结构化知识、低延迟执行与长期维护能力。",
  "keywords": null,
  "tags": [],
  "categories": [],
  "author": "孔淼",
  "image": "https://miaok.ong/images/avatar.jpg",
  "content": "\u003ch1 id=\"2026-07-09-ai日更--从国家安全到编码评测ai-落地开始要求可问责可复核\"\u003e\n  2026-07-09 AI日更 | 从国家安全到编码评测：AI 落地开始要求可问责、可复核\n  \u003ca class=\"heading-link\" href=\"#2026-07-09-ai%e6%97%a5%e6%9b%b4--%e4%bb%8e%e5%9b%bd%e5%ae%b6%e5%ae%89%e5%85%a8%e5%88%b0%e7%bc%96%e7%a0%81%e8%af%84%e6%b5%8bai-%e8%90%bd%e5%9c%b0%e5%bc%80%e5%a7%8b%e8%a6%81%e6%b1%82%e5%8f%af%e9%97%ae%e8%b4%a3%e5%8f%af%e5%a4%8d%e6%a0%b8\"\u003e\n    \u003ci class=\"fa-solid fa-link\" aria-hidden=\"true\" title=\"链接到标题\"\u003e\u003c/i\u003e\n    \u003cspan class=\"sr-only\"\u003e链接到标题\u003c/span\u003e\n  \u003c/a\u003e\n\u003c/h1\u003e\n\u003cblockquote\u003e\n\u003cp\u003e今天的主线不是单纯模型竞速，而是 AI 进入更高风险场景后的治理与验证。OpenAI 明确政府和国家安全合作原则，编码评测、研究审计和论文生成也转向去噪与可追溯。与此同时，垂直智能体继续深入 CAD、长篇记忆和检索工作流，专业落地更依赖结构化知识、低延迟执行与长期维护能力。\u003c/p\u003e\n\u003c/blockquote\u003e\n\u003ch2 id=\"-本期-watch-list-深度导读\"\u003e\n  📖 本期 Watch List 深度导读\n  \u003ca class=\"heading-link\" href=\"#-%e6%9c%ac%e6%9c%9f-watch-list-%e6%b7%b1%e5%ba%a6%e5%af%bc%e8%af%bb\"\u003e\n    \u003ci class=\"fa-solid fa-link\" aria-hidden=\"true\" title=\"链接到标题\"\u003e\u003c/i\u003e\n    \u003cspan class=\"sr-only\"\u003e链接到标题\u003c/span\u003e\n  \u003c/a\u003e\n\u003c/h2\u003e\n\u003cp\u003e今天最值得先读的是 AI 进入高风险公共部门后的治理边界：OpenAI 关于政府与国家安全合作的文章，明确把网络防御、生物安全、公共服务放在民主社会可用 AI 的框架下讨论；同时 K–12 教师 AI 技能项目，显示“公共基础设施化”的另一面。\u003c/p\u003e\n\u003cp\u003e技术侧建议关注“可验证的智能体”。从 coding eval 去噪、FirstResearch 的研究问题证书，到 Prompt-to-Paper 对文献、实验和论文质量的审计，核心都是让模型产出不只像真的，而是可追溯、可复核。\u003c/p\u003e\n\u003cp\u003e应用层则出现一组很扎实的垂直智能体论文：CAD 生成、工业级 CAD Agent、长篇叙事记忆、循环内检索与 MemAttention，都在回答同一个问题——智能体要真正进入专业工作流，记忆、结构化知识和低延迟执行将比单次生成能力更关键。\u003c/p\u003e\n\u003ch2 id=\"-x-平台-ai-热点快讯\"\u003e\n  🌐 X 平台 AI 热点快讯\n  \u003ca class=\"heading-link\" href=\"#-x-%e5%b9%b3%e5%8f%b0-ai-%e7%83%ad%e7%82%b9%e5%bf%ab%e8%ae%af\"\u003e\n    \u003ci class=\"fa-solid fa-link\" aria-hidden=\"true\" title=\"链接到标题\"\u003e\u003c/i\u003e\n    \u003cspan class=\"sr-only\"\u003e链接到标题\u003c/span\u003e\n  \u003c/a\u003e\n\u003c/h2\u003e\n\u003ch3 id=\"话题-1anthropic-extends-claude-fable-5-access-through-july-12\"\u003e\n  话题 1:Anthropic Extends Claude Fable 5 Access Through July 12\n  \u003ca class=\"heading-link\" href=\"#%e8%af%9d%e9%a2%98-1anthropic-extends-claude-fable-5-access-through-july-12\"\u003e\n    \u003ci class=\"fa-solid fa-link\" aria-hidden=\"true\" title=\"链接到标题\"\u003e\u003c/i\u003e\n    \u003cspan class=\"sr-only\"\u003e链接到标题\u003c/span\u003e\n  \u003c/a\u003e\n\u003c/h3\u003e\n\u003cul\u003e\n\u003cli\u003e分类:AI · News\u003c/li\u003e\n\u003cli\u003e概况:热度时间:1 day ago,相关帖子数:65000\u003c/li\u003e\n\u003cli\u003e是什么事:Anthropic 将 Claude Fable 5 在所有付费计划中的访问期限延长至 7 月 12 日。\u003c/li\u003e\n\u003cli\u003e为什么重要:这表明前沿大模型的发布与商业化仍受算力、成本、出口管制和产品分层策略影响，也反映用户对长上下文、代码和智能体任务能力的强需求。\u003c/li\u003e\n\u003cli\u003e讨论概况:X 上讨论主要集中在延长期是否足够、Fable 5 的能力是否显著优于旧版 Claude、按量计费是否过高，以及 Anthropic 是否能在容量限制和用户期待之间取得平衡。\u003c/li\u003e\n\u003c/ul\u003e\n\u003ch3 id=\"话题-2openai-launches-gpt-56-models-sol-terra-and-luna-after-government-clearance\"\u003e\n  话题 2:OpenAI Launches GPT-5.6 Models Sol, Terra, and Luna After Government Clearance\n  \u003ca class=\"heading-link\" href=\"#%e8%af%9d%e9%a2%98-2openai-launches-gpt-56-models-sol-terra-and-luna-after-government-clearance\"\u003e\n    \u003ci class=\"fa-solid fa-link\" aria-hidden=\"true\" title=\"链接到标题\"\u003e\u003c/i\u003e\n    \u003cspan class=\"sr-only\"\u003e链接到标题\u003c/span\u003e\n  \u003c/a\u003e\n\u003c/h3\u003e\n\u003cul\u003e\n\u003cli\u003e分类:AI · News\u003c/li\u003e\n\u003cli\u003e概况:热度时间:1 day ago,相关帖子数:46000\u003c/li\u003e\n\u003cli\u003e是什么事:据 X 平台热议消息，OpenAI 在获得美国政府放行后，准备公开发布 GPT-5.6 系列模型 Sol、Terra 和 Luna。\u003c/li\u003e\n\u003cli\u003e为什么重要:这被视为前沿 AI 发布进入更强监管阶段的标志，显示高能力模型在编码、生物和网络安全等敏感领域的进展，可能同时影响开发者生态、商业成本和政府审查机制。\u003c/li\u003e\n\u003cli\u003e讨论概况:讨论焦点集中在 GPT-5.6 的实际能力是否显著领先、政府预审是否会成为行业常态、国家安全审查是否会拖慢创新，以及低成本版本 Terra、Luna 能否扩大企业和开发者采用。\u003c/li\u003e\n\u003c/ul\u003e\n\u003ch3 id=\"话题-3anthropic-shares-cost-saving-claude-fable-5-agent-tips\"\u003e\n  话题 3:Anthropic Shares Cost-Saving Claude Fable 5 Agent Tips\n  \u003ca class=\"heading-link\" href=\"#%e8%af%9d%e9%a2%98-3anthropic-shares-cost-saving-claude-fable-5-agent-tips\"\u003e\n    \u003ci class=\"fa-solid fa-link\" aria-hidden=\"true\" title=\"链接到标题\"\u003e\u003c/i\u003e\n    \u003cspan class=\"sr-only\"\u003e链接到标题\u003c/span\u003e\n  \u003c/a\u003e\n\u003c/h3\u003e\n\u003cul\u003e\n\u003cli\u003e分类:AI · News\u003c/li\u003e\n\u003cli\u003e概况:热度时间:1 day ago,相关帖子数:9700\u003c/li\u003e\n\u003cli\u003e是什么事:Anthropic 分享了使用 Claude Fable 5 构建 AI Agent 时降低推理与运行成本的实践建议。\u003c/li\u003e\n\u003cli\u003e为什么重要:Agent 应用通常涉及多轮调用、工具使用和长上下文处理，成本控制直接影响其规模化部署、商业化可行性和开发者采用意愿。\u003c/li\u003e\n\u003cli\u003e讨论概况:X 上讨论集中在这些优化技巧能否在真实场景中显著降本，是否会牺牲模型效果、稳定性或开发体验，以及 Anthropic 在 Agent 生态中相较 OpenAI、Google 等竞争对手是否具备持续优势。\u003c/li\u003e\n\u003c/ul\u003e\n\u003ch3 id=\"话题-4xai-rebrands-as-spacexai-after-spacex-acquisition\"\u003e\n  话题 4:xAI Rebrands as SpaceXAI After SpaceX Acquisition\n  \u003ca class=\"heading-link\" href=\"#%e8%af%9d%e9%a2%98-4xai-rebrands-as-spacexai-after-spacex-acquisition\"\u003e\n    \u003ci class=\"fa-solid fa-link\" aria-hidden=\"true\" title=\"链接到标题\"\u003e\u003c/i\u003e\n    \u003cspan class=\"sr-only\"\u003e链接到标题\u003c/span\u003e\n  \u003c/a\u003e\n\u003c/h3\u003e\n\u003cul\u003e\n\u003cli\u003e分类:AI · News\u003c/li\u003e\n\u003cli\u003e概况:热度时间:2 days ago,相关帖子数:33000\u003c/li\u003e\n\u003cli\u003e是什么事:X 平台热议称，SpaceX 收购 xAI 后将其更名为“SpaceXAI”。\u003c/li\u003e\n\u003cli\u003e为什么重要:如果属实，这意味着马斯克旗下航天、算力与 AI 业务可能进一步整合，影响大模型训练资源、商业化路径及 AI 在航天等场景的应用布局。\u003c/li\u003e\n\u003cli\u003e讨论概况:讨论焦点集中在消息真实性、品牌整合是否合理、SpaceX 数据与算力能否强化 xAI，以及此举是否会加剧马斯克旗下公司之间的资源集中和监管担忧。\u003c/li\u003e\n\u003c/ul\u003e\n\u003ch3 id=\"话题-5google-ai-studio-adds-one-click-github-import-for-faster-app-building\"\u003e\n  话题 5:Google AI Studio Adds One-Click GitHub Import for Faster App Building\n  \u003ca class=\"heading-link\" href=\"#%e8%af%9d%e9%a2%98-5google-ai-studio-adds-one-click-github-import-for-faster-app-building\"\u003e\n    \u003ci class=\"fa-solid fa-link\" aria-hidden=\"true\" title=\"链接到标题\"\u003e\u003c/i\u003e\n    \u003cspan class=\"sr-only\"\u003e链接到标题\u003c/span\u003e\n  \u003c/a\u003e\n\u003c/h3\u003e\n\u003cul\u003e\n\u003cli\u003e分类:AI · News\u003c/li\u003e\n\u003cli\u003e概况:热度时间:6 hours ago,相关帖子数:357\u003c/li\u003e\n\u003cli\u003e是什么事:Google AI Studio 新增一键导入 GitHub 仓库功能，帮助开发者更快将现有代码接入 AI 辅助开发流程并构建应用。\u003c/li\u003e\n\u003cli\u003e为什么重要:这一功能降低了从代码仓库到 AI 原型开发的门槛，强化了 AI 编程工具与真实开发工作流的结合，可能提升应用迭代速度并加剧 AI 编程平台竞争。\u003c/li\u003e\n\u003cli\u003e讨论概况:X 上的讨论主要集中在该功能是否会推动“vibe coding”普及、对初学者和独立开发者是否真正有用，以及 Google AI Studio 与 Cursor、Replit、GitHub Copilot 等工具相比的优势和局限。\u003c/li\u003e\n\u003c/ul\u003e\n\u003ch3 id=\"话题-6teslas-2025-impact-report-details-cybercab-and-emission-wins\"\u003e\n  话题 6:Tesla\u0026rsquo;s 2025 Impact Report Details Cybercab and Emission Wins\n  \u003ca class=\"heading-link\" href=\"#%e8%af%9d%e9%a2%98-6teslas-2025-impact-report-details-cybercab-and-emission-wins\"\u003e\n    \u003ci class=\"fa-solid fa-link\" aria-hidden=\"true\" title=\"链接到标题\"\u003e\u003c/i\u003e\n    \u003cspan class=\"sr-only\"\u003e链接到标题\u003c/span\u003e\n  \u003c/a\u003e\n\u003c/h3\u003e\n\u003cul\u003e\n\u003cli\u003e分类:AI · News\u003c/li\u003e\n\u003cli\u003e概况:热度时间:2 days ago,相关帖子数:19000\u003c/li\u003e\n\u003cli\u003e是什么事:特斯拉发布2025年《影响力报告》，披露Cybercab进展及其电动车、能源产品带来的减排成果。\u003c/li\u003e\n\u003cli\u003e为什么重要:Cybercab代表特斯拉在自动驾驶与机器人出租车商业化上的关键布局，其进展将影响AI在交通出行场景中的规模化落地与监管讨论。\u003c/li\u003e\n\u003cli\u003e讨论概况:X上的讨论集中在特斯拉减排数据的可信度、Cybercab量产与自动驾驶能力是否能按期兑现，以及其环保叙事能否抵消外界对安全、监管和商业模式风险的质疑。\u003c/li\u003e\n\u003c/ul\u003e\n\u003ch4 id=\"今日-x-上的-ai-舆情小结\"\u003e\n  今日 X 上的 AI 舆情小结\n  \u003ca class=\"heading-link\" href=\"#%e4%bb%8a%e6%97%a5-x-%e4%b8%8a%e7%9a%84-ai-%e8%88%86%e6%83%85%e5%b0%8f%e7%bb%93\"\u003e\n    \u003ci class=\"fa-solid fa-link\" aria-hidden=\"true\" title=\"链接到标题\"\u003e\u003c/i\u003e\n    \u003cspan class=\"sr-only\"\u003e链接到标题\u003c/span\u003e\n  \u003c/a\u003e\n\u003c/h4\u003e\n\u003cp\u003e今天 AI 舆论主线集中在前沿模型发布、成本可控性和 AI 落地场景竞争上：无论是 Claude Fable 5 延长访问、GPT-5.6 传闻发布，还是 Google AI Studio 接入 GitHub，都反映出用户和开发者对更强模型、更低门槛、更便宜 Agent 工作流的共同需求。较明显的共识是，长上下文、代码能力、智能体和真实开发流程整合正在成为大模型商业化的核心战场，而成本、容量和产品分层将直接决定采用速度。分歧则主要在于这些新模型或新功能是否真的带来代际跃迁，政府预审是否必要，马斯克系 AI 与航天/汽车资源整合是否可信且合理，以及特斯拉 Cybercab 等实体 AI 应用能否按承诺兑现。潜在风险包括高能力模型受到更严格国家安全审查、算力与资源进一步向少数巨头集中、Agent 大规模运行成本失控，以及自动驾驶、网络安全、生物安全等高风险场景中商业叙事快于监管和安全验证。\u003c/p\u003e\n\u003ch2 id=\"-大佬观点influencer-insights\"\u003e\n  💡 大佬观点(Influencer Insights)\n  \u003ca class=\"heading-link\" href=\"#-%e5%a4%a7%e4%bd%ac%e8%a7%82%e7%82%b9influencer-insights\"\u003e\n    \u003ci class=\"fa-solid fa-link\" aria-hidden=\"true\" title=\"链接到标题\"\u003e\u003c/i\u003e\n    \u003cspan class=\"sr-only\"\u003e链接到标题\u003c/span\u003e\n  \u003c/a\u003e\n\u003c/h2\u003e\n\u003cp\u003e好的，各位，以下是基于过去 24 小时 AI 领域关键意见领袖（KOL）的推文，为您整理的行业情报分析。\u003c/p\u003e\n\u003chr\u003e\n\u003ch3 id=\"1-今日核心技术与产品热点\"\u003e\n  1. 今日核心技术与产品热点\n  \u003ca class=\"heading-link\" href=\"#1-%e4%bb%8a%e6%97%a5%e6%a0%b8%e5%bf%83%e6%8a%80%e6%9c%af%e4%b8%8e%e4%ba%a7%e5%93%81%e7%83%ad%e7%82%b9\"\u003e\n    \u003ci class=\"fa-solid fa-link\" aria-hidden=\"true\" title=\"链接到标题\"\u003e\u003c/i\u003e\n    \u003cspan class=\"sr-only\"\u003e链接到标题\u003c/span\u003e\n  \u003c/a\u003e\n\u003c/h3\u003e\n\u003cp\u003e今日的讨论中心毫无疑问地围绕着两大巨头的旗舰模型对决展开，同时开源与端侧生态也在同步演进。\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e\n\u003cp\u003e\u003cstrong\u003e巅峰对决：GPT-5.6 Sol vs. Claude Fable 5\u003c/strong\u003e\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e\u003cstrong\u003eGPT-5.6 Sol 正式发布\u003c/strong\u003e: OpenAI 宣布将于本周四公开发布 GPT-5.6 Sol，以及其变体 Terra 和 Luna。\n\u003cul\u003e\n\u003cli\u003e这引发了社区对 Fable 5 地位的讨论，@Pluvio9yte 称其为“逼宫”，并希望这能促使 Fable 5 常驻。\u003c/li\u003e\n\u003cli\u003e早期评测者 @mitchellh 的比喻被 @dotey 转发并引发共鸣：\u003cstrong\u003eGPT-5.6 Sol 像一个魅力十足、高效全能的同事，而 Fable 5 则像一位在特定领域无比出色的天才隐士\u003c/strong\u003e。初步结论是 Fable 在高度针对性的调试、安全和性能任务上仍有优势，而 Sol 在其他方面表现更好或持平。\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003e\u003cstrong\u003eAnthropic 应对策略\u003c/strong\u003e：与此同时，@zhixianio 发现 \u003cstrong\u003eClaude Fable 5 对所有付费计划的访问权限被延长至 7 月 12 日\u003c/strong\u003e。这被市场解读为在竞争对手发布新产品时维持用户粘性的举措。\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003e\n\u003cp\u003e\u003cstrong\u003e模型能力挖掘与使用范式迭代\u003c/strong\u003e\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e\u003cstrong\u003e从“约束”到“赋能”\u003c/strong\u003e：Claude Code 工程师 @trq212 的演讲被 @dotey 大力推荐。核心观点是，对于 Fable 5 这类顶级模型，应\u003cstrong\u003e减少约束性指令，提供更多上下文\u003c/strong\u003e。模型自己的想象力比预设的示例更丰富。\u003c/li\u003e\n\u003cli\u003e\u003cstrong\u003e两极分化的工作流\u003c/strong\u003e：@dotey 和 @vista8 都分享了 Simon Willison 的省钱技巧，即\u003cstrong\u003e让“判断型”任务（架构设计）运行在 Fable/Opus 等顶级模型上，而将“执行型”任务（大批量写代码）下放给 Sonnet/Haiku 等子代理完成\u003c/strong\u003e。@blackanger 也表示通过此法将 Fable 5 的单个任务成本从 70 刀降至 2 刀。\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003e\n\u003cp\u003e\u003cstrong\u003e开源与端侧模型的进展\u003c/strong\u003e\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e\u003cstrong\u003e腾讯 Hy3 引起关注\u003c/strong\u003e：@vista8 和 @ruanyf 都评测了腾讯新发布的 \u003cstrong\u003e295B MoE 模型 Hy3\u003c/strong\u003e。观点认为，虽然参数规模小于 GLM 5.1，但其性能达到或超越了后者，且 API 价格更低，适合作为日常使用的高性价比模型。\u003c/li\u003e\n\u003cli\u003e\u003cstrong\u003e端侧模型卡带化构想\u003c/strong\u003e：@zhixianio 非常认同 @geekbb 提出的 \u003cstrong\u003e“Model-Pak”概念，即将大模型像游戏卡带一样封装，即插即用\u003c/strong\u003e，认为这与他对未来端侧模型发展方向的思考完全一致。\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003c/ul\u003e\n\u003ch3 id=\"2-值得注意的独特观点与行业前瞻\"\u003e\n  2. 值得注意的独特观点与行业前瞻\n  \u003ca class=\"heading-link\" href=\"#2-%e5%80%bc%e5%be%97%e6%b3%a8%e6%84%8f%e7%9a%84%e7%8b%ac%e7%89%b9%e8%a7%82%e7%82%b9%e4%b8%8e%e8%a1%8c%e4%b8%9a%e5%89%8d%e7%9e%bb\"\u003e\n    \u003ci class=\"fa-solid fa-link\" aria-hidden=\"true\" title=\"链接到标题\"\u003e\u003c/i\u003e\n    \u003cspan class=\"sr-only\"\u003e链接到标题\u003c/span\u003e\n  \u003c/a\u003e\n\u003c/h3\u003e\n\u003cul\u003e\n\u003cli\u003e\n\u003cp\u003e\u003cstrong\u003e“能力悬余”与“找到你的未知” (@dotey / @trq212)\u003c/strong\u003e\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e@dotey 详细转述了 Anthropic 工程师 Thariq 提出的概念。模型其实已经能做很多事，只是我们没找到正确的“打开方式”（例如模型无法在脑中列举以\u003ccode\u003eaw\u003c/code\u003e结尾的宝可梦，但给了代码工具后瞬间就能解决）。\u003c/li\u003e\n\u003cli\u003e\u003cstrong\u003e实用方法论\u003c/strong\u003e：在使用高级模型时，应让模型先做一次“\u003cstrong\u003e盲区扫描\u003c/strong\u003e”（Blind Spot Pass），帮你发现连自己都没意识到的潜在问题。这标志着人机交互正在从人指挥工具，转向\u003cstrong\u003e人定义目标，AI 辅助发现未知风险\u003c/strong\u003e。\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003e\n\u003cp\u003e\u003cstrong\u003eAI 时代的能力瓶颈迁移 (@vista8 / @Pluvio9yte)\u003c/strong\u003e\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e@vista8 指出：“\u003cstrong\u003e当模型足够强时，瓶颈就是人的表达能力。\u003c/strong\u003e” 如何把模糊的想法变成清晰的目标，成为新的核心竞争力。@Pluvio9yte 则分享了一条高赞提示词，其核心逻辑也是\u003cstrong\u003e强制 AI 在行动前与用户进行关键信息确认\u003c/strong\u003e，避免因人的模糊表达而产生“正确的废话”，印证了这一观点。\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003e\n\u003cp\u003e\u003cstrong\u003e生产效率的悖论与破局 (@gefei55)\u003c/strong\u003e\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e@gefei55 提出了尖锐批评：许多人并不是缺少技术，而是用 AI 在错误的赛道上加速。\u003cstrong\u003e从“一个月写 1 个没人用的 App”变成了“一个月花 1 万元 Token 写 37 个没人用的 App”\u003c/strong\u003e。他强调，AI 暴露了程序员害怕做市场调研和推广的舒适区问题，未来生存的关键在于“产销一条龙”的综合能力。\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003e\n\u003cp\u003e\u003cstrong\u003eAgent 工作流的平民化与去魅 (@dotey / @ruanyf)\u003c/strong\u003e\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e@dotey 揭示了 Fable 5 带来的维护挑战：Vibe Coding 让堆积功能变得极其容易，但后续的\u003cstrong\u003e正确性验证、安全审查和长期维护\u003c/strong\u003e成为新的无法完全依赖模型的痛点。\u003c/li\u003e\n\u003cli\u003e@ruanyf 提到一个前瞻性观点：未来招聘程序员，考验的将不再是手写代码的能力，而是\u003cstrong\u003e考察“他会不会用 AI”\u003c/strong\u003e，这将对整个招聘体系提出颠覆性挑战。\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003c/ul\u003e\n\u003ch3 id=\"3-推荐的工具与资源\"\u003e\n  3. 推荐的工具与资源\n  \u003ca class=\"heading-link\" href=\"#3-%e6%8e%a8%e8%8d%90%e7%9a%84%e5%b7%a5%e5%85%b7%e4%b8%8e%e8%b5%84%e6%ba%90\"\u003e\n    \u003ci class=\"fa-solid fa-link\" aria-hidden=\"true\" title=\"链接到标题\"\u003e\u003c/i\u003e\n    \u003cspan class=\"sr-only\"\u003e链接到标题\u003c/span\u003e\n  \u003c/a\u003e\n\u003c/h3\u003e\n\u003cul\u003e\n\u003cli\u003e\n\u003cp\u003e\u003cstrong\u003e端侧代码模型\u003c/strong\u003e：\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e\u003cstrong\u003eGemma 4 12B Coder\u003c/strong\u003e: @zhixianio 进行了详细测试。结论是对于短小精悍的任务表现不错，微调版解决了“只想不动手”的问题，但受限于 12B 参数规模，在处理“长上下文、有状态、一次成型”的复杂程序（如俄罗斯方块）时天花板明显。\u003c/li\u003e\n\u003cli\u003e\u003cstrong\u003e目标与工作流\u003c/strong\u003e：Claude Code 的 \u003ccode\u003e/goal\u003c/code\u003e (目标指令) 和 \u003ccode\u003eworkflows\u003c/code\u003e (工作流) 新功能，帮助模型持续工作并进行自我验证。\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003e\n\u003cp\u003e\u003cstrong\u003eAgent 开发与工具链\u003c/strong\u003e：\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e\u003cstrong\u003eOpenConnector\u003c/strong\u003e: @Pluvio9yte 强烈推荐，一个开源认证网关，解决了 Agent 连接外部工具时最繁琐的 API 认证和凭证管理问题，被视为 Composio 的开源平替方案，上线一天即涨 400+ star。\u003c/li\u003e\n\u003cli\u003e\u003cstrong\u003ernskill\u003c/strong\u003e: @Pluvio9yte 开源的 AI Agent Skill 集合，专门针对中文 AI 内容的“去 AI 味”修饰，以及产品动效视频的导演和风格化生成，极具实操性。\u003c/li\u003e\n\u003cli\u003e\u003cstrong\u003e公众号文章下载 Skills\u003c/strong\u003e: @AI_Jasonyu 分享的群友作品，能一键批量下载公众号文章并转为干净的 Markdown 格式，方便构建个人知识库。\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003e\n\u003cp\u003e\u003cstrong\u003eAI 视频创作\u003c/strong\u003e：\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e\u003cstrong\u003eTopview 3D Shot Composer\u003c/strong\u003e: @AI_Jasonyu 推荐。不同于纯提示词，它允许先在 3D 空间里摆好机位、角色、构图，再由 AI 生成视频，解决了 AI 视频中构图不受控的痛点。\u003c/li\u003e\n\u003cli\u003e\u003cstrong\u003eSeedance 2.5 on CapCut\u003c/strong\u003e: @Pluvio9yte 提到，即海外版剪映的 AI 视频功能，可支持 30 秒片段和 50 个参考素材，提供了较高创作自由度。\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003c/ul\u003e\n\u003ch2 id=\"-附录今日-watch-list-更新源列表\"\u003e\n  📚 附录:今日 Watch List 更新源列表\n  \u003ca class=\"heading-link\" href=\"#-%e9%99%84%e5%bd%95%e4%bb%8a%e6%97%a5-watch-list-%e6%9b%b4%e6%96%b0%e6%ba%90%e5%88%97%e8%a1%a8\"\u003e\n    \u003ci class=\"fa-solid fa-link\" aria-hidden=\"true\" title=\"链接到标题\"\u003e\u003c/i\u003e\n    \u003cspan class=\"sr-only\"\u003e链接到标题\u003c/span\u003e\n  \u003c/a\u003e\n\u003c/h2\u003e\n\u003cblockquote\u003e\n\u003cp\u003e时间窗口:最近 3 天;覆盖 22 个源;共 35 条更新\u003c/p\u003e\n\u003c/blockquote\u003e\n\u003ch3 id=\"stratechery-by-ben-thompson-a_full\"\u003e\n  Stratechery by Ben Thompson (A_full)\n  \u003ca class=\"heading-link\" href=\"#stratechery-by-ben-thompson-a_full\"\u003e\n    \u003ci class=\"fa-solid fa-link\" aria-hidden=\"true\" title=\"链接到标题\"\u003e\u003c/i\u003e\n    \u003cspan class=\"sr-only\"\u003e链接到标题\u003c/span\u003e\n  \u003c/a\u003e\n\u003c/h3\u003e\n\u003cul\u003e\n\u003cli\u003e\u003cstrong\u003e\u003ca href=\"https://stratechery.com/2026/xbox-cuts-bundling-and-the-internet-solvent-transaction-coordination-and-sunk-costs/\"  class=\"external-link\" target=\"_blank\" rel=\"noopener\"\u003eXBOX Cuts; Bundling and the Internet Solvent; Transaction, Coordination, and Sunk Costs\u003c/a\u003e\u003c/strong\u003e\n\u003cul\u003e\n\u003cli\u003e发布时间:2026-07-08 18:00 北京时间\u003c/li\u003e\n\u003cli\u003e摘要:- 微软的 Xbox 部门正在进行大规模裁员，因为该公司正在应对其 Game Pass 战略的惨败。\n\u003cul\u003e\n\u003cli\u003e\u003cstrong\u003e15 美元\u003c/strong\u003e/月\u003cem\u003e或\u003c/em\u003e\u003cstrong\u003e150 美元\u003c/strong\u003e/年。\u003c/li\u003e\n\u003cli\u003e通过每周三封电子邮件或播客对当天新闻进行实质性分析。\u003c/li\u003e\n\u003cli\u003e\u003cstrong\u003e策略采访\u003c/strong\u003e。\u003c/li\u003e\n\u003cli\u003e采访领先的上市首席执行官、私营公司创始人，并与分析师同行进行讨论。\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003eEN 要点:\n\u003cul\u003e\n\u003cli\u003eMicrosoft\u0026rsquo;s Xbox division is conducting big layoffs, as the company deals with abject failure of its Game Pass strategy.\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003c/ul\u003e\n\u003ch3 id=\"openai-blog-a_full\"\u003e\n  OpenAI Blog (A_full)\n  \u003ca class=\"heading-link\" href=\"#openai-blog-a_full\"\u003e\n    \u003ci class=\"fa-solid fa-link\" aria-hidden=\"true\" title=\"链接到标题\"\u003e\u003c/i\u003e\n    \u003cspan class=\"sr-only\"\u003e链接到标题\u003c/span\u003e\n  \u003c/a\u003e\n\u003c/h3\u003e\n\u003cul\u003e\n\u003cli\u003e\n\u003cp\u003e\u003cstrong\u003e\u003ca href=\"https://openai.com/index/government-national-security-partnerships\"  class=\"external-link\" target=\"_blank\" rel=\"noopener\"\u003eOur approach to government and national security partnerships\u003c/a\u003e\u003c/strong\u003e\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e发布时间:2026-07-08 21:30 北京时间\u003c/li\u003e\n\u003cli\u003e摘要:- 各国政府开始将前沿人工智能系统用于日益重要的工作，包括国家安全。\n\u003cul\u003e\n\u003cli\u003e这为人工智能实验室、政府和民间社会共同努力研究如何在敏感环境中使用这些工具创造了新的必要条件。\u003c/li\u003e\n\u003cli\u003e我们相信民主社会应该能够利用人工智能来保护人民、保卫关键基础设施、提供公共服务并应对新出现的威胁，包括在网络防御和生物安全等领域，人工智能可以在这些领域为防御者带来有意义的优势。\u003c/li\u003e\n\u003cli\u003e但能力日益增强的人工智能系统的部署方式必须能够加强民主问责制、有意义的人类判断和法治，并加强民主制度而不是集中权力。\u003c/li\u003e\n\u003cli\u003e今天，我们发布 OpenAI 的国家安全原则，以透明地说明我们如何处理政府合作伙伴关系以及我们技术的国家安全用途。\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003eEN 要点:\n\u003cul\u003e\n\u003cli\u003eLearn how OpenAI approaches government and national security partnerships, with principles for responsible AI use, democratic accountability, and public safety.\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003e\n\u003cp\u003e\u003cstrong\u003e\u003ca href=\"https://openai.com/index/separating-signal-from-noise-coding-evaluations\"  class=\"external-link\" target=\"_blank\" rel=\"noopener\"\u003eSeparating signal from noise in coding evaluations\u003c/a\u003e\u003c/strong\u003e\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e发布时间:2026-07-08 21:00 北京时间\u003c/li\u003e\n\u003cli\u003e摘要:- 对于每个模型版本，我们都会报告各种外部和内部基准的结果，以跟踪模型进度。\n\u003cul\u003e\n\u003cli\u003e当评估存在影响结果的缺陷时，它们可能会对能力产生错误的理解，歪曲安全案例并影响研究重点。\u003c/li\u003e\n\u003cli\u003e当时，我们鼓励更广泛的社区转向 SWE-Bench Pro。\u003c/li\u003e\n\u003cli\u003e与 SWE-bench Verified 一样，任务以编程方式从一组公共和私有存储库中的功能更改历史记录中获取。\u003c/li\u003e\n\u003cli\u003e需要模型来实现一个解决方案，该解决方案通过功能的新测试，而不破坏现有功能。\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003eEN 要点:\n\u003cul\u003e\n\u003cli\u003eA new analysis from OpenAI reveals issues in SWE-Bench Pro, a popular coding benchmark, raising concerns about reliability and accuracy in evaluating AI models.\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003e\n\u003cp\u003e\u003cstrong\u003e\u003ca href=\"https://openai.com/index/k-12-educators-practical-skills\"  class=\"external-link\" target=\"_blank\" rel=\"noopener\"\u003eHelping K–12 educators build practical AI skills\u003c/a\u003e\u003c/strong\u003e\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e发布时间:2026-07-08 18:00 北京时间\u003c/li\u003e\n\u003cli\u003e摘要:- OpenAI Academy 和 Walton Family Foundation 正在推出 AI 技能实践实践活动，帮助 K-12 教育工作者在课堂上培养实用的 AI 技能。\n\u003cul\u003e\n\u003cli\u003eOpenAI 博客中的这篇文章解释了如何帮助 K-12 教育工作者培养实用的 AI 技能来塑造更广泛的 AI 和基础设施景观。\u003c/li\u003e\n\u003cli\u003e在帮助 K-12 教育工作者培养实用的人工智能技能之后，它还为创始人、运营商和投资者带来了实际影响。\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003eEN 要点:\n\u003cul\u003e\n\u003cli\u003eOpenAI Academy and the Walton Family Foundation are bringing hands-on AI Skills Jams to help K–12 educators build practical AI skills for the classroom.\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003e\n\u003cp\u003e\u003cstrong\u003e\u003ca href=\"https://openai.com/index/introducing-gpt-live\"  class=\"external-link\" target=\"_blank\" rel=\"noopener\"\u003eIntroducing GPT-Live\u003c/a\u003e\u003c/strong\u003e\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e发布时间:2026-07-08 08:00 北京时间\u003c/li\u003e\n\u003cli\u003e摘要:- 用于自然人机交互的新一代语音模型，现已为 ChatGPT 语音提供支持。\n\u003cul\u003e\n\u003cli\u003eOpenAI 博客的这篇文章解释了 GPT-Live 的推出如何塑造更广泛的人工智能和基础设施格局。\u003c/li\u003e\n\u003cli\u003e推出 GPT-Live 后，它还为创始人、运营商和投资者带来了实际影响。\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003eEN 要点:\n\u003cul\u003e\n\u003cli\u003eA new generation of voice models for natural human-AI interaction, now powering ChatGPT Voice.\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003c/ul\u003e\n\u003ch3 id=\"arxiv-csai-b_introsearch\"\u003e\n  ArXiv cs.AI (B_intro+search)\n  \u003ca class=\"heading-link\" href=\"#arxiv-csai-b_introsearch\"\u003e\n    \u003ci class=\"fa-solid fa-link\" aria-hidden=\"true\" title=\"链接到标题\"\u003e\u003c/i\u003e\n    \u003cspan class=\"sr-only\"\u003e链接到标题\u003c/span\u003e\n  \u003c/a\u003e\n\u003c/h3\u003e\n\u003cul\u003e\n\u003cli\u003e\n\u003cp\u003e\u003cstrong\u003e\u003ca href=\"https://arxiv.org/abs/2607.05456\"  class=\"external-link\" target=\"_blank\" rel=\"noopener\"\u003ePrompt-to-Paper: Agentic AI System for Bioinformatics\u003c/a\u003e\u003c/strong\u003e\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e发布时间:2026-07-08 12:00 北京时间\u003c/li\u003e\n\u003cli\u003e摘要:- arXiv:2607.05456v1 公告类型：新。\n-摘要：虽然大语言模型的最新进展已经实现了端到端自动手稿生成，但现有系统存在三个关键缺陷：（i）生成的声明没有确定性地基于可验证的文献，（ii）实验结果经常是捏造的而不是执行的，以及（iii）不存在标准化的多维框架来评估人工智能生成的手稿是否满足现实世界出版所需的质量和严谨性。\n\u003cul\u003e\n\u003cli\u003e我们提出了 Prompt-to-Paper，这是一个多智能体框架，可通过三项集成创新直接解决这一评估差距。\u003c/li\u003e\n\u003cli\u003e首先，确定性检索增强生成管道具有部分感知相关性评分和滚雪球引用扩展，为可验证的 60\u0026ndash;100 篇论文的语料库中的每项主张提供依据。\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003eEN 要点:\n\u003cul\u003e\n\u003cli\u003earXiv:2607.05456v1 Announce Type: new\u003c/li\u003e\n\u003cli\u003eAbstract: While recent advances in large language models have enabled end-to-end automated manuscript generation, existing systems suffer from three critical de…\u003c/li\u003e\n\u003cli\u003eWe present Prompt-to-Paper, a multi-agent framework that directly addresses this evaluation gap through three integrated innovations\u003c/li\u003e\n\u003cli\u003eFirst, a deterministic retrieval-augmented generation pipeline with section-aware relevance scoring and snowball citation expansion grounds every claim in a ver…\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003e\n\u003cp\u003e\u003cstrong\u003e\u003ca href=\"https://arxiv.org/abs/2607.05563\"  class=\"external-link\" target=\"_blank\" rel=\"noopener\"\u003eFrom Graphs to Gradients: Physics-Inspired Structural Attribution for Cyber-Physical IoT Systems and Beyond\u003c/a\u003e\u003c/strong\u003e\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e发布时间:2026-07-08 12:00 北京时间\u003c/li\u003e\n\u003cli\u003e摘要:- arXiv:2607.05563v1 公告类型：新。\n-摘要：人工智能中的可解释解释方法旨在揭示根本原因及其影响，从而更深入地理解为什么系统在不同输入下以某种方式表现。\n\u003cul\u003e\n\u003cli\u003e与主要强调输入和输出变量之间的相关性的传统可解释性方法不同，因果解释侧重于干预问题。\u003c/li\u003e\n\u003cli\u003e通过这样做，它可以提供更强大的见解，帮助用户理解自动化决策，尤其是在高风险领域。\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003eEN 要点:\n\u003cul\u003e\n\u003cli\u003earXiv:2607.05563v1 Announce Type: new\u003c/li\u003e\n\u003cli\u003eAbstract: Interpretable explanation methods in Artificial Intelligence aim to uncover the underlying causes and their effects, enabling a deeper understanding o…\u003c/li\u003e\n\u003cli\u003eUnlike traditional explainability methods, which mainly highlight correlations between input and output variables, causal explanation focuses on interventional…\u003c/li\u003e\n\u003cli\u003eBy doing so, it provides more robust insights, helping users understand automated decisions, especially in high-risk domains\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003e\n\u003cp\u003e\u003cstrong\u003e\u003ca href=\"https://arxiv.org/abs/2607.05571\"  class=\"external-link\" target=\"_blank\" rel=\"noopener\"\u003eCSTutorBench: Benchmarking Small Language Models as Tutors for Block-Based Programming\u003c/a\u003e\u003c/strong\u003e\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e发布时间:2026-07-08 12:00 北京时间\u003c/li\u003e\n\u003cli\u003e摘要:- arXiv:2607.05571v1 公告类型：新。\n\u003cul\u003e\n\u003cli\u003e摘要：大型语言模型作为 AI 导师越来越多地被探索，但在 K-12 环境中部署它们引发了对隐私、成本和对专有模型的依赖的担忧。\u003c/li\u003e\n\u003cli\u003e小语言模型 (SLM) 提供了一种有前途的替代方案，但为特定的教育环境选择正确的模型仍然很困难，特别是当模型训练数据中基本上不存在目标领域（例如基于块的编程）时。\u003c/li\u003e\n\u003cli\u003e我们推出了 CSTutorBench，这是一个在 VEX VR（基于块的机器人环境）中评估作为 CS 导师的语言模型的基准。\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003eEN 要点:\n\u003cul\u003e\n\u003cli\u003earXiv:2607.05571v1 Announce Type: new\u003c/li\u003e\n\u003cli\u003eAbstract: Large language models are increasingly explored as AI tutors, yet deploying them in K-12 settings raises concerns around privacy, cost, and reliance o…\u003c/li\u003e\n\u003cli\u003eSmall language models (SLMs) offer a promising alternative, but selecting the right model for a specific educational context remains difficult, particularly whe…\u003c/li\u003e\n\u003cli\u003eWe introduce CSTutorBench, a benchmark for evaluating language models as CS tutors in VEX VR, a block-based robotics environment\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003e\n\u003cp\u003e\u003cstrong\u003e\u003ca href=\"https://arxiv.org/abs/2607.05573\"  class=\"external-link\" target=\"_blank\" rel=\"noopener\"\u003eFoundation Models for Automatic CAD Generation\u003c/a\u003e\u003c/strong\u003e\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e发布时间:2026-07-08 12:00 北京时间\u003c/li\u003e\n\u003cli\u003e摘要:- arXiv:2607.05573v1 公告类型：新。\n\u003cul\u003e\n\u003cli\u003e摘要：大型语言模型 (LLM) 和视觉语言模型 (VLM) 的最新进展使得能够根据自然语言规范自动生成参数化 3D 设计。\u003c/li\u003e\n\u003cli\u003e本章介绍了自动计算机辅助设计 (CAD) 生成机械零件的基础模型的实证研究，使用统一的评估流程和 97 个工程设计问题的策划基准。\u003c/li\u003e\n\u003cli\u003e我们介绍 LLMForge，一个多模型文本到 CAD 框架，集成了 JSON 模式验证、分析特征评分、网格合成和多轮迭代细化，在两种批评制度下进行了研究。\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003eEN 要点:\n\u003cul\u003e\n\u003cli\u003earXiv:2607.05573v1 Announce Type: new\u003c/li\u003e\n\u003cli\u003eAbstract: Recent advances in Large Language Models (LLMs) and Vision-Language Models (VLMs) enable the automatic generation of parametric 3D designs from natura…\u003c/li\u003e\n\u003cli\u003eThis chapter presents an empirical study of foundation models for automatic Computer-Aided Design (CAD) generation of mechanical parts, using a unified evaluati…\u003c/li\u003e\n\u003cli\u003eWe introduce LLMForge, a multi-model text-to-CAD framework integrating JSON-schema validation, analytic feature scoring, mesh synthesis, and multi-round iterati…\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003e\n\u003cp\u003e\u003cstrong\u003e\u003ca href=\"https://arxiv.org/abs/2607.05577\"  class=\"external-link\" target=\"_blank\" rel=\"noopener\"\u003eNarrative World Model: Narratology-Grounded Writer Memory for Long-Form Fiction\u003c/a\u003e\u003c/strong\u003e\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e发布时间:2026-07-08 12:00 北京时间\u003c/li\u003e\n\u003cli\u003e摘要:- arXiv:2607.05577v1 公告类型：新。\n\u003cul\u003e\n\u003cli\u003e摘要：长篇小说作家需要记忆来回答有关不断发展的故事状态的多跳问题：谁知道一个秘密，他们什么时候知道这个秘密，一个事件是否先于揭示它的叙述，一个设置是否得到回报，以及关系如何转变。\u003c/li\u003e\n\u003cli\u003e通用检索和主体记忆系统代表实体和事实，但不代表这些问题所开启的叙事结构，因此它们会提供错误的证据或根本没有证据。\u003c/li\u003e\n\u003cli\u003e我们引入了叙事世界模型（NWM），这是一种作者记忆系统，它将基于叙事学的类型化时间状态图与查询条件混合检索配对。\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003eEN 要点:\n\u003cul\u003e\n\u003cli\u003earXiv:2607.05577v1 Announce Type: new\u003c/li\u003e\n\u003cli\u003eAbstract: Long-form fiction writers need memory that answers multi-hop questions about evolving story state: who knows a secret and when they learned it, whethe…\u003c/li\u003e\n\u003cli\u003eGeneral-purpose retrieval and agent-memory systems represent entities and facts but not the narratological structure these questions turn on, so they surface th…\u003c/li\u003e\n\u003cli\u003eWe introduce the Narrative World Model (NWM), a writer-memory system that pairs a narratology-grounded typed temporal-state graph with query-conditioned hybrid…\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003e\n\u003cp\u003e\u003cstrong\u003e\u003ca href=\"https://arxiv.org/abs/2607.05682\"  class=\"external-link\" target=\"_blank\" rel=\"noopener\"\u003eFirstResearch: Auditable Question Formation for LLM Scientific Discovery Agents\u003c/a\u003e\u003c/strong\u003e\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e发布时间:2026-07-08 12:00 北京时间\u003c/li\u003e\n\u003cli\u003e摘要:- arXiv:2607.05682v1 公告类型：新。\n-摘要：用于科学发现的法学硕士系统越来越多地协助构思、文献综合、实验计划和报告生成，但他们提出的第一个研究问题仍然难以审核：在不暴露科学家应该检查的机制、证伪者或假设的情况下，它可能听起来似乎合理。\n\u003cul\u003e\n\u003cli\u003e我们介绍 FirstResearch，这是一个针对科学法学硕士代理人的第一性原理研究问题形成框架，其核心工件是结构化研究问题证书。\u003c/li\u003e\n\u003cli\u003e证书记录原始定义、假设、机制模型、张力或矛盾、可证伪的假设、最小决定性测试和失败更新规则，使得提出的问题在下游执行之前可检查。\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003eEN 要点:\n\u003cul\u003e\n\u003cli\u003earXiv:2607.05682v1 Announce Type: new\u003c/li\u003e\n\u003cli\u003eAbstract: LLM systems for scientific discovery increasingly assist with ideation, literature synthesis, experiment planning, and report generation, but the firs…\u003c/li\u003e\n\u003cli\u003eWe introduce FirstResearch, a first-principles research-question formation framework for scientific LLM agents whose core artifact is a structured Research Ques…\u003c/li\u003e\n\u003cli\u003eThe certificate records primitive definitions, assumptions, a mechanism model, a tension or contradiction, a falsifiable hypothesis, a minimal decisive test, an…\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003e\n\u003cp\u003e\u003cstrong\u003e\u003ca href=\"https://arxiv.org/abs/2607.05690\"  class=\"external-link\" target=\"_blank\" rel=\"noopener\"\u003eMemory in the Loop: In-Process Retrieval as ExtendedWorking Memory for Language Agents\u003c/a\u003e\u003c/strong\u003e\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e发布时间:2026-07-08 12:00 北京时间\u003c/li\u003e\n\u003cli\u003e摘要:- arXiv:2607.05690v1 公告类型：新。\n\u003cul\u003e\n\u003cli\u003e摘要：语言代理运行一个循环 - 观察、推理、行动 - 但它们推理的记忆位于循环之外：每轮最多查询一次的存储。\u003c/li\u003e\n\u003cli\u003e我们研究内存在循环内移动、每一步读取和写入的机制。\u003c/li\u003e\n\u003cli\u003e障碍始终是延迟：网络存储在数十到数百毫秒内做出响应，当检索成本高昂时，循环检索可能会使端到端延迟增加高达 83 倍。\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003eEN 要点:\n\u003cul\u003e\n\u003cli\u003earXiv:2607.05690v1 Announce Type: new\u003c/li\u003e\n\u003cli\u003eAbstract: Language agents run a loop - observe, reason, act - but the memory they reason over sits outside it: a store queried at most once per turn\u003c/li\u003e\n\u003cli\u003eWe study the regime where memory moves inside the loop, read and written on every step\u003c/li\u003e\n\u003cli\u003eThe obstacle has always been latency: networked stores answer in tens to hundreds of milliseconds, and in-loop retrieval can inflate end-to-end latency by up to…\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003e\n\u003cp\u003e\u003cstrong\u003e\u003ca href=\"https://arxiv.org/abs/2607.05708\"  class=\"external-link\" target=\"_blank\" rel=\"noopener\"\u003eAkashic: A Low-Overhead LLM Inference Service with MemAttention\u003c/a\u003e\u003c/strong\u003e\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e发布时间:2026-07-08 12:00 北京时间\u003c/li\u003e\n\u003cli\u003e摘要:- arXiv:2607.05708v1 公告类型：新。\n\u003cul\u003e\n\u003cli\u003e摘要：最近基于 LLM 的代理系统不断积累多轮交互、工具调用和跨会话工作流程的上下文。\u003c/li\u003e\n\u003cli\u003e快速重播每个请求的完整历史记录变得不切实际：长上下文会增加预填充成本，可能会超出上下文限制，并且经常将与任务相关的证据隐藏在不相关的内容中，从而降低服务效率和输出质量。\u003c/li\u003e\n\u003cli\u003e我们提出了 Akashic，一种围绕 MemAttention 构建的低开销记忆系统，它将上下文组织成有界的块，并对跨块的语义关系进行建模，保留跨块的证据，而无需重复重写完整的历史记录。\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003eEN 要点:\n\u003cul\u003e\n\u003cli\u003earXiv:2607.05708v1 Announce Type: new\u003c/li\u003e\n\u003cli\u003eAbstract: Recent LLM-based agent systems continuously accumulate context across multi-turn interactions, tool invocations, and cross-session workflows\u003c/li\u003e\n\u003cli\u003eReplaying the full history for every request quickly becomes impractical: long contexts increase prefill cost, may exceed context limits, and often bury task-re…\u003c/li\u003e\n\u003cli\u003eWe propose Akashic, a low-overhead memory system built around MemAttention, which organizes context into bounded chunks and models semantic relationships across…\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003e\n\u003cp\u003e\u003cstrong\u003e\u003ca href=\"https://arxiv.org/abs/2607.05750\"  class=\"external-link\" target=\"_blank\" rel=\"noopener\"\u003eArtisanCAD: An Industrial-Level CAD Agent with Expert-Grounded Knowledge Distillation\u003c/a\u003e\u003c/strong\u003e\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e发布时间:2026-07-08 12:00 北京时间\u003c/li\u003e\n\u003cli\u003e摘要:- arXiv:2607.05750v1 公告类型：新。\n\u003cul\u003e\n\u003cli\u003e摘要：工业组件的计算机辅助设计 (CAD) 需要长期程序建模、强大的特征依赖性、可编辑的参数化几何形状和生产级 B-Rep 执行。\u003c/li\u003e\n\u003cli\u003e现有的文本到 CAD 方法在从自然语言描述生成 CAD 程序方面取得了可喜的进展，但当用户提示不明确、不明确或仅描述高级设计意图时，它们仍然举步维艰。\u003c/li\u003e\n\u003cli\u003e他们也很少利用工业工作流程中自然可用的专家程序知识，例如 CATIA 操作记录、宏日志、绘图注释和工程描述。\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003eEN 要点:\n\u003cul\u003e\n\u003cli\u003earXiv:2607.05750v1 Announce Type: new\u003c/li\u003e\n\u003cli\u003eAbstract: Computer-aided design (CAD) for industrial components requires long-horizon procedural modeling, robust feature dependencies, editable parametric geom…\u003c/li\u003e\n\u003cli\u003eExisting text-to-CAD methods have made promising progress in generating CAD programs from natural-language descriptions, but they still struggle when user promp…\u003c/li\u003e\n\u003cli\u003eThey also rarely exploit expert procedural knowledge naturally available in industrial workflows, such as CATIA operation recordings, macro logs, drawing notes,…\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003e\n\u003cp\u003e\u003cstrong\u003e\u003ca href=\"https://arxiv.org/abs/2607.05761\"  class=\"external-link\" target=\"_blank\" rel=\"noopener\"\u003eSynthetic Consumer Insight Generation with Large Language Models\u003c/a\u003e\u003c/strong\u003e\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e发布时间:2026-07-08 12:00 北京时间\u003c/li\u003e\n\u003cli\u003e摘要:- arXiv:2607.05761v1 公告类型：新。\n\u003cul\u003e\n\u003cli\u003e摘要：现代数据驱动营销依赖于大量消费者数据，但收集此类数据可能成本高昂、耗时且难以扩展。\u003c/li\u003e\n\u003cli\u003e这项研究探讨大型语言模型 (LLM) 是否可用于为投射技术生成合成消费者数据，投射技术是一组旨在引发消费者联想、情感、愿望和需求的方法。\u003c/li\u003e\n\u003cli\u003e我们测试了法学硕士在多个投射任务、法学硕士、提示策略和温度设置中生成的反应，并将它们与人类对城市旅游目的地认知的初步研究的反应进行比较。\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003eEN 要点:\n\u003cul\u003e\n\u003cli\u003earXiv:2607.05761v1 Announce Type: new\u003c/li\u003e\n\u003cli\u003eAbstract: Modern data-driven marketing relies on large amounts of consumer data, yet collecting such data can be costly, time-consuming, and difficult to scale\u003c/li\u003e\n\u003cli\u003eThis research examines whether large language models (LLMs) can be used to generate synthetic consumer data for projective techniques, a set of methods designed…\u003c/li\u003e\n\u003cli\u003eWe test LLM-generated responses across multiple projective tasks, LLMs, prompting strategies, and temperature settings, and compare them with human responses fr…\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003c/ul\u003e\n\u003ch3 id=\"arxiv-cscl-b_introsearch\"\u003e\n  ArXiv cs.CL (B_intro+search)\n  \u003ca class=\"heading-link\" href=\"#arxiv-cscl-b_introsearch\"\u003e\n    \u003ci class=\"fa-solid fa-link\" aria-hidden=\"true\" title=\"链接到标题\"\u003e\u003c/i\u003e\n    \u003cspan class=\"sr-only\"\u003e链接到标题\u003c/span\u003e\n  \u003c/a\u003e\n\u003c/h3\u003e\n\u003cul\u003e\n\u003cli\u003e\n\u003cp\u003e\u003cstrong\u003e\u003ca href=\"https://arxiv.org/abs/2607.05398\"  class=\"external-link\" target=\"_blank\" rel=\"noopener\"\u003eHow Personas Can Influence Agents to Play Split or Steal\u003c/a\u003e\u003c/strong\u003e\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e发布时间:2026-07-08 12:00 北京时间\u003c/li\u003e\n\u003cli\u003e摘要:- arXiv:2607.05398v1 公告类型：新。\n-摘要：角色通常被用来指导大型语言模型代理，但它们在社会困境环境中塑造策略行为的有效性仍然不确定。\n\u003cul\u003e\n\u003cli\u003e为了解决这个问题，我们检查了角色提示在迭代的 Split 或 Steal 游戏中的影响，其中角色驱动的代理与由固定提示控制的虚拟人 (VH) 进行交互。\u003c/li\u003e\n\u003cli\u003e代理是从四个开放模型（Ministral 3:3b、phi4:14b、Gemma3:12b 和 Gemma4:e4b）在两种温度设置（0.3 和 0.7）和零温度的确定性决策中实例化的，而 VH 由 GPT 4.1 mini 提供支持。\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003eEN 要点:\n\u003cul\u003e\n\u003cli\u003earXiv:2607.05398v1 Announce Type: new\u003c/li\u003e\n\u003cli\u003eAbstract: Personas are often employed to guide large language model agents, yet their effectiveness in shaping strategic behavior in social dilemma settings rem…\u003c/li\u003e\n\u003cli\u003eTo address this, we examined the impact of persona prompts in an iterated Split or Steal game where persona-driven agents interacted with a Virtual Human (VH) c…\u003c/li\u003e\n\u003cli\u003eAgents were instantiated from four open models (Ministral 3:3b, phi4:14b, Gemma3:12b, and Gemma4:e4b) at two temperature settings (0.3 and 0.7) and deterministi…\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003e\n\u003cp\u003e\u003cstrong\u003e\u003ca href=\"https://arxiv.org/abs/2607.05399\"  class=\"external-link\" target=\"_blank\" rel=\"noopener\"\u003eBenchmarking KV-Cache Optimizations across Task Quality and System Performance for Long-Context Serving\u003c/a\u003e\u003c/strong\u003e\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e发布时间:2026-07-08 12:00 北京时间\u003c/li\u003e\n\u003cli\u003e摘要:- arXiv:2607.05399v1 公告类型：新。\n-摘要：大型语言模型服务越来越受到长上下文工作负载下 KV 缓存增长的限制，但现有的 KV 缓存压缩技术很难比较，因为它们是在不同的模型、任务、预算和服务堆栈上进行评估的。\n\u003cul\u003e\n\u003cli\u003e本文提出了跨量化、修剪和合并的代表性 KV 缓存优化机制的工作负载感知基准，包括 KIVI、TurboQuant、SnapKV 和 CaM，并使用 Llama-3.1-8B-Instruct 和 Mistral-7B-Instruct-v0.3 在 LongBench 风格的多文档 QA、单文档 QA、小样本学习和摘要工作负载上进行评估。\u003c/li\u003e\n\u003cli\u003e该基准测试衡量任务质量、平均输出吞吐量、平均首次令牌时间以及跨上下文长度存储桶实现的压缩比。\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003eEN 要点:\n\u003cul\u003e\n\u003cli\u003earXiv:2607.05399v1 Announce Type: new\u003c/li\u003e\n\u003cli\u003eAbstract: Large language model serving is increasingly limited by KV-cache growth under long-context workloads, yet existing KV-cache compression techniques are…\u003c/li\u003e\n\u003cli\u003eThis paper presents a workload-aware benchmark of representative KV-cache optimization mechanisms spanning quantization, pruning, and merging, including KIVI, T…\u003c/li\u003e\n\u003cli\u003eThe benchmark measures task quality, mean output throughput, mean time-to-first-token, and realized compression ratio across context-length buckets\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003e\n\u003cp\u003e\u003cstrong\u003e\u003ca href=\"https://arxiv.org/abs/2607.05416\"  class=\"external-link\" target=\"_blank\" rel=\"noopener\"\u003eText Distance from Nested and Hierarchical Repetitions: A Compression-Based Perspective\u003c/a\u003e\u003c/strong\u003e\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e发布时间:2026-07-08 12:00 北京时间\u003c/li\u003e\n\u003cli\u003e摘要:- arXiv:2607.05416v1 公告类型：新。\n\u003cul\u003e\n\u003cli\u003e摘要：我们提出了一种基于算法信息论（AIT）的结构序列分析新方法。\u003c/li\u003e\n\u003cli\u003e其核心是 Ladderpath 方法，它提取语言序列中重复子结构之间的嵌套和层次关系 - 这是 AIT 通过最小生成程序描述数据原则的实例。\u003c/li\u003e\n\u003cli\u003e这些结构然后用于定义三个距离度量：归一化压缩距离（NCD）和直接从梯形路径表示导出的两个替代距离。\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003eEN 要点:\n\u003cul\u003e\n\u003cli\u003earXiv:2607.05416v1 Announce Type: new\u003c/li\u003e\n\u003cli\u003eAbstract: We present a new method for structural sequence analysis grounded in Algorithmic Information Theory (AIT)\u003c/li\u003e\n\u003cli\u003eAt its core is the Ladderpath approach, which extracts nested and hierarchical relationships among repeated substructures in linguistic sequences \u0026ndash; an instanti…\u003c/li\u003e\n\u003cli\u003eThese structures are then used to define three distance measures: a normalized compression distance (NCD), and two alternative distances derived directly from t…\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003e\n\u003cp\u003e\u003cstrong\u003e\u003ca href=\"https://arxiv.org/abs/2607.05545\"  class=\"external-link\" target=\"_blank\" rel=\"noopener\"\u003eMost LLM Conformity Needs No Speaker: Measuring the Speaker-Free Floor in Peer-Pressure Benchmarks\u003c/a\u003e\u003c/strong\u003e\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e发布时间:2026-07-08 12:00 北京时间\u003c/li\u003e\n\u003cli\u003e摘要:- arXiv:2607.05545v1 公告类型：新。\n\u003cul\u003e\n\u003cli\u003e摘要：LLM 一致性通常用于描述模型更改对同行或群体响应的正确答案的情况。\u003c/li\u003e\n\u003cli\u003e我们表明，即使在同伴被移除后，大多数这种明显的一致性仍然存在。\u003c/li\u003e\n\u003cli\u003e原因很令人困惑：标准的一致性提示同时混合了两种提示：说话者的存在和重复的错误答案本身。\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003eEN 要点:\n\u003cul\u003e\n\u003cli\u003earXiv:2607.05545v1 Announce Type: new\u003c/li\u003e\n\u003cli\u003eAbstract: LLM conformity is often used to describe cases where a model changes a correct answer toward a peer or group response\u003c/li\u003e\n\u003cli\u003eWe show that most of this apparent conformity survives even after the peer is removed\u003c/li\u003e\n\u003cli\u003eThe reason is a confound: standard conformity prompts mix two cues at once, the presence of a speaker and the repeated wrong answer itself\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003e\n\u003cp\u003e\u003cstrong\u003e\u003ca href=\"https://arxiv.org/abs/2607.05552\"  class=\"external-link\" target=\"_blank\" rel=\"noopener\"\u003eThe yes-no bias of large language models reflects answer order and wording, not shifts in moral judgment\u003c/a\u003e\u003c/strong\u003e\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e发布时间:2026-07-08 12:00 北京时间\u003c/li\u003e\n\u003cli\u003e摘要:- arXiv:2607.05552v1 公告类型：新。\n-摘要：大型语言模型（LLM）越来越多地发出被解读为二元判决的判断，越来越多的文献报道了这种判断在逻辑上不相关的措辞变化下发生变化——其中包括对道德困境的放大的是与否偏见，而人类不存在这种偏见。\n\u003cul\u003e\n\u003cli\u003e单个框架无法说明这种转变是什么：在是/否问题中，“否”一词既是逻辑判断，又是词汇标记，也是最后打印的选项。\u003c/li\u003e\n\u003cli\u003e我们引入了一个心理测量电池组，将这些分开：交叉对称化 - 每个逻辑上不相关的因素以平衡对的形式翻转 - 跨越问题形式的语料库。\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003eEN 要点:\n\u003cul\u003e\n\u003cli\u003earXiv:2607.05552v1 Announce Type: new\u003c/li\u003e\n\u003cli\u003eAbstract: Large language models (LLMs) increasingly issue judgments read as binary verdicts, and a growing literature reports such judgments shifting under logi…\u003c/li\u003e\n\u003cli\u003eA single framing cannot say what such a shift is: in a yes/no question the word \u0026ldquo;no\u0026rdquo; is at once logical verdict, lexical token, and last-printed option\u003c/li\u003e\n\u003cli\u003eWe introduce a psychometric battery that separates these: crossed symmetrization - every logically irrelevant factor flipped in balanced pairs - across a corpus…\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003e\n\u003cp\u003e\u003cstrong\u003e\u003ca href=\"https://arxiv.org/abs/2607.05554\"  class=\"external-link\" target=\"_blank\" rel=\"noopener\"\u003ePrompt Robustness Is Task-Dependent: Comparing Objective and Belief-Style Questions in LLM Evaluation\u003c/a\u003e\u003c/strong\u003e\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e发布时间:2026-07-08 12:00 北京时间\u003c/li\u003e\n\u003cli\u003e摘要:- arXiv:2607.05554v1 公告类型：新。\n\u003cul\u003e\n\u003cli\u003e摘要：大型语言模型的调查式评估通常将提示响应视为模型价值观或信念的衡量标准。\u003c/li\u003e\n\u003cli\u003e当回应被视为政治价值观、社会态度或信仰的证据时，这种假设尤其脆弱。\u003c/li\u003e\n\u003cli\u003e我们询问具有固定答案的客观问题和询问意见或价值观的主观问题之间的即时鲁棒性是否不同。\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003eEN 要点:\n\u003cul\u003e\n\u003cli\u003earXiv:2607.05554v1 Announce Type: new\u003c/li\u003e\n\u003cli\u003eAbstract: Survey-style evaluations of large language models often treat a prompted response as a measure of a model\u0026rsquo;s values or beliefs\u003c/li\u003e\n\u003cli\u003eThis assumption is particularly fragile when responses are read as evidence of political values, social attitudes, or beliefs\u003c/li\u003e\n\u003cli\u003eWe ask whether prompt robustness differs between objective questions with fixed answers and subjective questions that ask for opinions or values\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003e\n\u003cp\u003e\u003cstrong\u003e\u003ca href=\"https://arxiv.org/abs/2607.05583\"  class=\"external-link\" target=\"_blank\" rel=\"noopener\"\u003eResonatorLM: Causal Resonant Field Mixing for Efficient Long-Context Language Modelin\u003c/a\u003e\u003c/strong\u003e\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e发布时间:2026-07-08 12:00 北京时间\u003c/li\u003e\n\u003cli\u003e摘要:- arXiv:2607.05583v1 公告类型：新。\n\u003cul\u003e\n\u003cli\u003e摘要：当代语言模型以 Transformer 架构为主，它利用自注意力机制来实现跨广泛文档和语料库的更高效、并行的训练。\u003c/li\u003e\n\u003cli\u003e这使得转换器能够跨各种模式和上下文有效地对数据进行建模。\u003c/li\u003e\n\u003cli\u003e然而，Transformer 以及它们的传统对应物（例如循环神经网络 (RNN) 和卷积神经网络 (CNN)）在处理长上下文时通常难以保持效率。\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003eEN 要点:\n\u003cul\u003e\n\u003cli\u003earXiv:2607.05583v1 Announce Type: new\u003c/li\u003e\n\u003cli\u003eAbstract: Contemporary language models are dominated by the transformer architecture, which leverages self-attention mechanisms to enable more efficient, parall…\u003c/li\u003e\n\u003cli\u003eThis has allowed transformers to effectively model data across a wide range of modalities and contexts\u003c/li\u003e\n\u003cli\u003eHowever, transformers, along with their conventional counterparts such as recurrent neural networks (RNNs) and convolutional neural networks (CNNs), often strug…\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003e\n\u003cp\u003e\u003cstrong\u003e\u003ca href=\"https://arxiv.org/abs/2607.05612\"  class=\"external-link\" target=\"_blank\" rel=\"noopener\"\u003eRevisiting the Relation Between Language Model Perplexity and ASR Word Error Rate for Modern End-to-End Speech Recognition\u003c/a\u003e\u003c/strong\u003e\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e发布时间:2026-07-08 12:00 北京时间\u003c/li\u003e\n\u003cli\u003e摘要:- arXiv:2607.05612v1 公告类型：新。\n\u003cul\u003e\n\u003cli\u003e摘要：语言模型 (LM) 困惑度 (PPL) 历来被用作自动语音识别 (ASR) 单词错误率 (WER) 的代理，先前的工作报告了对数空间中的近似线性关系。\u003c/li\u003e\n\u003cli\u003e现代端到端 ASR 系统挑战了这一假设，因为它们已经包含内部语言建模能力，通常无需外部语言模型即可进行评估，并且现在可以通过不同的识别策略与神经 LM 和大型语言模型 (LLM) 相结合。\u003c/li\u003e\n\u003cli\u003e本文重新审视现代 ASR 系统的 PPL 和 WER 之间的关系。\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003eEN 要点:\n\u003cul\u003e\n\u003cli\u003earXiv:2607.05612v1 Announce Type: new\u003c/li\u003e\n\u003cli\u003eAbstract: Language model (LM) perplexity (PPL) has historically been used as a proxy for automatic speech recognition (ASR) word error rate (WER), with prior wo…\u003c/li\u003e\n\u003cli\u003eModern end-to-end ASR systems challenge this assumption because they already contain internal language modeling capacity, are often evaluated without external l…\u003c/li\u003e\n\u003cli\u003eThis paper revisits the relation between PPL and WER for modern ASR systems\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003e\n\u003cp\u003e\u003cstrong\u003e\u003ca href=\"https://arxiv.org/abs/2607.05614\"  class=\"external-link\" target=\"_blank\" rel=\"noopener\"\u003eBaFCo: A Document Understanding Benchmark for Complex Bangla Form Comprehension\u003c/a\u003e\u003c/strong\u003e\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e发布时间:2026-07-08 12:00 北京时间\u003c/li\u003e\n\u003cli\u003e摘要:- arXiv:2607.05614v1 公告类型：新。\n\u003cul\u003e\n\u003cli\u003e摘要：对于多模态大型语言模型来说，文档理解是一项具有挑战性但影响深远的任务，特别是当这些系统在现实世界、以人为中心的应用程序中得到越来越多的采用时。\u003c/li\u003e\n\u003cli\u003e然而，由于缺乏高质量的注释数据，这种采用仅限于孟加拉语等资源匮乏的语言。\u003c/li\u003e\n\u003cli\u003e为了解决这一差距，我们引入了 BaFCo，这是一个孟加拉语形式理解的基准数据集，重点关注文档布局分析 (DLA) 和关键信息提取 (KIE)。\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003eEN 要点:\n\u003cul\u003e\n\u003cli\u003earXiv:2607.05614v1 Announce Type: new\u003c/li\u003e\n\u003cli\u003eAbstract: Document comprehension is a challenging yet impactful task for Multimodal Large Language Models, especially as these systems see growing adoption in r…\u003c/li\u003e\n\u003cli\u003eHowever, this adoption is limited for low-resource languages such as Bangla due to the scarcity of high-quality annotated data\u003c/li\u003e\n\u003cli\u003eTo address this gap, we introduce BaFCo, a benchmark dataset for Bangla form comprehension with a focus on Document Layout Analysis (DLA) and Key Information Ex…\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003e\n\u003cp\u003e\u003cstrong\u003e\u003ca href=\"https://arxiv.org/abs/2607.05623\"  class=\"external-link\" target=\"_blank\" rel=\"noopener\"\u003eNAVER LABS System Re-implementation for the IWSLT 2026 Instruction-Following Task\u003c/a\u003e\u003c/strong\u003e\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e发布时间:2026-07-08 12:00 北京时间\u003c/li\u003e\n\u003cli\u003e摘要:- arXiv:2607.05623v1 公告类型：新。\n\u003cul\u003e\n\u003cli\u003e摘要：我们为 IWSLT 2026 共享任务（约束条件、短音轨）重新实现了 NAVER LABS IWSLT 2025 指令跟踪管道，使其适应强制组件：SeamlessM4T-v2-large 作为语音编码器，Qwen3-4B-Instruct 作为 LLM 主干。\u003c/li\u003e\n\u003cli\u003e原始设计中保留了三阶段方法投影仪对齐、纯文本 LoRA 预训练和多模式合并。\u003c/li\u003e\n\u003cli\u003e我们还从提供的语料库中构建了 100k 个合成指令跟踪示例，涵盖 10 个以语音为中心的任务类型（每个任务 10k 个），适合进一步的第 3 阶段微调。\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003eEN 要点:\n\u003cul\u003e\n\u003cli\u003earXiv:2607.05623v1 Announce Type: new\u003c/li\u003e\n\u003cli\u003eAbstract: We re-implement the NAVER LABS IWSLT 2025 instruction-following pipeline for the IWSLT 2026 Shared Task (constrained condition, short audio track), ad…\u003c/li\u003e\n\u003cli\u003eThe three-stage approach projector alignment, text-only LoRA pre-training, and multimodal merging is preserved from the original design\u003c/li\u003e\n\u003cli\u003eWe additionally construct 100k synthetic instruction-following examples across ten speech-centric task types (10k per task) from the provided corpora, suitable…\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003c/ul\u003e\n\u003ch3 id=\"arxiv-cslg-b_introsearch\"\u003e\n  ArXiv cs.LG (B_intro+search)\n  \u003ca class=\"heading-link\" href=\"#arxiv-cslg-b_introsearch\"\u003e\n    \u003ci class=\"fa-solid fa-link\" aria-hidden=\"true\" title=\"链接到标题\"\u003e\u003c/i\u003e\n    \u003cspan class=\"sr-only\"\u003e链接到标题\u003c/span\u003e\n  \u003c/a\u003e\n\u003c/h3\u003e\n\u003cul\u003e\n\u003cli\u003e\n\u003cp\u003e\u003cstrong\u003e\u003ca href=\"https://arxiv.org/abs/2607.05436\"  class=\"external-link\" target=\"_blank\" rel=\"noopener\"\u003eStatistically Meaningful Geometry and Gauge Symmetry Breaking: A Geometric Foundation for Scientific Discovery and Intelligence Emergence\u003c/a\u003e\u003c/strong\u003e\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e发布时间:2026-07-08 12:00 北京时间\u003c/li\u003e\n\u003cli\u003e摘要:- arXiv:2607.05436v1 公告类型：新。\n\u003cul\u003e\n\u003cli\u003e摘要：过度参数化的机器学习架构（尤其是法学硕士）的快速扩展引发了一场深刻的危机：这些系统是否表现出真正的智能，或者它们仅仅是复杂的统计模式匹配器？\u003c/li\u003e\n\u003cli\u003e经典的平面欧几里得统计无法区分连续插值和新因果律的自主发现。\u003c/li\u003e\n\u003cli\u003e为了解决这个问题，我们引入了统计有意义的几何（SMG），这是一个将过度参数化学习系统建模为无限维非参数 Orlicz 纤维束的框架。\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003eEN 要点:\n\u003cul\u003e\n\u003cli\u003earXiv:2607.05436v1 Announce Type: new\u003c/li\u003e\n\u003cli\u003eAbstract: The rapid scaling of over-parameterized machine learning architectures, particularly LLMs, raises a profound crisis: do these systems exhibit genuine…\u003c/li\u003e\n\u003cli\u003eClassical flat Euclidean statistics cannot differentiate continuous interpolation from the autonomous discovery of novel causal laws\u003c/li\u003e\n\u003cli\u003eTo resolve this, we introduce Statistically Meaningful Geometry (SMG), a framework modeling over-parameterized learning systems as infinite-dimensional non-para…\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003e\n\u003cp\u003e\u003cstrong\u003e\u003ca href=\"https://arxiv.org/abs/2607.05439\"  class=\"external-link\" target=\"_blank\" rel=\"noopener\"\u003eDesign-CP: Context Parallelism for Design of Protein Nanoparticles\u003c/a\u003e\u003c/strong\u003e\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e发布时间:2026-07-08 12:00 北京时间\u003c/li\u003e\n\u003cli\u003e摘要:- arXiv:2607.05439v1 公告类型：新。\n\u003cul\u003e\n\u003cli\u003e摘要：许多全原子生成蛋白质模型原则上可以通过对所有链进行联合建模来设计大型多聚体复合物，但随着建模的链和残基数量的增长，它们的二次标记和原子对表示很快就会超过单 GPU 内存。\u003c/li\u003e\n\u003cli\u003e我们引入 Design-CP，这是 RFdiffusion 3 的两种上下文并行 (CP) 推理策略（1D 行分片和带环注意力的 2D 网格分片），可在多 GPU 网格上分配二次激活，同时保留预训练的权重。\u003c/li\u003e\n\u003cli\u003e我们在对二十面体组件进行采样时表征了它们的缩放，表明最大可行的不对称子单元 (ASU) 大小随着 GPU 数量的预期平方根趋势而增长，并且 2D 分片实现了更好的挂钟缩放。\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003eEN 要点:\n\u003cul\u003e\n\u003cli\u003earXiv:2607.05439v1 Announce Type: new\u003c/li\u003e\n\u003cli\u003eAbstract: Many all-atom generative protein models can in principle design large multimeric complexes by jointly modelling all chains, but their quadratic token-…\u003c/li\u003e\n\u003cli\u003eWe introduce Design-CP, two context-parallel (CP) inference strategies for RFdiffusion 3 (1D row-sharding and 2D grid sharding with ring attention) that distrib…\u003c/li\u003e\n\u003cli\u003eWe characterise their scaling when sampling icosahedral assemblies, showing that the maximum feasible asymmetric subunit (ASU) size grows with the expected squa…\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003e\n\u003cp\u003e\u003cstrong\u003e\u003ca href=\"https://arxiv.org/abs/2607.05449\"  class=\"external-link\" target=\"_blank\" rel=\"noopener\"\u003eGeometry-Aware Infrastructure-Anchored Denoiser for UWB Sensing and Work-Zone Reconstruction\u003c/a\u003e\u003c/strong\u003e\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e发布时间:2026-07-08 12:00 北京时间\u003c/li\u003e\n\u003cli\u003e摘要:- arXiv:2607.05449v1 公告类型：新。\n\u003cul\u003e\n\u003cli\u003e摘要：准确的工作区几何感知对于智能交通系统至关重要，超宽带传感为基础设施辅助重建提供了一种低成本方法。\u003c/li\u003e\n\u003cli\u003e然而，室外 UWB 测距通常会因非视距传播、突发噪声和长尾误差而降低性能，这可能会扭曲下游空间重建。\u003c/li\u003e\n\u003cli\u003e我们提出了 GAIA，一种几何感知、基础设施锚定的学习框架，它将时间范围建模与潜在锚点布局估计和确定性距离投影结合起来。\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003eEN 要点:\n\u003cul\u003e\n\u003cli\u003earXiv:2607.05449v1 Announce Type: new\u003c/li\u003e\n\u003cli\u003eAbstract: Accurate work-zone geometry perception is critical for intelligent transportation systems, and ultra-wideband sensing offers a low-cost approach for i…\u003c/li\u003e\n\u003cli\u003eHowever, outdoor UWB ranging is often degraded by non-line-of-sight propagation, burst noise, and long-tail errors, which can distort downstream spatial reconst…\u003c/li\u003e\n\u003cli\u003eWe present GAIA, a geometry-aware, infrastructure-anchored learning framework that couples temporal range modeling with latent anchor-layout estimation and dete…\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003e\n\u003cp\u003e\u003cstrong\u003e\u003ca href=\"https://arxiv.org/abs/2607.05450\"  class=\"external-link\" target=\"_blank\" rel=\"noopener\"\u003eThe Granularity Paradox: How Temporal Disaggregation Inflates In-Sample Fit and Compounds Out-of-Sample Error\u003c/a\u003e\u003c/strong\u003e\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e发布时间:2026-07-08 12:00 北京时间\u003c/li\u003e\n\u003cli\u003e摘要:- arXiv:2607.05450v1 公告类型：新。\n\u003cul\u003e\n\u003cli\u003e摘要：本文探讨了时间序列预测中的“粒度悖论”，其中更精细的时间分解（例如，每月到每周/每日）改善了样本内诊断和数据集大小 (N)，但由于较长时间范围内的递归误差复合而降低了样本外准确性 (H)。\u003c/li\u003e\n\u003cli\u003e相反，粗聚合（每年）消除了递归错误传播，但减少了估算器可用的数据。\u003c/li\u003e\n\u003cli\u003e我们使用 13 年的公共采购数据集，在六个粒度上正式确定了这种权衡和基准测试 10 个模型 - 涵盖朴素、统计、机器学习和深度学习架构。\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003eEN 要点:\n\u003cul\u003e\n\u003cli\u003earXiv:2607.05450v1 Announce Type: new\u003c/li\u003e\n\u003cli\u003eAbstract: This paper explores the \u0026ldquo;Granularity Paradox\u0026rdquo; in time-series forecasting, wherein finer temporal disaggregation (e.g., Monthly to Weekly/Daily) improv…\u003c/li\u003e\n\u003cli\u003eConversely, coarse aggregation (Annual) eliminates recursive error propagation but reduces data available to estimators\u003c/li\u003e\n\u003cli\u003eWe formalize this trade-off and benchmark 10 models - spanning na\u0026quot;ive, statistical, machine learning, and deep learning architectures - across six granularitie…\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003e\n\u003cp\u003e\u003cstrong\u003e\u003ca href=\"https://arxiv.org/abs/2607.05452\"  class=\"external-link\" target=\"_blank\" rel=\"noopener\"\u003eExogenous Dropout: A Simple, Strong Baseline for Corruption-Robust Time Series Forecasting with Covariates\u003c/a\u003e\u003c/strong\u003e\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e发布时间:2026-07-08 12:00 北京时间\u003c/li\u003e\n\u003cli\u003e摘要:- arXiv:2607.05452v1 公告类型：新。\n\u003cul\u003e\n\u003cli\u003e摘要：使用外源协变量的时间序列预测器在部署中很脆弱：当这些协变量受到噪声、时间错位或缺失时，强外源融合和外源适应模型的性能可能会远远低于纯内源下限。\u003c/li\u003e\n\u003cli\u003e我们研究这种鲁棒性是否需要专门的架构，或者是否可以通过简单的训练干预来获得。\u003c/li\u003e\n\u003cli\u003e我们提出外源dropout，一种与模型无关的方法，在训练期间随机将整个外源通道归零。\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003eEN 要点:\n\u003cul\u003e\n\u003cli\u003earXiv:2607.05452v1 Announce Type: new\u003c/li\u003e\n\u003cli\u003eAbstract: Time series forecasters that use exogenous covariates are fragile in deployment: when those covariates are noised, temporally misaligned, or missing,…\u003c/li\u003e\n\u003cli\u003eWe study whether such robustness requires specialized architectures, or whether it can be obtained through a simple training intervention\u003c/li\u003e\n\u003cli\u003eWe propose exogenous dropout, a model-agnostic method that randomly zeros whole exogenous channels during training\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003e\n\u003cp\u003e\u003cstrong\u003e\u003ca href=\"https://arxiv.org/abs/2607.05457\"  class=\"external-link\" target=\"_blank\" rel=\"noopener\"\u003eEmpirical Minimal-Realisation Compression of Deep Neural Networks via Controllability-Observability Tests\u003c/a\u003e\u003c/strong\u003e\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e发布时间:2026-07-08 12:00 北京时间\u003c/li\u003e\n\u003cli\u003e摘要:- arXiv:2607.05457v1 公告类型：新。\n\u003cul\u003e\n\u003cli\u003e摘要：深度神经网络通常包含大量隐藏状态冗余，但大多数压缩方法直接对权重、神经元或量化表示进行操作，而没有明确表征内部状态的动态作用。\u003c/li\u003e\n\u003cli\u003e本文提出了一种用于深度神经网络经验状态阶约化的可控性-可观察性框架。\u003c/li\u003e\n\u003cli\u003e通过将经过训练的网络视为深度索引的非线性动力系统，我们从隐藏状态快照和输出雅可比行列式构建数据驱动的可达性、可观测性和平衡格拉玛矩阵。\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003eEN 要点:\n\u003cul\u003e\n\u003cli\u003earXiv:2607.05457v1 Announce Type: new\u003c/li\u003e\n\u003cli\u003eAbstract: Deep neural networks often contain substantial hidden-state redundancy, but most compression methods operate directly on weights, neurons, or quantise…\u003c/li\u003e\n\u003cli\u003eThis paper proposes a controllability-observability framework for empirical state-order reduction of deep neural networks\u003c/li\u003e\n\u003cli\u003eBy viewing a trained network as a depth-indexed nonlinear dynamical system, we construct data-driven reachability, observability, and balanced Gramians from hid…\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003e\n\u003cp\u003e\u003cstrong\u003e\u003ca href=\"https://arxiv.org/abs/2607.05458\"  class=\"external-link\" target=\"_blank\" rel=\"noopener\"\u003eLearning to Control LLM Agent Harnesses with Offline Reinforcement Learning\u003c/a\u003e\u003c/strong\u003e\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e发布时间:2026-07-08 12:00 北京时间\u003c/li\u003e\n\u003cli\u003e摘要:- arXiv:2607.05458v1 公告类型：新。\n\u003cul\u003e\n\u003cli\u003e摘要：大型语言模型（LLM）代理通常通过更改提示、模型或手写工作流程来改进，而模型周围的执行工具则被视为固定的基础设施。\u003c/li\u003e\n\u003cli\u003e我们认为这个工具本身就是一个可学习的控制层。\u003c/li\u003e\n\u003cli\u003e我们将线束操作形式化为有限范围线束 MDP，其中轻量级控制器选择结构执行操作，而 LLM 执行器保持冻结状态。\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003eEN 要点:\n\u003cul\u003e\n\u003cli\u003earXiv:2607.05458v1 Announce Type: new\u003c/li\u003e\n\u003cli\u003eAbstract: Large language model (LLM) agents are usually improved by changing prompts, models, or hand-written workflows, while the execution harness around the…\u003c/li\u003e\n\u003cli\u003eWe argue that this harness is itself a learnable control layer\u003c/li\u003e\n\u003cli\u003eWe formalize harness operation as a finite-horizon Harness MDP, where a lightweight controller selects structural execution actions while the LLM executor remai…\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003e\n\u003cp\u003e\u003cstrong\u003e\u003ca href=\"https://arxiv.org/abs/2607.05461\"  class=\"external-link\" target=\"_blank\" rel=\"noopener\"\u003eAdaStop: Cost-Aware Early Stopping for DNN Test Selection\u003c/a\u003e\u003c/strong\u003e\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e发布时间:2026-07-08 12:00 北京时间\u003c/li\u003e\n\u003cli\u003e摘要:- arXiv:2607.05461v1 公告类型：新。\n-摘要：用于测试深度神经网络（DNN）的现有方法主要优先考虑可能在固定标签预算下揭示模型故障的测试输入。\n\u003cul\u003e\n\u003cli\u003e实际上，选择预算很困难：测试太少会错过失败，而太多则会产生不必要的标签成本。\u003c/li\u003e\n\u003cli\u003e这项工作研究了 DNN 测试中的停止问题。\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003eEN 要点:\n\u003cul\u003e\n\u003cli\u003earXiv:2607.05461v1 Announce Type: new\u003c/li\u003e\n\u003cli\u003eAbstract: Existing methods for testing deep neural networks (DNNs) primarily prioritize test inputs likely to reveal model faults under a fixed labeling budget\u003c/li\u003e\n\u003cli\u003eIn practice, choosing that budget is difficult: too little testing misses failures, while too much incurs unnecessary labeling costs\u003c/li\u003e\n\u003cli\u003eThis work studies the stopping problem in DNN testing\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003e\n\u003cp\u003e\u003cstrong\u003e\u003ca href=\"https://arxiv.org/abs/2607.05464\"  class=\"external-link\" target=\"_blank\" rel=\"noopener\"\u003eLearnable Weighting of Intra-Attribute Distances for Categorical Data Clustering with Nominal and Ordinal Attributes\u003c/a\u003e\u003c/strong\u003e\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e发布时间:2026-07-08 12:00 北京时间\u003c/li\u003e\n\u003cli\u003e摘要:- arXiv:2607.05464v1 公告类型：新。\n\u003cul\u003e\n\u003cli\u003e摘要：分类数据聚类的成功通常很大程度上依赖于测量两个对象之间的不相似程度的距离度量。\u003c/li\u003e\n\u003cli\u003e然而，大多数现有的聚类方法都处理两种分类子类型，即\u003c/li\u003e\n\u003cli\u003e名义属性和序数属性，在计算相异性时以相同的方式，而不考虑序数值的相对顺序信息。\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003eEN 要点:\n\u003cul\u003e\n\u003cli\u003earXiv:2607.05464v1 Announce Type: new\u003c/li\u003e\n\u003cli\u003eAbstract: The success of categorical data clustering generally much relies on the distance metric that measures the dissimilarity degree between two objects\u003c/li\u003e\n\u003cli\u003eHowever, most of the existing clustering methods treat the two categorical subtypes, i.e\u003c/li\u003e\n\u003cli\u003enominal and ordinal attributes, in the same way when calculating the dissimilarity without considering the relative order information of the ordinal values\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003e\n\u003cp\u003e\u003cstrong\u003e\u003ca href=\"https://arxiv.org/abs/2607.05469\"  class=\"external-link\" target=\"_blank\" rel=\"noopener\"\u003eBreaking Structural Isolation: Scalable Graph Clustering via Community-Aware Sampling and Structural Entropy\u003c/a\u003e\u003c/strong\u003e\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e发布时间:2026-07-08 12:00 北京时间\u003c/li\u003e\n\u003cli\u003e摘要:- arXiv:2607.05469v1 公告类型：新。\n\u003cul\u003e\n\u003cli\u003e摘要：无监督图聚类是揭示大规模网络中底层语义模式的基本技术。\u003c/li\u003e\n\u003cli\u003e尽管图对比学习表现出了良好的性能，但现有方法在小批量训练期间经常遇到“结构隔离”问题，这使得捕获表征全局拓扑分布的内聚社区结构具有挑战性。\u003c/li\u003e\n\u003cli\u003e为了应对这些挑战，我们提出 SCISE，这是一种可扩展的无监督图聚类框架，通过将社区感知采样与约束结构熵相结合来保持结构完整性。\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003cli\u003eEN 要点:\n\u003cul\u003e\n\u003cli\u003earXiv:2607.05469v1 Announce Type: new\u003c/li\u003e\n\u003cli\u003eAbstract: Unsupervised graph clustering is a fundamental technique for uncovering underlying semantic patterns in large-scale networks\u003c/li\u003e\n\u003cli\u003eAlthough Graph Contrastive Learning has demonstrated promising performance, existing methods often suffer from the \u0026ldquo;structural isolation\u0026rdquo; issue during mini-batc…\u003c/li\u003e\n\u003cli\u003eTo address these challenges, we propose SCISE, a Scalable unsupervised graph Clustering framework that preserves structural Integrity by synergizing community-a…\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003c/ul\u003e\n\u003c/li\u003e\n\u003c/ul\u003e\n",
  "wordCount": 3558,
  "readingTime": 17,
  "tableOfContents": "\u003cnav id=\"TableOfContents\"\u003e\n  \u003cul\u003e\n    \u003cli\u003e\u003ca href=\"#-本期-watch-list-深度导读\"\u003e📖 本期 Watch List 深度导读\u003c/a\u003e\u003c/li\u003e\n    \u003cli\u003e\u003ca href=\"#-x-平台-ai-热点快讯\"\u003e🌐 X 平台 AI 热点快讯\u003c/a\u003e\n      \u003cul\u003e\n        \u003cli\u003e\u003ca href=\"#话题-1anthropic-extends-claude-fable-5-access-through-july-12\"\u003e话题 1:Anthropic Extends Claude Fable 5 Access Through July 12\u003c/a\u003e\u003c/li\u003e\n        \u003cli\u003e\u003ca href=\"#话题-2openai-launches-gpt-56-models-sol-terra-and-luna-after-government-clearance\"\u003e话题 2:OpenAI Launches GPT-5.6 Models Sol, Terra, and Luna After Government Clearance\u003c/a\u003e\u003c/li\u003e\n        \u003cli\u003e\u003ca href=\"#话题-3anthropic-shares-cost-saving-claude-fable-5-agent-tips\"\u003e话题 3:Anthropic Shares Cost-Saving Claude Fable 5 Agent Tips\u003c/a\u003e\u003c/li\u003e\n        \u003cli\u003e\u003ca href=\"#话题-4xai-rebrands-as-spacexai-after-spacex-acquisition\"\u003e话题 4:xAI Rebrands as SpaceXAI After SpaceX Acquisition\u003c/a\u003e\u003c/li\u003e\n        \u003cli\u003e\u003ca href=\"#话题-5google-ai-studio-adds-one-click-github-import-for-faster-app-building\"\u003e话题 5:Google AI Studio Adds One-Click GitHub Import for Faster App Building\u003c/a\u003e\u003c/li\u003e\n        \u003cli\u003e\u003ca href=\"#话题-6teslas-2025-impact-report-details-cybercab-and-emission-wins\"\u003e话题 6:Tesla\u0026rsquo;s 2025 Impact Report Details Cybercab and Emission Wins\u003c/a\u003e\u003c/li\u003e\n      \u003c/ul\u003e\n    \u003c/li\u003e\n    \u003cli\u003e\u003ca href=\"#-大佬观点influencer-insights\"\u003e💡 大佬观点(Influencer Insights)\u003c/a\u003e\n      \u003cul\u003e\n        \u003cli\u003e\u003ca href=\"#1-今日核心技术与产品热点\"\u003e1. 今日核心技术与产品热点\u003c/a\u003e\u003c/li\u003e\n        \u003cli\u003e\u003ca href=\"#2-值得注意的独特观点与行业前瞻\"\u003e2. 值得注意的独特观点与行业前瞻\u003c/a\u003e\u003c/li\u003e\n        \u003cli\u003e\u003ca href=\"#3-推荐的工具与资源\"\u003e3. 推荐的工具与资源\u003c/a\u003e\u003c/li\u003e\n      \u003c/ul\u003e\n    \u003c/li\u003e\n    \u003cli\u003e\u003ca href=\"#-附录今日-watch-list-更新源列表\"\u003e📚 附录:今日 Watch List 更新源列表\u003c/a\u003e\n      \u003cul\u003e\n        \u003cli\u003e\u003ca href=\"#stratechery-by-ben-thompson-a_full\"\u003eStratechery by Ben Thompson (A_full)\u003c/a\u003e\u003c/li\u003e\n        \u003cli\u003e\u003ca href=\"#openai-blog-a_full\"\u003eOpenAI Blog (A_full)\u003c/a\u003e\u003c/li\u003e\n        \u003cli\u003e\u003ca href=\"#arxiv-csai-b_introsearch\"\u003eArXiv cs.AI (B_intro+search)\u003c/a\u003e\u003c/li\u003e\n        \u003cli\u003e\u003ca href=\"#arxiv-cscl-b_introsearch\"\u003eArXiv cs.CL (B_intro+search)\u003c/a\u003e\u003c/li\u003e\n        \u003cli\u003e\u003ca href=\"#arxiv-cslg-b_introsearch\"\u003eArXiv cs.LG (B_intro+search)\u003c/a\u003e\u003c/li\u003e\n      \u003c/ul\u003e\n    \u003c/li\u003e\n  \u003c/ul\u003e\n\u003c/nav\u003e",
  "isDraft": false
}
