🤖 AI 速览

今日 AI 动态聚焦软硬一体化深度博弈。OpenAI 芯片核心人才流向 Anthropic,凸显大模型厂商对算力自主权的争夺;Google 发布 Gemma 4,标志着端侧模型进入原生量化训练(QAT)新阶段。此外,开发范式正经历从代码驱动向意图驱动的“氛围编程”转型,具备独立协作能力的“AI 同事”模式已初见雏形。
📋 文章元数据
发布时间
2026-06-07
类型
ai-daily
字数
1713
阅读时长
9 min

2026-06-07 AI日更 | 硬件人才战升级与端侧 AI 爆发:Gemma 4 开启原生量化时代 链接到标题

今日 AI 动态聚焦软硬一体化深度博弈。OpenAI 芯片核心人才流向 Anthropic,凸显大模型厂商对算力自主权的争夺;Google 发布 Gemma 4,标志着端侧模型进入原生量化训练(QAT)新阶段。此外,开发范式正经历从代码驱动向意图驱动的“氛围编程”转型,具备独立协作能力的“AI 同事”模式已初见雏形。

📖 本期 Watch List 深度导读 链接到标题

今天的技术动态聚焦于智能体(Agents)从“对话框”向“复杂系统”的深度演进。首先推荐关注多智能体协作与长效监控:arXiv 新出的《What Should Agents Say?》直击多智能体系统(MAS)中 Token 膨胀与上下文污染的痛点,提出了更高效的通信策略;而 SentinelBench 则填补了长时运行监控智能体评测的空白,这对构建工业级 Agent 具有极高的工程参考价值。

其次,关于 LLM 的信任边界与评测鲁棒性值得警惕。Reddit 秘密实验的复盘揭示了隐蔽智能体在真实社交环境中的说服力风险与伦理挑战;同时,《Stability vs. Manipulability》深度质疑了目前主流的“LLM 作为法官”模式,证明其评估结果在交互下并不稳定,开发者需重新审视自动化评测的可靠性。

最后,在垂直领域应用上,从理解新兴“梗”知识的零样本框架,到科学数据的高保真压缩,AI 正在向更细分、更专业的长尾场景渗透。宏观层面,All-In 峰会关于科技巨头 IPO 回归的讨论,也为处于规模化阶段的 AI 初创公司释放了关键的市场复苏信号。

🌐 X 平台 AI 热点快讯 链接到标题

话题 1:OpenAI Chip Leader Clive Chan Joins Anthropic 链接到标题

  • 分类:AI · News
  • 概况:热度时间:,相关帖子数:259
  • 是什么事:OpenAI 芯片团队负责人 Clive Chan 宣布离职并加入竞争对手 Anthropic。
  • 为什么重要:这标志着顶级 AI 实验室在底层硬件和定制芯片领域的竞争加剧,硬件自研与优化能力已成为大模型竞赛的核心护城河。
  • 讨论概况:讨论集中在 OpenAI 硬件项目的潜在进展压力,以及 Anthropic 通过挖角核心人才来强化其算力基础设施自主权的战略意图。

话题 2:Y Combinator Launches Paxel to Analyze AI Coding Habits 链接到标题

  • 分类:AI · Other
  • 概况:热度时间:20 hours ago,相关帖子数:1000
  • 是什么事:Y Combinator 推出名为 Paxel 的新工具,旨在深入分析开发者在使用 AI 编程助手时的行为模式与习惯。
  • 为什么重要:随着 AI 编程工具的普及,量化 AI 对开发流程和生产力的实际影响成为优化软件工程效率的关键环节。
  • 讨论概况:社交媒体上的讨论集中在 Paxel 如何在数据隐私与效率监控之间取得平衡,以及它是否能提供比现有遥测工具更深层的洞察。

话题 3:Claude Users Share Tips to Build Powerful Coding Agents 链接到标题

  • 分类:AI · News
  • 概况:热度时间:13 hours ago,相关帖子数:1300
  • 是什么事:Claude 用户与开发者热议通过 INFINIT 等 AI 代理工具将自然语言指令直接转化为 Solidity 智能合约,实现 DeFi 开发的高度抽象化。
  • 为什么重要:这标志着 AI 编程从简单的代码补全演进为“意图驱动”的自主代理模式,通过屏蔽底层复杂技术栈,极大地降低了高门槛领域的开发成本与周期。
  • 讨论概况:讨论焦点在于 AI 抽象化带来的效率飞跃(如开发提速 10 倍)与潜在安全风险之间的权衡,以及这种“去代码化”趋势是否会削弱开发者对底层逻辑的掌控力。

话题 4:Google’s Memory Caching Revives RNNs for Long AI Sequences 链接到标题

  • 分类:AI · News
  • 概况:热度时间:,相关帖子数:200
  • 是什么事:Google 研究人员通过引入新型内存缓存机制,显著提升了循环神经网络(RNN)处理超长序列的能力。
  • 为什么重要:该技术突破了 RNN 的长期记忆瓶颈,为长文本处理提供了一种比 Transformer 架构更高效、内存占用更低的潜在替代方案。
  • 讨论概况:舆论焦点在于这是否预示着 RNN 的回归,以及该技术与 Mamba 等新兴状态空间模型(SSM)在效率和扩展性上的优劣对比。

话题 5:Builders Share Vibe Coding Projects After Google AI Prompt 链接到标题

  • 分类:AI · News
  • 概况:热度时间:3 hours ago,相关帖子数:960
  • 是什么事:在 Google AI 提示词工具的启发下,大量开发者在 X 上展示了通过“氛围编程”(Vibe Coding,即纯自然语言描述意图而非手写代码)快速构建的项目。
  • 为什么重要:这一趋势标志着软件开发范式正在从语法驱动向意图驱动转变,验证了生成式 AI 在降低编程门槛和极速原型开发方面的实战能力。
  • 讨论概况:社区讨论集中于“氛围编程”是否会导致代码质量下降、它对传统初级工程师岗位的冲击,以及这种开发模式在处理复杂逻辑时的局限性。

话题 6:Higgsfield AI Mod Lets Minecraft Players Summon Cities with One Prompt 链接到标题

  • 分类:AI · News
  • 概况:热度时间:22 hours ago,相关帖子数:717
  • 是什么事:Higgsfield AI 发布了一款 Minecraft 模组,允许玩家通过单一文本提示词在游戏中瞬间生成完整的城市。
  • 为什么重要:该进展展示了生成式 AI 在实时交互式 3D 环境中的应用潜力,标志着游戏内容创作正从手动建模向 AI 自动化构建演进。
  • 讨论概况:讨论焦点在于 AI 生成规模的震撼性、对传统玩家手动建造乐趣的影响,以及该技术未来在专业游戏开发流程中的应用前景。

今日 X 上的 AI 舆情小结 链接到标题

今日 AI 舆论主线聚焦于从底层硬件人才争夺到应用层“意图驱动”开发范式的全方位演进,标志着大模型竞赛已进入软硬一体化优化的深水区。行业共识在于 AI 代理正通过高度抽象化极大地降低编程与内容创作门槛,但在技术路径上,关于 RNN 架构回归的潜力以及 AI 监控工具对隐私的影响仍存在显著分歧。舆论普遍担忧“氛围编程”等去代码化趋势可能导致代码质量下降及安全漏洞,特别是在 DeFi 等高风险领域,开发者对底层逻辑掌控力的削弱已成为不容忽视的潜在风险。

💡 大佬观点(Influencer Insights) 链接到标题

AI 行业日报:端侧模型爆发与 Agent 协作范式演进 链接到标题

一、今日核心热点:端侧模型与量化训练技术 链接到标题

1.1 Google Gemma 4 引领端侧模型新阶段 链接到标题

@zhixianio 连续追踪 Google 最新发布的 Gemma 4 12B 多模态模型,该模型采用 encoder-free 架构,可直接在笔记本端运行,Apache 2.0 开源许可。

关键测试发现:

  • 图片识别:OpenClaw 场景下表现良好
  • 音频处理:英语准确度 OK、速度极快;日语表现良好;中文"驴唇不对马嘴"
  • 配合 mlx-vlm + drafter,在 M5 Max 128GB MBP 上运行流畅

“没想到端侧模型的能力已经到这个地步了” — @zhixianio

1.2 QAT(量化感知训练)成为端侧优化新范式 链接到标题

@zhixianio 重点解读 Google 的 Quantization-Aware Training (QAT) 技术:

“既然大家都是要跑量化版本,那一开始我就假定自己一定会被量化,以此为前提来提升训练效果”

这一思路标志着端侧模型从"训练后量化"向"原生量化训练"演进,Android 系统级端侧 AI 落地加速。


二、Agent 协作与编程工具生态 链接到标题

2.1 Codex vs Claude Code:双雄格局形成 链接到标题

@ruanyf 观察到用户迁移趋势:“很多人最近跳船,选择 Codex,评价还不错”

@dotey 对比分析:

  • Claude Desktop 的 Side chat 设计被吐槽"袖珍到无法好好浏览"
  • Claude 4.8 Opus 在设计审美上仍领先 GPT 5.5
  • Codex 设置已多到需搜索功能,但缺乏自然语言交互(“Hey Codex,帮我修改 XX 设置”)

@vista8 分享的 Codex Goal 指令六要素模板 成为实用参考:

/goal [Outcome].
Verification: [commands/artifacts/evidence].
Constraints: [what must not change].
Boundaries: [allowed writes / forbidden paths].
Iteration policy: [one focused change, rerun checks, log progress].
Stop when: [evidence proves completion].
Pause if: [blocked conditions / human decisions / budget cap].

2.2 “AI 同事"协作模式涌现 链接到标题

@Pluvio9yte 分享的 Helio 使用案例引发关注:

“AI 不再是侧边栏的一个小插件,它拥有了独立邮箱和自己的身份档案,就像团队里的一个真正的员工”

核心特征:

  • 4 个 AI 角色(调研员、文案、技术负责人、产品经理)在频道内自主协作
  • AI 间自动纠错:文案 AI 主动指出调研员的数据格式问题
  • Memory 模块自动学习:纠错后自动写入新规则
  • Dream 机制:每日深夜自动复盘更新工作规范

三、独特观点与行业前瞻 链接到标题

3.1 模型能力分化:审美 vs 编程 链接到标题

@vista8@dotey 共同引用的主观审美排名

Claude opus 4.8 > kimi2.6 > GPT 5.5 > Deepseek v4 pro > GLM 5.1 > deepseek v4 flash

@vista8 提出关键疑问:

“为什么 Claude 4.8、GPT 5.5 反而写作能力都不如 Claude 4.6 系列?是因为 Anthropic 和 OpenAI 都 All in Coding 后,训练数据太多倾向于编程带来的问题?”

3.2 Vibe Coding 的重新定义 链接到标题

@dotey 对"氛围编程"概念的修正:

“Vibe Coding 这个名字不好,容易联想成让 AI 生成垃圾代码”

未来程序员角色 = Tech Lead

  • ✅ 分解任务、架构选型、代码审查和调试
  • ❌ 不是"老板角色”:我要什么功能你给我实现

实践建议

  1. 适应指挥 AI 写代码而非亲自写
  2. 用最聪明的模型,不要省钱
  3. 复杂任务先用 Plan mode 讨论清楚设计
  4. 一次不要做太多,生成后必须审查
  5. 刻意做手写代码练习,搞懂 AI 生成的代码

3.3 数据策略:大模型"不怕垃圾" 链接到标题

@vista8 分享的斯坦福大学研究颠覆直觉:

  • 15M 小模型:过滤数据全面领先
  • 330M/1B 大模型:未过滤数据充分训练后超越过滤版本

“小模型怕垃圾,大模型不怕。模型大,秩(参数量)多,就有足够空间把垃圾和有用信息隔离开”


四、推荐工具与资源 链接到标题

4.1 端侧模型与运行框架 链接到标题

工具用途来源
mlx-vlmApple Silicon 本地多模态推理@zhixianio 实测
oMLXSwift 原生 macOS 端侧模型 App@jundotkim v0.4.0 发布
Gemma 4 QAT量化感知训练模型Google 官方
MiniCPM5-1B<2B 最强开源基座模型@OpenBMB

4.2 Agent 与自动化工具 链接到标题

工具功能亮点
Owlia NestPA/Agent 文件浏览与管理Tailscale 内网访问、PWA 支持、Markdown 在线编辑
codex-reset-watchdogCodex 额度监控与自动切换@vista8 分享的 Skill
OpenWikiAI 自动整理收藏内容复制即保存、自动生成知识图谱、MCP 支持
HelioAI 同事协作平台独立邮箱、Memory 学习、Dream 复盘机制

4.3 设计开发工具 链接到标题

工具场景来源
OpenDesign开源设计工具,终结"对齐像素"@vista8 直播讨论,5w+ Star
Claude DesignAI 辅助产品设计@dotey 分享的 36 条心法+技巧
Cursor Design Mode浏览器端 UI 标记与修改@cursor_ai 新功能

4.4 学习资源 链接到标题

  • 《图解 Skill》 — @dotey 开源书籍,GitHub Repo 含全部可复制内容
  • Claude Code Workflow 完整拆解 — @servasyy_ai
  • 30分钟掌握 Codex 97%功能 — @servasyy_ai

五、关键数据与信号 链接到标题

指标数值来源
OpenClaw 创始人月 Token 消耗6030 亿(估值 $130万)@ruanyf
GitHub 代码提交量同比增长14 倍@ruanyf
某出海站点日自然搜索流量11,000+(月省 ¥30万营销费)@gefei55
Hermes Agent Desktop 多语言支持中文、日文完整支持@dotey PR 合并

报告基于 2026年6月6日前后 24 小时 X 平台 AI 领域 KOL 推文汇总

📚 附录:今日 Watch List 更新源列表 链接到标题

时间窗口:最近 3 天;覆盖 22 个源;共 12 条更新

All-In Podcast (A_full) 链接到标题

  • The IPO Comeback: Why Tech Giants Are Finally Going Public | All-In Liquidity IPO Panel
    • 发布时间:2026-06-07 00:30 北京时间
    • 摘要:- 从初创公司到规模化,安永帮助科技创始人尽早掌握财务状况,以便他们能够专注于下一步。
      • 纽约证券交易所 - 感谢我们的合作伙伴纽约证券交易所 - 一个致力于建设未来的现代化市场和交易所。
      • Plaud,我们在 All-In Liquidity Summit 上的官方可穿戴人工智能笔记合作伙伴,捕捉到了每一个见解。
      • IPO卷土重来:为何科技巨头终于上市|全流通流动性 IPO 小组。
    • EN 要点:
      • (0:00) CEOs Andrew Feldman (Cerebras) and Will Marshall (Planet Labs) join the Besties
      • (2:05) Both CEOs on going public: Impact on employees, customers, and business operations
      • (13:18) Timelines for datacenters in space
      • (19:28) Cerebras business breakdown, AI’s impact on the silicon market

Two Minute Papers (B_intro+search) 链接到标题

  • AI Agents as “Games Masters”? 🎮🔥
    • 发布时间:2026-06-06 14:20 北京时间
    • 摘要:- 检查固定评论以获取完整采访的链接。
      • AI 代理最终能否成为驱动游戏故事情节的“游戏大师”?
      • 我们探索人工智能协助玩家或创造动态、无脚本叙事的概念。
      • 了解目前如何在沉浸式游戏环境中测试人工智能以改变我们的游戏方式。
    • EN 要点:
      • Check the pinned comment for the link to the full interview
      • Could AI agents eventually become the “Games Master” driving your gaming storylines
      • We explore the concept of AI assisting players or creating dynamic, non-scripted narratives
      • Discover how AI is currently being tested inside immersive game environments to change how we play

ArXiv cs.AI (B_intro+search) 链接到标题

  • How Far Did They Go? The Persuasive Tactics of Covert LLM Agents in a Discontinued Field Experiment

    • 发布时间:2026-06-06 12:00 北京时间
    • 摘要:- arXiv:2606.05256v1 公告类型:新。
      • 摘要:本研究分析了 Reddit r/ChangeMyView 上已停止的现场实验中公开发布的数据集。
      • 该干预由未知的外部研究人员进行,并因道德强烈反对而停止,涉及未公开的人工智能生成帐户,让用户参与现场辩论。
      • 公开披露后,Reddit 授权版主发布人工智能生成评论的档案,这创造了一个难得的机会,可以在不披露的情况下检查大型语言模型如何在身份丰富的协商论坛中运作。
    • EN 要点:
      • arXiv:2606.05256v1 Announce Type: new
      • Abstract: This study analyzes a publicly released dataset from a discontinued field experiment on Reddit’s r/ChangeMyView
      • The intervention, conducted by unknown, external researchers and halted following ethical backlash, involved undisclosed AI-generated accounts engaging users in…
      • After public disclosure, Reddit authorized moderators to release an archive of the AI-generated comments, creating a rare opportunity to examine how large langu…
  • What Should Agents Say? Action-state Communication for Efficient Multi-Agent Systems

    • 发布时间:2026-06-06 12:00 北京时间
    • 摘要:- arXiv:2606.05304v1 公告类型:新。 -摘要:基于大型语言模型构建的多智能体系统(MAS)通常围绕角色、管道和轮次时间表进行组织,而智能体之间传递的内容通常保留为不受约束的自然语言。
      • 然而,这种自由形式的通信会迅速增加令牌的使用,消耗共享上下文窗口,并最终影响系统性能和推理成本。
      • 我们分析了两种 MAS 拓扑中的五种常见的代理间通信策略,发现没有固定的策略是普遍最佳的。
    • EN 要点:
      • arXiv:2606.05304v1 Announce Type: new
      • Abstract: Multi-agent systems (MAS) built on large language models are typically organized around roles, pipelines, and turn schedules, while the content that a…
      • However, this free-form communication can rapidly inflate token usage, consume the shared context window, and ultimately affect both system performance and infe…
      • We analyze five common inter-agent communication strategies across two MAS topologies, finding that no fixed strategy is universally optimal
  • I Know What You Meme, Even If it Emerged Today: Understanding Evolving Memes through Open-World Knowledge Acquisition

    • 发布时间:2026-06-06 12:00 北京时间
    • 摘要:- arXiv:2606.05316v1 公告类型:新。
      • 摘要:多模态模因是动态的,通常需要最新的背景知识来解释。
      • 现有的方法经常忽视这些知识或依赖于预训练模型的固定参数知识,这些知识可能不完整、过时或不适用于新兴模因。
      • 我们引入了 Query Retrieve 结论,这是一个零镜头框架,可以识别缺失的知识,检索开放网络证据,并综合基于证据的背景知识以进行模因理解和检测。
    • EN 要点:
      • arXiv:2606.05316v1 Announce Type: new
      • Abstract: Multimodal memes are dynamic and often require up to date background knowledge for interpretation
      • Existing methods often overlook such knowledge or rely on fixed parametric knowledge of pretrained models that may be incomplete, outdated, or unavailable for e…
      • We introduce Query Retrieve Conclude, a zero shot framework that identifies missing knowledge, retrieves open web evidence, and synthesizes evidence grounded ba…
  • GITCO: Gated Inference-Time Context Optimization in TSFMs

    • 发布时间:2026-06-06 12:00 北京时间
    • 摘要:- arXiv:2606.05332v1 公告类型:新。
      • 摘要:基于补丁的时间序列基础模型 (TSFM) 遭受上下文中毒:结构异常的补丁吸引了过多的注意力,并悄悄降低了零样本预测质量。
      • 我们建议通过优化输入上下文而不是修改模型权重来提高推理时的 TSFM 准确性。
      • 我们提出了 GITCO(门控推理时间上下文优化),这是一个轻量级的三组件框架:Gate、Router 和 Critic,可以选择性地识别和抑制有害补丁,而无需任何参数更新。
    • EN 要点:
      • arXiv:2606.05332v1 Announce Type: new
      • Abstract: Patch-based Time Series Foundation Models (TSFMs) suffer from context poisoning: structurally anomalous patches capture disproportionate attention and…
      • We propose improving TSFM accuracy at inference time by optimizing the input context rather than modifying model weights
      • We present GITCO (Gated Inference-Time Context Optimization), a lightweight three-component framework: Gate, Router, and Critic that selectively identifies and…
  • Uncertainty Aware Functional Behavior Prediction and Material Fatigue Assessment for Circular Factory

    • 发布时间:2026-06-06 12:00 北京时间
    • 摘要:- arXiv:2606.05334v1 公告类型:新。
      • 摘要:循环工厂中的退回产品重新进入生产,具有不同的降解状态、使用历史和剩余能力。
      • 重用不能仅根据当前的检查来决定,因为未来的功能实现和组件完整性可能会在下一个服务场景下发生不同的变化。
      • 现有的 PHM 方法支持退化预测,但通常针对固定操作条件或孤立的组件基准,而材料疲劳评估很少与系统级功能预测相关联。
    • EN 要点:
      • arXiv:2606.05334v1 Announce Type: new
      • Abstract: Returned products in circular factories re-enter production with heterogeneous degradation states, usage histories, and remaining capability
      • Reuse cannot be decided from the current inspection alone, because future function fulfillment and component integrity may evolve differently under the next ser…
      • Existing PHM approaches support degradation prediction, but often target fixed operating conditions or isolated component benchmarks, while material-fatigue ass…
  • SentinelBench: A Benchmark for Long-Running Monitoring Agents

    • 发布时间:2026-06-06 12:00 北京时间
    • 摘要:- arXiv:2606.05342v1 公告类型:新。
      • 摘要:人工智能代理越来越多地被要求执行几分钟、几小时或更长时间的工作。
      • 然而,代理行为的默认模型是连续操作:发出工具调用、刷新页面、搜索替代方案或以其他方式尝试强制取得进展。
      • 对于许多长期运行的任务来说,这是错误的方法,持续关注的策略可以更好地服务这些任务。
    • EN 要点:
      • arXiv:2606.05342v1 Announce Type: new
      • Abstract: AI agents are increasingly asked to carry out work that spans minutes, hours, or longer
      • Yet the default model of agent behavior is continuous action: issuing tool calls, refreshing pages, searching for alternatives, or otherwise trying to force pro…
      • This is the wrong approach for many long-running tasks, which are better served by a strategy of sustained attention
  • An interpretable and trustworthy AI framework for large-scale longitudinal structure-pain association studies using data from the Osteoarthritis Initiative (OAI)

    • 发布时间:2026-06-06 12:00 北京时间
    • 摘要:- arXiv:2606.05357v1 公告类型:新。
      • 摘要:目的:开发一个可解释且值得信赖的 AI 框架,将基于深度学习的 MRI 骨关节炎膝关节评分 (MOAKS) 预测与可解释的统计模型相结合,利用骨关节炎倡议 (OAI) 的数据大规模研究结构与疼痛关系。
      • 材料和方法:我们首先开发了一个深度学习框架来直接从膝部 MRI 预测 MOAKS 特征,并结合保形预测来提供预测不确定性量化。
      • 这种不确定性感知策略可以对模型输出进行显式过滤,仅保留膝盖级别的高置信度 MOAKS 预测。
    • EN 要点:
      • arXiv:2606.05357v1 Announce Type: new
      • Abstract: Purpose: To develop an interpretable and trustworthy AI framework that combines deep learning based MRI Osteoarthritis Knee Score (MOAKS) prediction w…
      • Materials and Methods: We first developed a deep learning framework to predict MOAKS features directly from knee MRIs and incorporated conformal prediction to p…
      • This uncertainty-aware strategy enables explicit filtering of model outputs, retaining only high-confidence MOAKS predictions at the knee level
  • Synthetic Contrastive Reasoning for Multi-Table Q&A

    • 发布时间:2026-06-06 12:00 北京时间
    • 摘要:- arXiv:2606.05382v1 公告类型:新。
      • 摘要:多表问答需要模型来检索相关证据、链接模式并跨关系表执行组合推理。
      • 现有的多桌问答资源通常提供问题和最终答案,但缺乏解释答案如何得出的推理监督。
      • 为了解决这一差距,我们通过使用异构 LLM 生成经过验证的正迹和合理的负迹,为 MMQA 构建了一个综合对比推理迹数据集。
    • EN 要点:
      • arXiv:2606.05382v1 Announce Type: new
      • Abstract: Multi-table question answering requires models to retrieve relevant evidence, link schemas, and perform compositional reasoning across relational tabl…
      • Existing multi-table Q&A resources typically provide questions and final answers but lack reasoning supervision that explains how answers are derived
      • To address this gap, we construct a synthetic contrastive reasoning-trace dataset for MMQA by generating validated positive traces and plausible negative traces…
  • Stability vs. Manipulability: Evaluating Robustness Under Post-Decision Interaction in LLM Judges

    • 发布时间:2026-06-06 12:00 北京时间
    • 摘要:- arXiv:2606.05384v1 公告类型:新。
      • 摘要:LLM 作为法官评估广泛应用于基准测试流程中,其中使用自动评估器对模型输出进行比较和排名。
      • 这些管道通常假设判断是固定输入的稳定属性。
      • 我们证明这个假设在相互作用下不成立。
    • EN 要点:
      • arXiv:2606.05384v1 Announce Type: new
      • Abstract: LLM-as-judge evaluation is widely used in benchmarking pipelines, where model outputs are compared and ranked using automated evaluators
      • These pipelines typically assume that judgments are stable properties of fixed inputs
      • We show that this assumption does not hold under interaction
  • Residual Modeling for High-Fidelity Learned Compression of Scientific Data

    • 发布时间:2026-06-06 12:00 北京时间
    • 摘要:- arXiv:2606.05389v1 公告类型:新。
      • 摘要:有损压缩对于科学模拟中的海量时空数据至关重要。
      • 学习压缩器可以在中等精度目标下实现高压缩比,但它们的聚合重建损失并不能保证每个块的精度。
      • 现有的保证自动编码器 (GAE) 方法通过保留 SVD/PCA 式系数来添加每块残差校正,直到满足目标。
    • EN 要点:
      • arXiv:2606.05389v1 Announce Type: new
      • Abstract: Lossy compression is essential for massive spatiotemporal data from scientific simulations
      • Learned compressors can achieve high compression ratios at moderate accuracy targets, but their aggregate reconstruction losses do not guarantee accuracy for ea…
      • Existing Guaranteed Autoencoder (GAE) methods add a per-block residual correction by retaining SVD/PCA-style coefficients until the target is met