新模型、开源权重与评测。
GPT-5.6 在内部模型访问路径中被发现。 GPT-5.6 即将到来已不是秘密。唯一的问题是它何时以及多快到来。 我猜测,一切准备工作都是为了应对潜在的 Fable 5 重新发布,随后很快发布 GPT-5.6。 鉴于围绕 Fable 5 的传闻越来越多,GPT-5.6 重新成为焦点并不意外。 🔗 阅读原文:https://x.com/kimmonismus/status/2070105726161162718
Claude已经,俨然成为了新一代电子老公。
新论文"LLMs Do Not Always Need Readable Language"提出BabelTele压缩写作风格,让LLM间通信混合缩写、符号、多语言片段及非传统结构,替代人类自然语言的长文本。即使失去人类可读性,模型仍能回答、记忆并在智能体间传递信息。最强结果:BabelTele保持约99.5%语义保真度,同时将文本压缩至原始长度的27.9%。 🔗 阅读原文:https://x.com/rohanpaul_ai/status/2070262004980326437
动态工作流仅适用于少量用例,可视为测试时计算(TTC)新范式,对爬山式研究实验有效。仔细规划及提升推理级别均可改善效果。/goal + /loop 是其子集,验证者/评判者至关重要。结合不同编码智能体能获更好结果,适合需要多智能体视角的 LLM 评审团场景。前沿模型不擅即时生成 harnesses,但 Mythos 等新模型可能更优地处理智能体编排。TTC 基准尚缺,需建立。元提示动态工作流很有趣,Opus 4.8 也可能带来惊喜。动态工作流可打包为技能以便进一步优化。 🔗 阅读原文:https://x.com/omarsar0/status/2070241450227331120
值得关注的产品发布与更新。
Un0 是一个图像生成系统工具,首次展示了该公司技术如何复制传统AI系统。
融资、政策与市场动向。
General Intuition 已筹集3.2亿美元,以扩大基于数百万小时游戏时间训练的AI规模,该公司认为行动数据可以帮助AI发展出更接近人类直觉的能力。
General Intuition 已融资 3.2 亿美元,用于扩大在数百万小时游戏玩法上训练的 AI 规模,该公司认为行动数据可以帮助 AI 更接近人类直觉。
Netris提供运行在网络交换机上的软件,并提供一个平台,帮助新云运营商缩短上线时间。
距离锁定TechCrunch创始人峰会2026席位仅剩2天,6月26日太平洋时间晚上11:59前注册可节省最高190美元。立即注册。
7月17-7月20
值得一读的研究与论文。
Ling Team 在 arxiv 发表论文,重新思考 FP4 预训练中的格式选择。研究发现,主流 E2M1 格式存在先天 Shrinkage Bias,导致数值量化时左右 rounding bin 不对称,该 bias 在训练中累积拖慢收敛。相比之下,E1M2/INT4 这类 uniform 格式在配合 Random Hadamard Transform(RHT)后,更高的 bucket 利用率能转化为实际量化质量收益,收敛表现优于 E2M1。团队提出 UFP4 方案:在 E1M2/INT4 下为三种 GEMM 操作数启用 RHT,并将 SR 用于 dy 量化。研究认为,细粒度量化与 RHT 引入后,FP4 训练已转向"局部分辨率主导",uniform 4-bit 格式的价值应被重新评估。 🔗 阅读原文:https://mp.weixin.qq.com/s/4_a4LI3zK-4yJEyfy-LQXA
arXiv:2606.24889v1 宣布类型:新 摘要:尽管自动语音识别(ASR)系统整体词错误率较低,但会产生残余的词汇错误,这些错误对语义关键标记(如命名实体、否定词和情感词)的影响尤为显著。这些错误通常是结构化的,源于语音相似性而非随机噪声,因此简单的逐标记纠正不足以解决问题。我们提出了一种结构化的ASR纠正框架,称为G-SPIN,它结合了语音图建模与上下文语言理解。图神经网络
arXiv:2606.24890v1 宣布类型:新 摘要:一小群志愿者能否仅通过编辑维基百科就影响AI系统对动物福利的讨论?我们证明可以。维基百科几乎出现在每一个主要语言模型训练数据集中,并且比网络爬取文本权重更高。支持动物福利的维基百科编辑者(PAW)是一群在相关文章中添加有来源的动物福利内容的倡导者,他们已在115页上进行了125次编辑。我们使用基于梯度的数据归因(Bergson;MAGIC),追踪这些编辑如何影响语言模型行为。TrackStar检索归因
arXiv:2606.24893v1 宣布类型:新 摘要:为了让代理在测试时从与世界的互动中持续学习,它们必须能够有效探索、获取新的世界知识和技能、保留相关的经历并进行长期规划。为了评估这些关键能力,我们引入了AgentOdyssey,这是一个新颖的评估框架,可以程序化生成具有丰富实体、世界动态和长期任务的开放文本游戏。关键的是,AgentOdyssey超越了传统的机器学习假设,即
arXiv:2606.24915v1 宣布类型:新 摘要:端到端自动语音识别系统经常出现罕见实体和特定领域术语的幻觉,尤其是在低资源语言中。虽然检索增强生成框架可以利用大型语言模型减轻这些错误,但当前架构面临重大挑战。它们要么依赖忽略语音误识别的标准稀疏检索,要么使用引入高延迟的重型跨模态嵌入。本文提出了一种高效、纯粹基于词汇的误差感知框架,旨在
大厂与平台今天的关键动作。
一份新的 OpenAI 研究论文显示,AI 代理正在改变工作方式,使更长、更复杂的工作任务成为可能,并在各个角色中扩大了生产力。

新的 Google Finance 已结束测试阶段,并推出一款新的 Android 应用。
OPENAI 🔥:据 The Information 报道,GPT-5.6 因联邦政府要求而推迟发布。 美国政府可能要求 AI 实验室在模型发布前获得批准。 新现实 👀 🔗 阅读原文:https://x.com/testingcatalog/status/2070253352840028408
The Information 报道,美国政府因安全顾虑要求 OpenAI 暂缓 GPT-5.6 的广泛发布,改为推出受控预览版。OpenAI 计划先向小部分合作伙伴提供早期访问,并由政府逐客户审批准入。这一非常规做法主要担忧模型在自动化高技能网络工作上的能力:既能帮防御者更快发现漏洞,也可能被攻击者用于加速测试漏洞利用。本周四,CEO Sam Altman 已向员工确认该审批流程。 🔗 阅读原文:https://x.com/rohanpaul_ai/status/2070252433109049466
OpenAI 据报将 GPT-5.6 仅作为有限预览提供给少数合作伙伴。Sam Altman 称是应美国政府要求,预览期间政府将逐客户审批,更广泛发布可能几周后跟进。此前 Anthropic 对 Mythos 采取类似路径,白宫曾因国家安全迫使 Anthropic 撤回 Fable 和 Mythos。特朗普 AI 行政令明确新模型审查应自愿而非政府许可,但前沿 AI 发布已开始呈现不同面貌。 🔗 阅读原文:https://x.com/kimmonismus/status/2070245282026319945