2026-07-27

O-VAD:基于目标跟踪与推理的工业视频异常检测

工业视频异常检测用于识别工业流程中的异常事件,现有视觉语言模型方法在面对复杂物体变换、严格物理约束和工艺流程限制时性能下降。研究团队提出一种免训练的智能框架,以应对工业场景中的交互密集型检测任务。

研究 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

月之暗面开源发布 Kimi K3(2.8T MoE,迄今最大开源权重模型)

月之暗面发布旗舰 Kimi K3 并开放权重:2.8 万亿参数 MoE(896 专家、每 token 激活 16 个、约 50B 激活参数)、原生多模态、100 万 token 上下文,为迄今参数最大的开源权重模型(MXFP4 四比特约 1.4TB)。同步开源配套栈:MoonEP(分布式 MoE 高性能通信库)、AgentENV(大规模智能体环境,服务 agentic RL)、FlashKDA(基于 CUTLASS 的 Kimi Delta Attention 内核,H20 prefill 最高约 2.22x)。

大模型 AI 摘要 · 单一来源
@Kimi_Moonshot 阅读 →

NVIDIA联合Linux基金会成立开放安全AI联盟

NVIDIA与Linux基金会牵头成立Open Secure AI Alliance,27+创始成员含微软、IBM、红帽、Hugging Face、CrowdStrike、Cloudflare、SpaceX、戴尔、Salesforce等40余家机构,开放共享用于保护AI智能体、软件及基础设施的安全技术;此举正值Hugging Face遭黑客攻击之后(Meta未在名单中)。

企业动态 AI 摘要 · 单一来源
@nvidia 阅读 →

频谱先验降低扩散模型的曝光偏差

扩散模型在迭代采样中通常受误差累积影响,即曝光偏差。研究揭示了训练与推理间存在系统性的频率相关差异,可理解为频率相关信噪比误差。该失配方向随模型和时间步不同而变化,表明固定校正规则无法泛化。团队提出频谱对齐(SPA),一种轻量级、基于引导的方法,将中间预测的功率谱校准至预计算的先验分布。该方法包含两个阶段。

研究 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

多头潜在控制:统一LLM智能体决策接口

大语言模型作为智能体时,仅靠next-token预测难以实现可靠决策。该研究提出多头潜在控制机制,使模型能在推理时自主决定继续推理、调用更强模型、请求信息或调用工具。现有方法依赖输入侧路由,成本高且难维护。

大模型 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

Molt:代理强化学习的可扩展PyTorch原生训练框架

代理强化学习涉及持续的算法修改、新估算器、新管道阶段和rollout方案,在主流框架中每次改动都需贯穿trainer、分布式后端和rollout胶水层,成本由研究者承担。Molt是PyTorch原生训练框架,代码库紧凑清晰,研究者可全局掌握,AI助手可完整读取推理,实现端到端算法流程追踪和修改。

研究 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →
2026-07-24

ReferTrack:用于具身视觉追踪的指代-追踪框架

具身视觉追踪(EVT)要求移动智能体仅通过机载视觉持续跟随自然语言描述的目标。ReferTrack 提出一种指代-追踪范式,使用单个前向摄像头实现具身追踪,先从图像中选取目标。

机器人 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

AREX:面向深度研究的递归自我改进智能体

深度研究需要智能体找到满足多个约束条件的答案,但发现答案成本高昂而验证成本较低。AREX 是一种递归自我改进(RSI)智能体,通过验证中间结果并利用部分验证状态引导后续优化。

研究 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

SANA-Video 2.0:结合线性注意力的高效视频生成模型

5B/14B规模的混合视频扩散Transformer,在单GPU上生成720p高质量视频,通过混合线性-Softmax注意力以3:1比例平衡线性复杂度和全秩token交互。

芯片 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

K12-KGraph:面向教育LLM的课程对齐知识图谱

现有K-12教育基准主要测试答题能力,忽视课程知识结构理解。K12-KGraph从人教版教材中提取覆盖中小学数理化生课程的课程对齐知识图谱。

大模型 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

Anthropic发布旗舰模型Claude Opus 5

Anthropic 7月24日发布新旗舰 Claude Opus 5:100万 token 上下文、支持 xhigh 推理档,并新增 low/medium/high 努力档位让用户在成本与能力间权衡;成为 Claude Max 默认、Pro 最强模型,价格与前代 Opus 4.8 持平。官方称在 Frontier-Bench、GDPval-AA 等编码/知识评测上刷新 SOTA。Cursor 等工具当日即接入。

大模型 AI 摘要 · 单一来源
@claudeai 阅读 →
2026-07-23

Anthropic升级Claude语音模式接入Opus/Sonnet

Anthropic 7月23日升级Claude语音模式:首次支持Opus与Sonnet(此前仅Haiku),可对话中切换模型、接入connectors工具,语调更自然、延迟更低、语言更多。以beta在桌面/移动/网页全端推送,付费用户默认沿用上次文本对话所用模型。

产品发布 AI 摘要 · 单一来源
@claudeai 阅读 →

ChatGPT语音登陆桌面端(GPT-Live全双工)

OpenAI 7月23日把最先进语音带上ChatGPT桌面端(Mac/Windows):由GPT-Live驱动、全双工可边听边说,用户能在Chat/Work/Codex里用语音发起、检查、指挥跨线程任务,Appshots还能让其读取当前聚焦窗口做上下文。面向Plus/Pro/Business/Edu/Enterprise全球推送。

产品发布 AI 摘要 · 单一来源
@OpenAI 阅读 →

OpenAI向全美用户推出ChatGPT健康功能

OpenAI 7月23日面向全美18岁以上用户(Web与iOS,覆盖Free/Go/Plus/Pro)推出「Health in ChatGPT」:可安全接入Apple Health与美国医疗门户的电子病历,让ChatGPT基于个人化验、睡眠与活动数据给出健康洞察、对比历次检查。此为1月小范围试点后的正式重启扩量。

产品发布 AI 摘要 · 单一来源
@OpenAI 阅读 →

主动观察者测试

人类视觉是闭环过程,当前视觉-语言基准无法评估MLLM是否具备主动观察能力。提出ActiveVision基准,包含17项任务分3类,强制模型进行重复视觉感知,以测量MLLM的主动观察能力。

大模型 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

Self Gradient Forcing:原生长视频外推

近期自回归视频扩散方法采用自强制训练,用自身生成的历史替代真实视频上下文,以减少曝光偏差。但历史键值缓存仅作为冻结的展开状态被未来帧使用,导致未来损失无法监督早期生成潜变量如何写入更有效的键值。我们将此问题称为历史上下文-梯度差距,并提出两遍训练策略 SGF 来解决这一问题。

研究 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

SLAI T-Rex:在 Ascend SuperPOD 上对 DeepSeek-V4 系列进行全参数后训练

万亿参数级 MoE 模型的全参数后训练面临严峻系统挑战,包括内存压力、通信开销和内核效率低下。本报告以 DeepSeek-V4 为例,在 Ascend NPU SuperPOD 上实现端到端优化,提出覆盖模型并行与计算通信编排的层次化框架。

芯片 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →
2026-07-22

makecindy/cindy:Consider it done. The open-source AI agent that works out of the

Consider it done. The open-source AI agent that works out of the box · 想到,就能做到。开源、开箱即用的 AI Agent。

产品发布 AI 摘要 · 单一来源
GitHub Trending 阅读 →

Cursor上线智能模型路由Router

Cursor推出智能模型路由,按任务复杂度自动分配模型:琐碎请求走GPT-5.4-mini、中等走GPT-5.4/Sonnet 4.6、架构级走GPT-5.5/Opus 4.7,路由阈值公开且可逐请求覆盖。业内称企业侧需求旺盛——既控成本又保代码质量,智能路由正成为AI编辑器新趋势。

产品发布 AI 摘要 · 单一来源
@cursor_ai 阅读 →

隐性时钟:扩散语言模型中的潜在时间建模

扩散语言模型(DLMs)作为自回归模型的有前景替代方案近来兴起。与标准扩散方法不同,DLMs 未显式依赖时间步条件。本文发现 DLMs 实际上在其残差流中编码了与扩散时间步相关的潜在表示,且这种信号可跨层通过探针可靠提取,表明去噪进度可被解码。

研究 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

DeepMind携手美能源部推进Genesis科学计划

Google DeepMind 7月22日宣布支持美国能源部(DOE)「Genesis Mission」国家级AI科研计划,联合17个国家实验室,用Gemini驱动的AI co-scientist加速能源、材料、生物医药等发现;2026年将开放AlphaEvolve、AlphaGenome、WeatherNext等模型,早期已产出药物再利用候选与抗菌耐药机制预测。

研究 AI 摘要 · 单一来源
@GoogleDeepMind 阅读 →

OpenAI推出企业级Agent部署平台Presence

OpenAI 7月22日发布企业产品Presence,帮助企业在客服、外呼销售、内部高风险流程等场景部署可信AI Agent:模型推理叠加策略、护栏与升级规则,支持语音与聊天实时交互。当前经Forward Deployed Engineers及集成商限量GA、非自助。OpenAI称其已承接自家英文电话客服、可无人工解决约75%来电。

产品发布 AI 摘要 · 单一来源
@OpenAI 阅读 →

将转录策略作为潜在变量:激活可控的逐字ASR与词级时间对齐

现代ASR模型在异质标注数据上训练时,转录风格(逐字vs意译)作为未控潜在变量,导致解码不稳定和评估混淆(高达60%的WER归因于风格不匹配)。研究表明模型已编码两种风格,关键在于可控激活。通过在并行逐字/意译转录对上训练覆盖感知解码器任务token,即使仅英语训练也能将德语非流利检测F1从10%提升至79%零样本迁移。

研究 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

AgentDebugX:LLM Agent 故障可观测、归因与恢复的开源工具包

LLM Agent 故障难以调试,因为错误表象往往与根源不在同一环节。AgentDebugX 是一个开源调试框架,将调试组织为检测、归因、恢复、再运行的闭环。其核心模块 DeepDebug 通过全局轨迹理解、结构化调查和交叉验证实现多轮根因诊断。

大模型 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

以游戏速度运行的生成式世界渲染器

生成式世界渲染器 AlayaRenderer 接收物理引擎导出的结构化世界状态并合成 RGB 帧。与从文本或控制提示生成帧的模型不同,AlayaRenderer 能保持场景结构而不改变底层世界动态。原版 AlayaRenderer 计算开销过大难以实时部署,本技术报告推出 AlayaRenderer-Flash,一款面向实时的生成式前向世界渲染器。

产品发布 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

文本模板词元是扩散Transformer中的隐式语义寄存器

文生图扩散Transformer(DiT)联合处理文本和图像词元,但其在去噪过程中的内部计算机制仍不清晰。我们为现代大规模DiT引入了一个因果可解释性框架,结合注意力分解与跨词元跨度、头和层的定向干预。利用该框架分离提示内容词元与结构模板词元,发现结构词元在编码器输出时携带的提示特定信息很少。然而令人惊讶的是,它们成为主导的图像到文本注意力汇聚点,并在因果上(原文截断)

研究 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →