全部 今日 本周 本月

Sol-Attn:通过实时注意力稀疏化加速视频生成推理

扩散Transformer是高质量视频生成的关键,但长序列使注意力计算成为推理瓶颈。无训练动态稀疏注意力通过仅计算选定key-value块来缓解瓶颈,但现有方法难以高效且准确地稀疏化注意力:固定分数选择导致预算僵化,而概率质量保留虽动态但可能不均衡。

研究 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

Chamaileon:基于上下文建模与混合采样的跨语境binder设计

生成模型推动了蛋白binder设计的发展,但现有方法主要基于单靶点、单状态假设,难以建模多靶点或多状态相互作用。Chamaileon将问题形式化为跨上下文binder设计,统一了多靶点与多状态binder设计任务。

研究 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

多轮长时域规划:从预训练到后训练的同策略智能体蒸馏

多轮长时域规划对基础模型智能体至关重要,但现有模型训练数据不可控、不透明,难以理解规划能力如何获得和整合。研究提出了统一可控的多轮环境,系统研究长时域规划在预训练等阶段的获取机制,通过单/多教师同策略蒸馏提升规划能力。

研究 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

On-Policy扩散蒸馏中无分类器引导的再思考

On-policy蒸馏通过沿student生成的轨迹查询teacher来适配扩散模型,但对无分类器引导(CFG)的处理仍不清楚。现有方法将速度匹配扩展到CFG组合预测,但这种目标在分支层面是欠定的——正负分支误差会相互补偿。

研究 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

从专有到开源:基于多智能体协议蒸馏弥合智能体搜索的分布差距

智能体搜索仅靠结果强化学习监督信号稀疏,从专有模型蒸馏知识时,传统 logit 匹配因隐藏 logits 和 tokenizer 不匹配而不可行,自然语言轨迹模仿效果有限。

产品发布 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

OmniVAE:跨模态对齐的音视频 VAE 实现联合生成

现有音视频联合生成方法分别训练 VAE,导致潜在空间缺乏跨模态对齐,使下游生成模型需从头学习跨模态同步。OmniVAE 提出一种联合训练的音视频 VAE,实现跨模态对齐。

研究 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

机器人学习中的过程奖励建模综述

综述机器人学习中过程奖励的研究进展,涵盖不同观察、目标规范、输出信号和监督来源的方法差异与统一框架需求。

机器人 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

JarvisHub:面向画布原生多模态创意智能体的开放测试框架

创意AI正从单步资产生成向长时程多模态创作演进。尽管近期生成模型能合成高质量图像、视频、音频、UI元素等创意资产,但实际创意工作远不止孤立的提示词-输出交互。它涉及参考资料、草稿、备选方案、编辑、失败尝试、版本关系、工具操作、评估信号和人类反馈,这些共同形成不断演进的项目状态。现有基于提示词、聊天和节点的生成系统仅能部分...

大模型 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

具身操控的数据金字塔

将具身智能数据组织为金字塔结构,整合真实机器人数据、UMI风格数据、模拟数据和通用视觉语言数据,平衡可扩展性与机器人对齐。

机器人 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

Anthropic CEO 阐明开放权重模型立场

Dario Amodei 发文正式阐明 Anthropic 对开放权重模型的立场:明确否认曾主张禁开源,称不具危险能力的开源模型是公共产品;但认为保护主义禁令解决不了国安担忧,主张三项措施——对华管制强芯片并打击走私、打击工业级蒸馏、对所有足够强大的模型(无论开源闭源)强制发布前安全测试。此前 Anthropic 与 OpenAI 均未签署 50 家公司联署的开放权重公开信。

观点 · 观点/主张 AI 摘要 · 单一来源
@AnthropicAI 阅读 →

O-VAD:基于目标跟踪与推理的工业视频异常检测

工业视频异常检测用于识别工业流程中的异常事件,现有视觉语言模型方法在面对复杂物体变换、严格物理约束和工艺流程限制时性能下降。研究团队提出一种免训练的智能框架,以应对工业场景中的交互密集型检测任务。

研究 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

月之暗面开源发布 Kimi K3(2.8T MoE,迄今最大开源权重模型)

月之暗面发布旗舰 Kimi K3 并开放权重:2.8 万亿参数 MoE(896 专家、每 token 激活 16 个、约 50B 激活参数)、原生多模态、100 万 token 上下文,为迄今参数最大的开源权重模型(MXFP4 四比特约 1.4TB)。同步开源配套栈:MoonEP(分布式 MoE 高性能通信库)、AgentENV(大规模智能体环境,服务 agentic RL)、FlashKDA(基于 CUTLASS 的 Kimi Delta Attention 内核,H20 prefill 最高约 2.22x)。

大模型 AI 摘要 · 单一来源
@Kimi_Moonshot 阅读 →

NVIDIA联合Linux基金会成立开放安全AI联盟

NVIDIA与Linux基金会牵头成立Open Secure AI Alliance,27+创始成员含微软、IBM、红帽、Hugging Face、CrowdStrike、Cloudflare、SpaceX、戴尔、Salesforce等40余家机构,开放共享用于保护AI智能体、软件及基础设施的安全技术;此举正值Hugging Face遭黑客攻击之后(Meta未在名单中)。

企业动态 AI 摘要 · 单一来源
@nvidia 阅读 →

频谱先验降低扩散模型的曝光偏差

扩散模型在迭代采样中通常受误差累积影响,即曝光偏差。研究揭示了训练与推理间存在系统性的频率相关差异,可理解为频率相关信噪比误差。该失配方向随模型和时间步不同而变化,表明固定校正规则无法泛化。团队提出频谱对齐(SPA),一种轻量级、基于引导的方法,将中间预测的功率谱校准至预计算的先验分布。该方法包含两个阶段。

研究 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

多头潜在控制:统一LLM智能体决策接口

大语言模型作为智能体时,仅靠next-token预测难以实现可靠决策。该研究提出多头潜在控制机制,使模型能在推理时自主决定继续推理、调用更强模型、请求信息或调用工具。现有方法依赖输入侧路由,成本高且难维护。

大模型 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

Molt:代理强化学习的可扩展PyTorch原生训练框架

代理强化学习涉及持续的算法修改、新估算器、新管道阶段和rollout方案,在主流框架中每次改动都需贯穿trainer、分布式后端和rollout胶水层,成本由研究者承担。Molt是PyTorch原生训练框架,代码库紧凑清晰,研究者可全局掌握,AI助手可完整读取推理,实现端到端算法流程追踪和修改。

研究 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →