来自 Twitter · Hacker News · GitHub 的 AI 行业动态
原文作者:公众号“香港中文大学深圳人工智能学院” 原文链接:https://mp.weixin.qq.com/s/5EiYIXjB9mPusjCEvdr7xA 近日,香港中文大学(深圳)人工智能学院荆炳义、尹峰教授和数据科学学院、人工智能学院双聘助理教授贺品嘉教授团队的6篇论文被机器学习领域顶级会议ICML 2026接收。 国际机器学习大会ICML(International Conference
ICML 2026 PRM-PBE方法示意图 尽管大语言模型在代码生成和程序推理任务中取得了显著进展,但其在Programming-by-Example(PBE)任务中的表现仍受到明显限制。PBE要求模型仅根据输入输出样例推断潜在程序逻辑,并合成能够满足所有样例的程序。现有LLM方法通常依赖输入到输出的直接映射,或借助Chain-of-Thought、执行反馈、监督微调等方式增强推理能力。然而,这
先进智能体在数据密集环境中难以将数据发现与代码执行有效整合,暴露了当前智能体能力的显著差距。
原文作者:公众号“Today读什么” 原文链接:https://mp.weixin.qq.com/s/BrsWJJAv22qHVa_gfv2cpg 一张照片被压缩、噪声、暗光和模糊破坏后,多模态模型仍然可以写出一段逻辑完整的分析。但分析越流畅,不代表它看到的证据越充分:车头朝向已经模糊,模型仍能解释车辆为何“直行”;公交车轮廓已经重叠,它依然可以自信地数出三辆。 过去的方法通常让视觉编码器适应噪声
原文作者:公众号“为机器立心” 原文链接:https://mp.weixin.qq.com/s/ZkUNbTfyXY5-zMRpiJxdQg 一、研究背景与动机 1. 现状:代码大模型的安全隐患 大语言模型已广泛落地代码生成场景,但模型训练数据包含海量开源漏洞代码,导致其天生会复刻漏洞(如SQL注入、缓冲区溢出、不安全函数调用等)。这类漏洞往往由单个Token/单行代码的局部错误引发,并非整段代码
原文作者:公众号“深圳市大数据研究院” 原文链接:https://mp.weixin.qq.com/s/ex36drATo7qIy_MwFFp5hA 近日,深圳市大数据研究院四项科研成果同时发表于第43届国际机器学习大会(International Conference on Machine Learning, ICML)。 会议介绍 国际机器学习大会(International Conferen
DreamX-World 1.0是一个交互式文本/图像到视频模型,通过专门编码、训练技术和优化方法生成长时域内容,支持相机控制和场景一致性。
自变量开源XRZero-G0,数采成本直降到1/20。 作者丨齐铖湧 编辑丨马晓宁 最近具身行业被一个开源项目刷屏了。 最早只是小圈子里传“有人在社区开源了一整套具身数据集”。我抱着“看看热闹”的心态去看了看,越看越不对劲,这不是简单的数据集,这是一整个无本体数采系统啊。 换句话说,别人开源的是"一段代码",而这个开源的是一套全身无本体数采+质检+训练+真机评测的完整链路,还有2000多小时、覆盖
原文作者:公众号“滴滴技术” 原文链接:https://mp.weixin.qq.com/s/cBQnS-ThQgLLc12flLW8ug 近日,机器学习与人工智能领域国际顶会 ICML 2026 录用结果正式揭晓,滴滴共有五篇高质量学术成果被大会收录。本次中稿论文分别来自滴滴L Lab团队、滴滴网约车交易市场技术团队,与中山大学、香港科技大学(广州)、北京大学、上海财经大学等高校联合研发完成。未
「数据量×任务量」二维Scaling才是具身AGI正解。 作者丨齐铖湧 编辑丨林觉民 近段时间,具身智能的模型技术迭代方向,节奏放缓,分歧不断。 对此,北大副教授董豪(上纬启元首席科学家)分享了一个新观点:现在主流的模仿学习、强化学习、仿真数据各有硬伤,行业需要换套思路。在不久前的百度智能云的具身智能论坛上,董豪详细分享了他的想法,董豪主张用二维横向Scaling Law新思路,把世界模型、生成数
FastContext 将代码仓库探索与代码解决分离,通过专用探索模型减少 Token 消耗并提升解决率。
文章指出 RL 效率关键在于 trainer 与 generator 吞吐量匹配,vLLM 与 verl 联合实验验证了可扩展的沙箱训练方案,感谢 KaichaoYou、Ao Shen 等贡献者。
报告对比手动、固定和自动化三种巡检方式在数据可用性、准确性、工人安全及成本四个维度上的表现,为大规模巡检提供选型参考。
该模型利用大规模交互轨迹数据,实现对三维环境的可扩展预测与模拟,可应用于游戏、自动驾驶和机器人规划。
该研究提出一种在像素空间直接对齐的三维几何生成方法,能够在超出传统视角限制的情况下实现场景重建,适用于虚拟现实和机器人感知。
Databricks 峰会上,Replit 获 2026 App Generation Partner of the Year,已登陆 Marketplace,SF 本周展位 651 欢迎交流。
基于1M token上下文的长程编码旗舰模型,Terminal-Bench 2.1得分81.0(对比GLM-5.1的62.0);IndexShare使1M上下文下每token FLOPs降低2.9倍…
在U.S. News 2026最佳全球大学排名中,UC Berkeley位列全球第七,同时蝉联美国公立大学榜首。
该团队正构建从经验中学习的超学习系统,对计算规模有极高要求;选择Google Cloud上规模最大的集群之一NVIDIA Vera Rubin NVL72驱动其迈向超智能的目标。
GLM-5.2专为长程编码智能体设计,支持百万token上下文,可承载项目级工程全流程;优化长程编码任务,涵盖大规模实现、自动化研究及性能调优,单任务覆盖从需求到跨平台部署完整开发流程,同时支持客户…
Computer Use最通用但速度慢、可控制任何GUI应用;Chrome扩展轻量快速;另有第三种方式,适用于不同场景。
CoherentCorp与NVIDIA合作扩大美国先进光子技术产能,激光与光链路支撑现代AI数据传输,强化本土AI制造基础
新增手腕端实时事件追踪、耳机/智能眼镜深度集成、Gemini智能助理(部分设备稍后上线)以及系统级功耗优化提升续航
新增实时屏幕反应、Gemini Omni文本/图像/视频混合创作、自定义配乐、应用悬浮窗口以及跨设备语音翻译功能
前沿评测团队负责人Tejal Patwardhan阐述评测重要性,指出基准饱和或被操纵时需关注的新评判维度
研究揭示Claude Code用户分布、使用场景、任务价值变化及领域专长对会话成功率的影响
利用近期的去标识化用户请求和候选模型响应,评估模型在发布前的潜在行为,提升安全性与可靠性。
他认为未来软件逻辑将呈现类似英语的表示,编程语言向伪代码演进,开发者可直接编辑高层逻辑,摆脱海量代码的束缚。
将于旧金山现场发布并直播,仅剩少量邀请名额
该系统为 8 个 Codex Agent 配备 GPU 与充足 token,设定任务目标后自主调度机器人寻找视觉线索、复位场景并练习新技能,实现人类介入最小的自主研究。