全部 今日 本周 本月

Dan Fu斯坦福客座:Token的一生与近光速LLM解码

解析KV缓存、预填充/解码分离、规模化推理真相;Megakernels通过GPU算子融合逼近解码极限;Parcae揭示循环Transformer膨胀根因及修复方案,还有新扩展定律暗示现有模型仍有余量。

芯片 AI 摘要 · 单一来源
@togethercompute 阅读 →

LlamaIndex亮相Data AI Summit,展示文档AI代理

联合创始人Jerry Liu两度登场:解析长时域AI代理的自动化文档工作流程,参与由LangChain、CrewAI等组成的代理技术栈圆桌。Booth #137可体验LlamaParse。6月15-…

大模型 AI 摘要 · 单一来源
@llama_index 阅读 →

钓鱼与Agent:不必紧盯跑完没跑,起身续水伸个腰

诗意对比揭示AI使用哲学:任务自主运行,结果自然到来。一椅一Agent,逍遥自得,恰如坐看云起日头高。

行业 AI 摘要 · 单一来源
@dotey 阅读 →

Vercel Day 排行榜 6 月 16 日开启:TOP 创业项目可获 3 万美元福利

与 Vercel 合作推出特别活动,6 月 16 日上线项目可参与排名,优胜者获 Vercel Ventures 投资机会及超过 3 万美元启动资源。

产品发布 AI 摘要 · 单一来源
@ProductHunt 阅读 →

SpenseGPT:单次剪枝实现 LLM 推理中稀疏/密集 GEMM 融合

论文提出实用化单次剪枝方案,可在 LLM 推理中同时启用稀疏与密集矩阵乘法,提升推理效率。

大模型 AI 摘要 · 单一来源
@_akhaliq 阅读 →

Replit Agent 新增 Skills 与自定义指令功能

进一步扩展 Agent 能力边界,允许通过 Skills 组合与自定义指令实现更灵活的自动化开发流程。

行业 AI 摘要 · 单一来源
@Replit 阅读 →

SGLang 新增 MiniMax-M3 原生支持:60 层 MoE、1M 上下文、多模态融合

该模型总计约 428B 参数、23B 活跃参数,60 层架构。MSA 稀疏注意力在 1M 上下文下比 M2 提速 9 倍/15 倍(预填充/解码),Token 计算量降至 1/20,支持 NVIDI…

大模型 AI 摘要 · 单一来源
@lmsysorg 阅读 →

CHORUS:去中心化多机体协作,单一 VLA 策略实现

该框架允许多个机体共享同一视觉-语言-动作策略,兼顾效率与灵活性。

行业 AI 摘要 · 单一来源
@_akhaliq 阅读 →

UCBerkeley 突破电子显微镜,分辨率达光学万倍

首次观测体内最小蛋白质分子,帮助从分子层面理解疾病机制。

研究 AI 摘要 · 单一来源
@UCBerkeley 阅读 →

a16z 报告:美国工业资本投资主要聚焦 AI 建设

对比历年数据,AI 基础设施正成为美国工业资本支出的核心领域。

企业动态 AI 摘要 · 单一来源
@a16z 阅读 →

Karpathy 研发引导星际探测器的控制大脑

目标让探测器自行导航、与其他文明建立联系,实现银河系和谐。

行业 AI 摘要 · 单一来源
@karpathy 阅读 →

Kimi-Moonshot开源K2.7-Code编程模型登陆SGLang

长多步代码任务可靠性提升,推理Token减少30%,与K2.5/K2.6架构兼容,现有部署环境可直接运行。

产品发布 AI 摘要 · 单一来源
@lmsysorg 阅读 →

Codex推出双向Token用量重置机制

邀请好友双方各获一次重置机会,Codex通过社交裂变方式重置个人用量限制。

产品发布 AI 摘要 · 单一来源
@dotey 阅读 →

高级RAG解决基础检索的噪声和准确性问题

n8n发布生产级检索系统构建指南,详解信息搜索、排序、过滤的优化方法,提升LLM查询质量。

大模型 AI 摘要 · 单一来源
@n8n_io 阅读 →

海螺AI用户创作世界杯足球支持视频

用户Seedily利用MiniMaxHub制作巴西、阿根廷、西班牙、英格兰等队加油视频,展示AI视频创作能力。

行业 AI 摘要 · 单一来源
@Hailuo_AI 阅读 →

AI摘要正在取代传统搜索成为流量入口

a16z指出AI摘要驱动搜索流量下滑、零点击搜索上升的趋势,并附相关数据图表。

行业 AI 摘要 · 单一来源
@a16z 阅读 →

Replit NYC Vibecon 即将开启:2 天艺术、代码与文化大咖齐聚

Vibecon 将于纽约举办为期两天的艺术、代码与文化盛会,邀请业界最具影响力的创作者参与,活动详情见链接,合作伙伴包括 BrandNewSchool。

企业动态 AI 摘要 · 单一来源
@Replit 阅读 →

Allen AI 发布 olmo-eval 工作台,专为迭代式 LLM 评估设计

训练 LLM 时每次调参或规模扩大都需要重新跑基准测试,olmo‑eval 工作台提供检查点追踪、自动化循环和可视化分析,帮助开发者快速迭代模型。

大模型 AI 摘要 · 单一来源
@allen_ai 阅读 →

连市长都在关注 Replit NYC 的氛围

在纽约的 Replit 活动现场,市长也出现在现场,关注氛围和活动,显示出活动的热度与影响力。

行业 AI 摘要 · 单一来源
@Replit 阅读 →

Replit 推出并行智能体,可同步交付网站、App、视频与路演文档

用户可在单个项目中同时运行多个代理,构建并部署网站、移动端 App、宣传视频以及演示文档,还可向已有项目添加多个产物。

产品发布 AI 摘要 · 单一来源
@Replit 阅读 →

Git 是否会是下一个被淘汰的遗留技术?

PR 与代码审查结束后,合并冲突仍占代码工作量 20‑40%。作者质疑 Git 是否必要,建议采用类似人与人协作的聊天、侧评论、负责人发布的模式,取代逐行合并。

产品发布 AI 摘要 · 单一来源
@swyx 阅读 →

Paul Graham用奥卡姆剃刀分析Epstein文件:至少部分指控为真

推测Elon在两人分歧时提及此事,说明并非泛泛指控,而是有实质内容支撑;简单声明"出现在文件中但内容全假"会显得无力

行业 AI 摘要 · 单一来源
@paulg 阅读 →

SGLang在GB300 NVL72上创纪录:DeepSeek V4 Pro达每秒1.2万toke…

通过NVIDIA Dynamo编排和MTP技术,在FP4精度下8K/1K配置实现高性能,且交互曲线全程保持强劲表现

大模型 AI 摘要 · 单一来源
@lmsysorg 阅读 →

YC Paper Club热议:LLM自我博弈、蛋白质世界模型、流式RAG

研究者展示AI在生物学、形式验证和代理编程中的应用,涵盖从蛋白质建模到Scaling Self-Play等前沿议题

大模型 AI 摘要 · 单一来源
@ycombinator 阅读 →

Claude Fable 5推理追踪功能曝光,可深入互动思考过程

OpenClaw新增forceBlockStreamingForReasoning参数,能清晰展示推理痕迹,提供更深层次的思考互动体验

大模型 AI 摘要 · 单一来源
@garrytan 阅读 →

MiniMax Hub上线:本地AI代理工作站,支持并行项目与批量生成

AI工作流正从编程转向创作,涵盖研究、脚本、图片、音乐到最终剪辑的全流程,支持无限画布和本地资产访问

产品发布 AI 摘要 · 单一来源
@Hailuo_AI 阅读 →

黄仁勋:计算正经历60年来最大转变,从检索转向生成

这一转变代表AI蛋糕生态五层架构中价值数万亿美元的机会,涵盖构建、发现和解决问题的全新可能

融资 AI 摘要 · 单一来源
@nvidia 阅读 →

NVIDIA AI Enterprise提供政府级安全AI部署方案

合规性常阻碍AI项目从试点阶段推进。NVIDIA AI Enterprise提供符合政府要求的安全软件,为全球团队打造可投入生产的基础设施,使团队能专注于AI部署而非漏洞管理。

行业 AI 摘要 · 单一来源
@nvidia 阅读 →

GTC Taipei精彩回顾:台北活动激发AI社区热情

GTC Taipei期间,台北展现了充满活力的技术社区氛围。从满座的keynote会场、前沿机器人技术到有趣的本地互动(小龙虾钳钥匙扣),这座城市给参与者留下深刻印象。NVIDIA感谢所有参与者共同…

机器人 AI 摘要 · 单一来源
@nvidia 阅读 →

MiniMax M3发布:开源模型集成百万token上下文与Agent能力

MiniMax M3具备前沿编码和代理能力,支持原生图像视频输入及计算机使用。核心创新为MSA稀疏注意力架构,查询仅需评分128-token KV块并仅对高分块执行注意力,使百万token上下文服务…

大模型 AI 摘要 · 单一来源
@vllm_project 阅读 →