chore: sync fork with upstream master #2
|
|
@ -0,0 +1,60 @@
|
|||
# 260612 AI Infra 今日速递
|
||||
|
||||

|
||||
|
||||
|
||||
|
||||
```Markdown
|
||||
🥢「源来有饭」正式启动计划
|
||||
|
||||
我们计划在端午后做第一期 **开源 x AI Infra** 主题交流,邀请行业大佬时间暂定晚上 **19:00-21:00**。
|
||||
|
||||
想问问大家更喜欢哪种场地:
|
||||
|
||||
- 咖啡厅
|
||||
- 酒吧
|
||||
- 学校空间
|
||||
- 其他(大家可以随便提哦~)
|
||||
|
||||
欢迎回复你喜欢的场地,也可以顺手留下一个想聊的开源 x AI 问题。
|
||||
```
|
||||
|
||||
### 腾讯混元升级开源推理算子库 HPC-Ops
|
||||
|
||||

|
||||
|
||||
腾讯混元完成旗下高性能推理工具库 HPC-Ops 的全面升级并正式开源。本次更新不是零散的小优化,而是对大模型推理全流程进行了整套性能升级,专门解决线上业务常见的推理延迟高、长文本卡顿、显存开销大、多卡通信低效等工程难题。升级覆盖五大核心模块,分别对应注意力计算、路由矩阵计算、MoE混合专家模型、多卡通信归一化以及模型末端采样环节,全方位补齐推理性能短板。这套优化方案经过腾讯真实业务场景打磨,适配主流硬件设备以及 vLLM、SGLang 等热门推理框架,开源后开发者可直接落地使用,快速搭建低延迟、高吞吐、高稳定性的大模型线上服务。根据官方测试数据,长文本推理最高提速近3倍,主流MoE模型性能提升1.2–1.6倍,末端采样环节最高提速8.5倍,整体服务处理能力提升30%以上,兼顾推理精度与运行效率。
|
||||
|
||||
|
||||
|
||||
### MiniMax 开源稀疏注意力算子库 MSA
|
||||
|
||||

|
||||
|
||||
MiniMax 推出全新开源工具 MSA,这是一款专为新一代 NVIDIA 显卡深度优化的稀疏注意力加速算子库,开源协议宽松,可供开发者自由使用。工具核心聚焦大模型长文本推理场景,集成稀疏注意力加速、常规密集注意力、低精度显存压缩解码等实用能力,能够有效减少推理过程中的算力浪费,大幅降低显存占用。该工具被认为有助于补齐新一代GPU适配稀疏大模型推理的开源工具生态,为开发者优化长文本大模型推理效率、降低部署成本提供了新的选择。
|
||||
|
||||
|
||||
|
||||
### Apache Burr:开源 AI Agent 运行框架
|
||||
|
||||
Apache 旗下开源项目 Burr 近期在技术社区热度飙升,成为 AI 智能体开发领域的热门工具。这是一款轻量化 AI Agent 开发运行框架,全程基于纯 Python 编写,无需学习复杂专属语法,上手门槛极低。Burr 最核心的优势是状态管理能力,支持自动保存任务进度、任务暂停续跑、全流程监控调试,同时具备人工审核、多任务并行执行等企业级实用功能。据社区讨论和部分用户反馈,相比 LangChain 等传统主流框架,Burr 在稳定性、生产环境适配、调试体验和技术栈兼容性上受到不少开发者关注,可用于搭建聊天机器人、复杂多智能体系统等各类 AI 应用。
|
||||
|
||||
|
||||
|
||||
### HelixDB:面向 AI Memory 的开源图向量数据库
|
||||
|
||||
专为大模型与AI智能体打造的开源图向量数据库 HelixDB,近期在开发者社区走红。该数据库采用高性能 Rust 语言开发,最大特色是多功能一体化,集成向量、图结构、文档、键值等多种数据存储能力,无需搭配多款数据库组合使用。高度适配大模型知识库搭建、RAG 检索、AI 智能体长期记忆存储等核心场景,可用于解决 AI 应用的记忆留存、关联知识检索等问题,是面向 AI 项目落地的一类开源存储方案。
|
||||
|
||||
|
||||
|
||||
## 重要开源项目更新
|
||||
|
||||
NVIDIA 发布 NCCL EP v0.1.0,针对 MoE 模型的专家并行通信场景做了专项优化
|
||||
|
||||
|
||||
|
||||
Weaviate v1.38.0 发布,优化索引性能与内存占用,上线多租户隔离预览能力,新增嵌套对象过滤、Schema属性重建索引等实用功能
|
||||
|
||||
|
||||
|
||||
Milvus v2.6.18 发布,补齐可空向量字段、结构体数组元素级向量搜索等全新能力,优化高负载场景下的查询调度、服务恢复机制与Arrow IO读写性能
|
||||
|
|
@ -0,0 +1,102 @@
|
|||
# 260616 ai infra
|
||||
|
||||
## 一、「Open source AI must win」:一场戳中从业者痛点的社区大讨论
|
||||
|
||||

|
||||
|
||||
这几天Hacker News热度最高的帖子,标题直白得很——《Open source AI must win》。没有花哨的论证包装,一句话的观点却精准戳中了很多开发者的情绪,短短几天攒下上千热度,几百条评论吵得不亦乐乎。
|
||||
|
||||
|
||||
|
||||
发帖人的核心想法很简单:如果AI这项下一代生产力工具,完完全全掌握在少数几家闭源公司手里,整个行业都会陷入被动。今天可以随意调整定价,明天可以改动服务规则,甚至说停服就停服,所有依赖它的开发者和企业,都只能被动接受。只有开源的AI生态,才能真正把能力交到更多人手里,守住技术的自主性。
|
||||
|
||||
|
||||
|
||||
底下的评论里,大家的态度也各有不同:
|
||||
|
||||
最多人认同的是反垄断的判断——毕竟大家都吃过技术垄断的亏,AI作为未来的数字基础设施,要是被少数公司攥在手里,创新的门槛只会越来越高,最后全行业都要为垄断买单。
|
||||
|
||||
也有不少人保持理性,觉得“开源必胜”说起来解气,落地却没那么容易。现在前沿大模型的训练成本水涨船高,普通团队根本难以承担,开源模型和闭源模型的能力差距,到现在也还实实在在地摆在那;而且完全无约束的开源也会带来安全隐患,这个平衡点要怎么找,行业至今也没标准答案。
|
||||
|
||||
还有人点出了当下最尴尬的现状:几乎所有科技公司都在囤开源模型做技术储备,但真到了生产环境的核心场景,大家用得最多的还是闭源API。开源模型看起来无处不在,但真要让它独挑大梁,还差不少火候。
|
||||
|
||||
聊到最后也没人能给出确定的答案,我们也想问问你:
|
||||
|
||||
- 你觉得开源AI最终能追上甚至超过闭源模型吗?
|
||||
- 平时工作里,你会优先选开源模型还是闭源API?最看重什么?
|
||||
- 如果开源模型能力能达到闭源多少,你会考虑全面切换吗?
|
||||
|
||||
|
||||
|
||||
## 二、Loop Engineering走红:AI编程的下一个主流方向?
|
||||
|
||||

|
||||
|
||||
聊完大的路线之争,这周开发者圈还火了一个新概念——Loop Engineering(循环工程),不少大厂技术负责人都在转发讨论,认为这会是接下来AI编程的核心方向。
|
||||
|
||||
|
||||
|
||||
这个概念最早由Anthropic Claude Code负责人Boris Cherny带火,后来Google工程师Addy Osmani正式将其总结为Loop Engineering。
|
||||
|
||||
提出者的核心观点是:人和AI的协作模式正在一步步升级。最开始大家做Prompt Engineering,靠写好提示词让AI一次输出结果;后来有了Agent模式,给AI配好工具、定好目标,让它自主执行几步,但还是离不开人工监控。
|
||||
|
||||
而Loop Engineering就是再往前推进一步:开发者不用再逐轮跟AI对话、调整提示词,只需要设计一套自动运行的闭环系统,定好最终目标、执行规则和验证标准,系统就会自动反复调用AI、验证输出结果、调整下一步指令,直到任务完成。人要做的,是维护好这套循环规则,不用再陷进重复的单轮沟通里。
|
||||
|
||||
|
||||
|
||||
简单说,就是从“人指挥AI单步干活”,变成“人设计系统,系统驱动AI自动闭环干活”。在提出者看来,这种模式能把人从大量重复的调prompt、改输出的工作里解放出来,尤其适合批量代码修复、标准化项目开发这类高频重复场景,能把AI的提效潜力再放大一截。
|
||||
|
||||
|
||||
|
||||
当然也有不少人觉得,这个说法多少有点新瓶装旧酒,概念大于实际价值。
|
||||
|
||||
|
||||
|
||||
## 三、MiniMax开源M3,Kimi上线Code高速版
|
||||
|
||||
<grid>
|
||||
<column width-ratio="0.528409">
|
||||

|
||||
</column>
|
||||
<column width-ratio="0.471591">
|
||||

|
||||
</column>
|
||||
</grid>
|
||||
|
||||
6月15日,MiniMax正式开源旗下旗舰多模态模型M3,同步发布MSA稀疏注意力技术论文,这套架构专门针对长上下文场景优化,能大幅降低长文本推理的计算成本。推理框架vLLM也同步完成了对M3的Day-0适配,开发者拿到权重即可直接部署多模态、长上下文推理能力。
|
||||
|
||||
同一天,月之暗面上线Kimi K2.7 Code高速版本。该版本与普通版基于同一模型,通过工程优化将输出速度提升至普通版的5-6倍,常规编程场景下可达180 Token/s,短上下文场景更是能到260 Token/s;定价为普通版的2倍,相当于用两倍成本换取五六倍的生成效率。这款主打高速编程的模型也在Hacker News上收获了不少关注,不少开发者认为,思考模式搭配高速输出的组合,已经能覆盖大部分日常编程需求,性价比十分突出。
|
||||
|
||||
|
||||
|
||||
## 四、微信支付AI接入工具箱升级2.0
|
||||
|
||||

|
||||
|
||||
今年4月推出的1.0版本,主打的是“一行指令接入”:把支付相关开发能力打包成Skill技能包,搭配AI友好的文档与API,开发者在IDE里输一行命令就能加载,不用再翻阅厚重的开发文档。
|
||||
|
||||
|
||||
|
||||
升级到2.0之后,实用性进一步提升:功能覆盖从仅支持支付、券类,扩展至微信支付全产品体系;新增两大AI专家能力,既能支持全链路排障,还能从金融级安全标准出发做代码质量审查。
|
||||
|
||||
最大的优化是,文档内所有时序图、状态图都改为了Mermaid格式,AI无需调用图像识别即可直接理解语义,整体Token消耗相比原始HTML文档降低50%,能省下不少调用成本。同时工具还支持9种语言,覆盖全球主流开发者群体,并新增了知识库自动同步功能,官网内容更新后本地会自动同步,无需手动维护。
|
||||
|
||||
|
||||
|
||||
## 五、Chainguard发起Athena开源安全联盟,Docker等二十余家企业加入
|
||||
|
||||

|
||||
|
||||
6月15日,开源安全公司Chainguard联合多家行业企业,正式发起Athena开源安全联盟,这也是行业内首个专门针对AI时代开源软件漏洞防护的跨行业组织。
|
||||
|
||||
|
||||
|
||||
目前联盟的创始成员已达二十余家,覆盖云服务、容器技术、金融等多个领域,思科、Cloudflare、Docker、摩根大通、普华永道等企业均在其中。
|
||||
|
||||
|
||||
|
||||
发起这个联盟的核心背景,是AI技术彻底打乱了漏洞攻防的节奏。过去攻击者挖掘、利用漏洞需要很长周期,现在借助AI,数小时内就能完成从发现漏洞到发起攻击的全流程,远快于人工修复的速度,漏洞从披露到被滥用的窗口期正在急剧缩短,单靠某一家公司的能力,根本跟不上攻防的节奏。
|
||||
|
||||
|
||||
|
||||
而Athena联盟要做的,就是整合各家的漏洞发现能力,借助AI批量生成修复补丁,赶在漏洞被公开滥用之前输出解决方案,统一协调开源项目的安全披露与补丁落地工作。根据公开信息,目前联盟已处理超过2万条漏洞发现,为500多个开源项目生成了2000多个修复补丁 ,第一批漏洞的公开披露将于下个月启动。
|
||||
|
|
@ -0,0 +1,79 @@
|
|||
# 260618
|
||||
|
||||
端午安康!祝大家假期松弛有度,学习、工作皆顺遂~
|
||||
|
||||

|
||||
|
||||
刷 X 时被一款 AI 辅助打造的水面交互网页戳中审美,鼠标在画面上移动,水面就会荡开一圈圈波纹,水里飘着的小花也跟着轻轻晃动,波光看着特别真实。大家可以点击这个去体验一下:[https://pastel-lab.pages.dev/flower-water-ripples/](https://link.wtturl.cn/?target=https%3A%2F%2Fpastel-lab.pages.dev%2Fflower-water-ripples%2F&scene=im&aid=497858&lang=zh)(来源:X:@konmari_tweet)
|
||||
|
||||
## 一、NVIDIA:Agent框架&具身智能双更新
|
||||
|
||||
NVIDIA近期持续加码AI Agent与机器人具身智能赛道,接连放出两款核心能力,补齐企业私有化部署与自动化实验基建。
|
||||
|
||||
**1、NemoClaw 开放框架 + Agent Toolkit 正式亮相**
|
||||
|
||||
在HPE Discover 2026大会上,NVIDIA正式公开NemoClaw开放框架与配套Agent Toolkit工具集。整套方案内置Nemotron开源模型、安全运行 runtime 与标准化Agent开发蓝图,深度适配企业私有云场景。主打**企业级Agent治理、多智能体协作、行为管控**,搭配NVIDIA机密计算能力,实现从模型运行、工具调用到数据安全的全栈防护,帮助企业快速落地可管控、可生产的私有化AI Agent系统。
|
||||
|
||||
**2、GEAR 发布 ENPIRE 机器人实验平台**
|
||||
|
||||
NVIDIA GEAR联合CMU、UC Berkeley推出ENPIRE平台,核心突破是让AI编程Agent**自主操控真实机器人完成全流程实验**。无需人工干预,AI可自动搭建实验环境、重置场景、执行测试、收集数据、分析报错、迭代优化代码,大幅降低具身智能与机器人算法的研发试错成本,项目后续将开源全部代码。
|
||||
|
||||
## 二、开源大模型集中上新
|
||||
|
||||
**1、智谱 GLM-5.2 正式开源(MIT 商用许可)**
|
||||
|
||||

|
||||
|
||||
智谱重磅开源GLM-5.2,核心亮点是**1M真实可用超长上下文**、极致强化代码能力与长程Agent任务表现。实测可稳定处理88万+token不丢信息,能独立完成完整软件项目开发、联调、测试、上线全流程。在权威代码评测榜单中稳居开源模型第一梯队,代码能力逼近顶级闭源模型,且支持全场景商用,适配各类国产算力,是目前长程Agent、代码私有化部署的最优基座之一。
|
||||
|
||||
**2、通义千问 Qwen-Robot Suite 具身智能模型发布**
|
||||
|
||||

|
||||
|
||||
阿里通义千问推出Qwen-Robot Suite,包含三款专业级具身智能基础模型,针对性适配机器人感知、决策、运动控制核心场景。为机器人、工业数字孪生、智能设备等具身AI应用提供现成底座,大幅降低行业具身智能的从零开发门槛。
|
||||
|
||||
## 三、算力&推理基建升级
|
||||
|
||||
**1、MiniMax 开源 MSA 稀疏注意力推理内核**
|
||||
|
||||
MiniMax开源面向NVIDIA SM100 GPU的MSA稀疏注意力推理内核,MIT许可可免费商用,支持BF16、FP8、NVFP4等多精度推理。和传统全量注意力机制不同,MSA采用**分支筛选+精准计算**逻辑:先用索引分支筛选关键Token块,再用主分支做精准Attention计算,跳过无效冗余计算,专门解决长上下文推理算力浪费、速度慢、成本高的痛点,长文本场景推理效率远超传统方案。
|
||||
|
||||
**💬 读者互动讨论**
|
||||
|
||||
长文本推理越来越卷,你觉得稀疏注意力会成为未来大模型推理的标配优化方案吗?
|
||||
|
||||
**2、Google 上线 TPU Developer Hub**
|
||||
|
||||
Google推出一站式TPU开发者中心,整合TPU预训练、微调、推理加速、XLA调试、PyTorch迁移、KV Cache卸载、内核优化等全流程教程与开源代码模板。彻底解决开发者TPU资料零散、适配困难、优化无思路的问题,大幅降低TPU算力的上手与落地门槛,完善Google AI算力生态。
|
||||
|
||||
## 四、社区热点:轻量化长上下文模型 + 小模型Agent提质方案
|
||||
|
||||
本周Hacker News社区两大热门话题,全部围绕「低成本、高效率AI Agent落地」展开,非常贴合中小团队实用开发场景。
|
||||
|
||||
**1、社区讨论:SubQ 1.1 Small 轻量化长上下文模型**
|
||||
|
||||
行业社区持续热议SubQ 1.1 Small模型,主打**小参数、低成本、长上下文能力**。区别于GLM-5.2这种超大基座模型,它主打轻量化部署,无需高算力硬件,就能实现不错的长文本理解与信息召回效果,非常适合端侧AI、轻量个人Agent、低成本长文档检索场景,给中小开发者提供了高性价比的长文本AI落地选择。
|
||||
|
||||
**2、HN爆款:Forge护栏让8B小模型逆袭Agent任务**
|
||||
|
||||
Show HN热门项目Forge引发大量讨论:通过工程化Guardrails安全护栏与任务约束机制,直接将普通8B开源小模型的Agent任务成功率,从**53%暴涨至99%**。核心逻辑不靠堆模型参数、不靠调用昂贵闭源API,而是靠标准化流程约束、任务校验、行为管控,补齐小模型逻辑弱、稳定性差的短板。这也让社区掀起新讨论:**工程优化或许比盲目堆模型更大程度决定Agent落地效果**。
|
||||
|
||||
**💬 读者互动讨论**
|
||||
|
||||
轻量化长文本小模型 + 工程护栏优化,会不会成为未来平民化AI Agent落地的主流方案?
|
||||
|
||||
## 五、开发者工具更新:Agent代码托管 + 数据抓取基建升级
|
||||
|
||||
**1、Cursor 发布 Origin:AI Agent 原生代码托管平台**
|
||||
|
||||
Cursor正式推出Origin平台,是业内首款**专为AI Agent协作设计的代码托管平台**,原生兼容Git协议。和传统GitHub有本质区别:GitHub是为人与人协作设计的,适配人工开发流程;而Origin深度适配AI Agent高频自动提交、批量合并冲突、AI自动代码审查、智能迭代工作流,完美适配当下「人+AI Agent协同开发」的全新模式,是AI编程时代的专属基建。
|
||||
|
||||
**2、Firecrawl 取消 API Key 门槛,零成本即用**
|
||||
|
||||
主流AI网页抓取工具Firecrawl重磅减负,网页搜索、全站内容抓取、PDF转Markdown等核心功能,**无需注册、无需申请API Key、零门槛直接使用**,同时支持MCP、CLI、API三种接入方式。对开发者而言,彻底省去账号注册、密钥配置、权限审核等繁琐步骤,快速搭建检索Agent、采集公开数据、验证产品原型的效率大幅提升。
|
||||
|
||||
**3、硬核实战:EC2+Firecracker实现1秒极速浏览器冷启动**
|
||||
|
||||

|
||||
|
||||
Browser-use团队公开顶级AI浏览器Agent基建实战方案:在普通EC2虚拟机中嵌套运行Firecracker微虚拟机,为每一个浏览器会话独立分配隔离微VM。最终实现**浏览器冷启动时长<1秒**,同时将单小时运行成本压缩至0.02美元。文章公开了嵌套虚拟化性能优化、大内存页调优、高并发会话调度、浏览器隐身防检测等核心技术细节,是搭建网页自动化、浏览器Agent、批量数据抓取场景的顶级参考案例。
|
||||
|
|
@ -0,0 +1,93 @@
|
|||
# 260622
|
||||
|
||||
## Google OpenRL:Kubernetes 原生强化学习微调框架开源
|
||||
|
||||
谷歌云实验室开源适配容器集群的大模型调优工具OpenRL,把模型训练拆分为样本采集、参数更新、数据存储等独立模块,可并行启动多组训练任务,缓解硬件空等造成的算力浪费。
|
||||
|
||||
市面上同类调优工具大多需要额外适配容器集群,OpenRL原生基于集群调度逻辑设计,硬件利用率更有优势,完整项目代码已对外公开。
|
||||
|
||||
|
||||
|
||||
## llm-d 成为 CNCF 沙箱孵化项目,容器原生大模型推理工具开源落地
|
||||
|
||||

|
||||
|
||||
llm-d由IBM、红帽、谷歌云联合捐赠进入开源基金会孵化,专为容器集群设计大模型在线推理能力,文本生成的两个阶段可分开扩容,缓存资源分层调度,搭配智能路由分配请求。
|
||||
|
||||
实测生成首段文字延迟降低三分之二,整体处理效率直接翻倍,适配英伟达、AMD、英特尔各类加速硬件,多家云厂商、AI企业共同参与项目共建。多数推理工具先开发核心能力再兼容容器环境,资源弹性调度能力弱于llm-d原生设计。
|
||||
|
||||
|
||||
|
||||
## Linux 7.2 正式移除 strncpy 函数:历时 6 年、362 份代码修改
|
||||
|
||||

|
||||
|
||||
Linux内核彻底移除沿用多年的字符串拷贝函数strncpy,整体优化周期长达六年,累计完成362处代码调整。长期以来业内普遍诟病该函数存在设计缺陷,复制文本后不会自动补全结束标识,极易引发内存溢出、信息泄露等系统安全隐患,大量内核安全漏洞都源于该函数不当使用。
|
||||
|
||||
官方推出四类全新替代函数,全部内置边界校验逻辑,从设计上规避错误操作。本次调整仅针对系统内核内部代码,日常软件开发不受影响。
|
||||
|
||||
|
||||
|
||||
## Project Valhalla 进入 JDK 28 预览版:近十年Java语言规模最大升级
|
||||
|
||||
Java底层优化项目Valhalla的核心轻量化数据类型功能,纳入JDK28预览版本,本次更新修改近19.7万行代码、调整1816个文件,是近十年语言层面改动幅度最大的一次更新。
|
||||
|
||||
Java过往所有数据内容都需要单独开辟内存空间存储,简单数字封装后会附带冗余信息,高并发数据计算场景下会频繁触发内存回收,拖累整体运行速度。轻量化数据类型可直接存放于临时内存,省去多余封装开销,减少内存占用、降低回收频次,对大数据、高并发服务提升明显。该功能需手动开启预览参数使用,后续版本仍可能调整接口设计。
|
||||
|
||||
|
||||
|
||||
|
||||
|
||||
|
||||
|
||||
## ClickHouse 开源 10 周年
|
||||
|
||||
ClickHouse迎来开源十周年,项目从Yandex内部数据分析工具,成长为全球广泛使用的列式数据库,十年关键发展节点:
|
||||
|
||||
- 2016年正式开源,凭借超快的数据查询速度在大数据领域快速普及
|
||||
- 2021年成立独立商业公司,搭建商业化服务体系
|
||||
- 2023年上线云端托管服务,全球参与开发的技术人员突破千人
|
||||
|
||||
目前金融、互联网、物流等行业数据分析场景,大多会选用ClickHouse作为核心数据存储工具,也是海外极具代表性的开源数据库项目。
|
||||
|
||||
|
||||
|
||||
> 大家最早是哪一年入坑 ClickHouse?你平时用 CK 主要做什么场景?
|
||||
|
||||
|
||||
|
||||
## 首个统一科研大模型 LOGOS 正式开源
|
||||
|
||||

|
||||
|
||||
阿里通义实验室联合人大高瓴人工智能学院,开源面向科研场景的通用大模型LOGOS,自研统一文本转换规则,把蛋白质、化学分子、新材料等不同研究对象转化为统一文本标识,打通不同学科之间的知识复用。
|
||||
|
||||
仅10亿参数的LOGOS-1B,在分子生成、蛋白结构预测、新材料设计等科研任务中,效果对标各领域专用模型。完整模型权重、运行代码与技术文档全部公开,可直接复用通用大模型轻量化、加速工具,降低落地成本。
|
||||
|
||||
|
||||
|
||||
## Data2Story:7套AI分工,表格数据自动生成可溯源交互式新闻
|
||||
|
||||
牛津大学与斯坦福大学研发Data2Story工具,依靠七套分工不同的AI模块搭建全自动数据新闻生产链路,上传表格文件就能产出附带原始依据的交互式报道。
|
||||
|
||||
七套AI分别负责资料检索、数据计算、内容撰写、图表制作、页面生成、逻辑校对、证据标注,每一段文字、每一张图表均可溯源对应计算代码与参考资料,完整核验信息真实性。读者实测反馈中,内容可信度评分远高于纯人工稿件。该工具定位新闻行业辅助工具,负责标准化数据产出,从业者可专注深度观点与创意内容创作。
|
||||
|
||||
|
||||
|
||||
## 反对Meta采集员工工作数据训练AI的线上请愿
|
||||
|
||||
行业技术从业者发起线上请愿,反对Meta在未获得员工明确许可的前提下,收集内部聊天记录、工作文档用于模型训练。业内主流观点认为,企业不能无限制取用员工工作产出训练AI,行业需要明确工作数据的使用边界;也有不同声音表示,入职协议已约定工作成果归属,企业合规采集数据训练具备法律依据,行业针对AI训练数据所有权的争议仍在持续。
|
||||
|
||||
|
||||
|
||||
## NVIDIA ACE游戏AI工具开放测试,本地小模型无缝适配虚幻引擎5
|
||||
|
||||

|
||||
|
||||
英伟达ACE游戏智能NPC开发工具开启Beta测试,轻量开发框架内置文字决策模型与语音生成模型,8G显存显卡即可本地运行,原生适配虚幻引擎5。绝地求生开发团队KRAFTON已接入工具制作可对话智能NPC,配套相关插件同步开源。
|
||||
|
||||
|
||||
|
||||
## 小米发布并开源全屋智能AI方案 Xiaomi Miloco 2.0
|
||||
|
||||
小米开源第二代全屋智能AI方案Miloco 2.0,基于自研MiMo大模型接入OpenClaw智能体生态,支持家人身份识别、生活习惯记忆,可离线全天候本地运行,实现主动式家居自动调度,也是OpenClaw生态新增的终端AI落地方案。
|
||||
|
|
@ -0,0 +1,53 @@
|
|||
# 260624
|
||||
|
||||
在贴吧刷到的一个好玩的帖子,分享给大家。
|
||||
|
||||

|
||||
|
||||
**01/ Claude Tag上线,支持Slack团队异步AI协作**
|
||||
|
||||

|
||||
|
||||
作为企业常用的团队协同办公平台,Slack承载着企业内部消息同步、分组频道办公、团队任务联动等日常协作工作。Anthropic此次推出的Claude Tag,能够直接将Claude智能体部署为常驻Slack频道的AI协作助手。该功能支持全天候后台在线运行,团队成员只需在对应频道内@该智能体即可下发工作指令,无需反复新建对话窗口。面对复杂工作任务,智能体可以自主拆分执行步骤,按需调用办公工具,并且支持异步处理任务,即便团队成员离线,也能持续完成既定工作流程,弥补了传统AI助手仅支持一对一即时对话、无法融入常态化团队办公流程的不足。
|
||||
|
||||
**02/ Anthropic发布Claude Agent SDK开发工具**
|
||||
|
||||
官方推出Claude Agent SDK,适配Python和TypeScript两种主流开发语言,原生兼容MCP模型上下文协议。工具内置子智能体调度、工具调用、上下文管理基础能力,降低开发者搭建生产级多智能体系统的开发难度。
|
||||
|
||||
**03/ IBM公开CUGA智能体框架实战案例**
|
||||
|
||||

|
||||
|
||||
IBM同步放出24组可直接复用的落地案例,覆盖智能体落地落地三大核心工作场景,每组案例都搭配完整实测运行效果。依托案例能力,智能体可自主拆解复杂开发与办公任务,减少人工分步提示的操作成本;也能独立调用浏览器、文档工具、接口调试工具完成全链路操作,减少人工中途干预;同时还能自动核验任务执行结果,自主修正运行错误。这套案例可以帮助开发者快速搭建标准化智能体工作流,该框架在AppWorld、WebArena两大权威智能体基准测评中均取得第一,兼容LangChain、MCP、OpenAPI主流开发生态,整体代码基于Apache 2.0协议开源,无商用使用限制。
|
||||
|
||||
**04/ Prime Intellect发布万亿参数大模型强化学习框架**
|
||||
|
||||
Prime Intellect正式开源prime-rl v0.6.0,该框架专门面向万亿参数MoE混合专家大模型做强化学习训练优化。实测仅需28台H200节点,感觉你改的这GLM-5大模型,同时搭载多项推理底层优化方案,支持大规模GPU集群并行训练。
|
||||
|
||||
**05/ vLLM接入NVIDIA DFlash技术,大幅提升推理速度**
|
||||
|
||||
主流推理框架vLLM完成NVIDIA DFlash推测解码技术适配,实测在指定硬件与模型环境下,推理吞吐率相比传统自回归解码提升4.4倍至5.8倍。目前该项技术已经兼容多款主流开源推理框架。
|
||||
|
||||
**06/ AMD更新librocdxg库,优化WSL环境GPU算力使用体验**
|
||||
|
||||

|
||||
|
||||
librocdxg是ROCm算力生态中关键的底层调度库,主要承担系统、WSL虚拟机与AMD独显之间的数据交互与硬件调度工作,负责管控GPU算力分配、显存调度以及硬件指令转发。本次1.22.1版本重点适配Windows 11下的WSL运行环境,同步推出专属Ubuntu安装包,并且内置amdsmi硬件管理程序。此次更新一方面简化了ROCm算力栈的安装部署流程,优化过往版本在WSL环境下安装繁琐、适配报错频繁的问题;另一方面补齐Windows平台下AMD显卡的运维监控能力,开发者可以直观查看显卡算力占用、显存使用率、硬件温度等运行数据,有效缩小了AMD与NVIDIA在Windows端GPU通用计算生态的使用体验差距。
|
||||
|
||||
**07/ Zyphra开源ZAYA1-8B大模型,全程基于AMD算力训练**
|
||||
|
||||
Zyphra基于Apache 2.0协议开源ZAYA1-8B大模型,该模型全程使用AMD Instinct算力芯片从零训练而成。该项目证明,脱离NVIDIA算力生态,同样可以训练出性能达标的开源大模型。
|
||||
|
||||
**08/ 百度开源Unlimited-OCR文档解析大模型**
|
||||
|
||||
百度开源3B参数文档解析模型Unlimited-OCR,模型支持32K上下文长度,单次可以完成40页以上PDF文档解析,官方基准测试表现优异。模型支持多种本地部署方式,相关开源动态登上Hacker News热门榜单。
|
||||
|
||||
**09/ RAGFlow开源项目GitHub星标突破7万**
|
||||
|
||||
开源检索增强生成框架RAGFlow GitHub star数量突破7万,工具支持多格式文件解析、混合检索以及智能体工作流联动,目前已经广泛应用于企业知识库搭建、AI合规审查等生产场景。
|
||||
|
||||
**10/ OpenAI发起开源项目安全漏洞修复计划**
|
||||
|
||||

|
||||
|
||||
OpenAI携手Trail of Bits、HackerOne两家业内知名网络安全厂商,联合发起Patch the Planet开源软件漏洞修复专项计划。项目旨在补齐开源软件供应链普遍存在的安全短板,依托GPT-5.5-Cyber安全专用大模型,自动化完成漏洞扫描、风险等级判定、修复补丁生成全流程工作。项目覆盖cURL、Python、Go、freenginx等三十余款行业底层核心开源软件,所有由AI生成的漏洞报告与修复补丁,都会经过专业安全工程师人工复核,确认无误后再提交给对应项目维护团队。在首期五天的专项迭代中,项目已经完成数十个安全补丁合并工作,同时挖掘出多组高危漏洞,能够有效规避开源软件供应链带来的网络安全风险。
|
||||
|
|
@ -0,0 +1,93 @@
|
|||
<title>260626</title>
|
||||
|
||||
|
||||
|
||||
# 01|OpenAI自研推理芯片Jalapeño曝光,台积电3nm工艺打造完整自研硬件路线
|
||||
|
||||

|
||||
|
||||
近期海外行业媒体与科技爆料人放出行业一手消息,OpenAI首款自研推理芯片Jalapeño已完成全部设计工作。这款芯片由OpenAI联合博通Broadcom联合开发,初代产品确定交由台积电3nm制程流片,也意味着OpenAI正式落地专属ASIC自研路线,改变长期依赖第三方通用GPU承载云端推理的模式。
|
||||
|
||||
|
||||
|
||||
通用GPU为兼顾图像渲染、训练、推理多类场景,内部存在大量冗余计算单元,运行大模型推理任务时算力利用率很难拉满。OpenAI这次多年立项打磨的芯片,完全围绕自身GPT系列大模型做底层适配,重点优化长上下文、批量并发、低延迟交互三大推理核心场景,剔除无关硬件模块,把晶体管资源全部倾斜给Transformer运算单元。
|
||||
|
||||
|
||||
|
||||
除初代Jalapeño外,第二代Jalapeño2已进入预研阶段,规划采用台积电A16工艺搭配CoWoS先进封装。先进封装技术能够实现多颗芯片高密度堆叠互联,大幅提升芯片间数据传输带宽,支撑万卡级大规模推理集群协同运行。
|
||||
|
||||
|
||||
|
||||
目前官方暂未公布流片、样片测试、服务器量产搭载的准确时间,但业内普遍预判短期内会推出测试样片。长期来看,自研芯片能帮助OpenAI降低巨额推理硬件采购成本,同时摆脱外部供应链限制,掌握AI底层硬件自主可控能力,后续会逐步替换自有云集群中的外购通用显卡。
|
||||
|
||||
|
||||
|
||||
# 02|Linux基金会联合NVIDIA推出Akrites项目,构建面向AI新型攻击的开源软件安全屏障
|
||||
|
||||

|
||||
|
||||
Linux基金会联合NVIDIA及多家行业企业推出开源安全专项Akrites,项目诞生的核心背景,是当前AI工具被黑客批量用于自动化漏洞挖掘、攻击代码生成,全球底层开源软件供应链迎来全新安全风险。
|
||||
|
||||
|
||||
|
||||
很多企业业务、AI框架、操作系统都搭建在开源代码之上,过往传统漏洞披露流程分散在各个社区,响应速度参差不齐,面对AI批量渗透攻击很难快速统一处置。Akrites针对性搭建两套标准化机制,第一是共建行业共享SIRT安全应急响应团队,打通企业、开源社区之间的安全情报通道;第二是建立保密、统一的漏洞上报与修复流程。
|
||||
|
||||
|
||||
|
||||
一旦底层开源组件出现可被AI利用的高危漏洞,安全团队会第一时间同步给上游代码维护者,在漏洞被大规模攻击利用前完成补丁更新。覆盖范围包含开源操作系统、数据库、AI训练推理框架等全类型基础软件,给全球依赖开源生态的团队提供统一、标准化的AI网络威胁防护方案。
|
||||
|
||||
|
||||
|
||||
# 03|NVIDIA发布全液冷AI工厂完整落地方案,45℃闭路循环实现机房零耗水高密度算力部署
|
||||
|
||||

|
||||
|
||||
NVIDIA官方博客推出Rubin AI服务器配套全液冷AI工厂全套落地方案,是面向超大规模万卡AI集群成熟可复制的绿色散热实践方案,完全重构传统风冷、水冷机房建设逻辑。
|
||||
|
||||
|
||||
|
||||
常规AI机房会依靠大量轴流风扇完成空气对流散热,还要设计复杂冷热通道隔离布局,不仅噪音巨大,机架算力堆叠密度也存在明显上限。这套液冷方案直接取消全部机房散热风扇,采用45℃中温冷却剂闭路循环架构,冷却介质通过管路直接贴合处理器冷板换热,不需要空气作为热量传导介质。
|
||||
|
||||
|
||||
|
||||
水资源节约层面数据对比十分直观,传统水冷AI机房每兆瓦算力全年淡水消耗可达260万加仑,而NVIDIA闭路液冷系统介质全程内部循环,无任何淡水损耗,完全适配各地数据中心节水、减碳政策,长期运营能节约海量水资源。
|
||||
|
||||
|
||||
|
||||
机房运营层面优势同样突出,移除风扇后整体噪音大幅降低,同时不再受风道布局约束,单机架硬件部署密度显著提升,同等建筑面积可承载更多AI服务器,摊薄单卡算力场地建设成本。配套设施无需大功率辅助空调机组,机房整体PUE数值持续优化,综合能耗下降明显。整套方案已经形成标准化落地模板,云计算厂商、自建超算中心的企业都可以直接参考部署,兼顾高密度算力承载、低碳节能、低运维成本三类核心需求。
|
||||
|
||||
|
||||
|
||||
# 04|阿里开源Qwen-AgentWorld系列世界模型,35B与397B双规格构建通用智能体训练底座
|
||||
|
||||

|
||||
|
||||
阿里通义千问团队开源专门面向通用智能体训练的Qwen-AgentWorld语言世界模型,同步发布35B轻量版本与397B超大参数版本,完整代码开源至GitHub仓库QwenLM/Qwen-AgentWorld,配套技术论文上线arXiv预印本平台,同时自研专属评测基准AgentWorldBench,用来量化衡量世界模型与下游Agent综合能力。
|
||||
|
||||
|
||||
|
||||
具备AI基础的开发者清楚,传统智能体大多依靠对话、单步工具调用数据训练,很难理解现实世界因果逻辑、长时序复杂任务,做多步骤规划时极易出现逻辑断裂。Qwen-AgentWorld内置7大类完整可仿真真实Agent交互环境,覆盖工具调用、多步骤任务拆解、多角色协同、长期场景推演等主流智能体业务场景。
|
||||
|
||||
|
||||
|
||||
依托世界模型对现实规则、时序逻辑的深度建模能力,经过该系列模型预训练后的智能体,在多轮复杂指令执行、跨工具联动、长周期任务规划测试中,任务完成率相比传统训练方案有明显提升。项目全栈开放无商用限制,为国内开源Agent生态提供全新标准化训练路径,降低企业和独立开发者搭建高性能自主智能体的研发门槛。
|
||||
|
||||
|
||||
|
||||
# 05|FAST-LIVO2斩获IEEE TRO傅京孙纪念最佳论文奖,开源多传感器SLAM框架突破移动机器人感知痛点
|
||||
|
||||

|
||||
|
||||
开源机器人感知系统FAST-LIVO2拿下国际机器人顶刊IEEE TRO傅京孙纪念最佳论文奖,该奖项是全球移动机器人定位建图领域顶尖学术荣誉,代表SLAM方向年度顶尖研究成果,目前项目GitHub开源仓库星标已突破4.2k,被全球大量机器人研发团队落地使用。
|
||||
|
||||
|
||||
|
||||
FAST-LIVO2是一套激光、视觉、惯性三类传感器深度融合的里程计与实时建图完整系统,项目完整开放核心算法代码、海量多场景实测数据集、传感器硬件同步配套设备、多类机器人落地实操案例,打通从学术研究到工业产品落地的完整链路。
|
||||
|
||||
|
||||
|
||||
熟悉机器人感知技术的从业者都了解,单一激光或单视觉SLAM存在固有缺陷,在纹理稀少区域、设备高速运动、暗光环境下,很容易出现定位漂移、地图失真,直接影响机器人自主导航稳定性。FAST-LIVO2自研多传感器硬同步融合算法,精准对齐不同传感器采集数据的时间戳,同时轻量化算法架构保障终端设备实时运算效率。
|
||||
|
||||
|
||||
|
||||
这套框架适配机型覆盖小型机载无人机、轮式巡检机器人、人形服务机器人等多类硬件平台。本次能够斩获大奖,核心是同时实现算法理论创新与工程实用价值双重突破,既在多模态融合定位方向提出全新优化思路,又完整开源无使用壁垒,高校实验室、中小机器人企业无需高额研发投入就能直接复用,大幅降低自主导航机器人研发门槛,是当前开源机器人感知赛道标杆项目。
|
||||
|
|
@ -0,0 +1,85 @@
|
|||
<title>260629</title>
|
||||
|
||||

|
||||
|
||||
苹果上调 Mac、iPad 售价,对外将涨价归咎于 AI 热潮推高内存芯片成本。网上流传一段犀利吐槽,不少人误以为出自美光高管,实际只是财经博主创作的趣味段子。而美光科技首席商务官苏米特·萨达纳(Sumit Sadana)也在接受采访时暗示,苹果公司在当前的内存供应紧张局面中负有一定责任。
|
||||
|
||||
# 01 LangChain 推出Deep Agents提示词缓存方案
|
||||
|
||||

|
||||
|
||||
LangChain 上线了专门给长任务智能体用的提示词缓存功能,市面上各家大模型都能自动适配缓存规则。
|
||||
|
||||
他们拿真实智能体运行数据做过实测,整套方案最高能砍掉80%的token开销,最低也能减少49%。
|
||||
|
||||
平时业务里跑复杂多轮agent流程,调用成本会很高,这个缓存工具不用大改现有项目代码,接入就能直接降低花费。
|
||||
|
||||
|
||||
|
||||
# 02 DeepSeek 联合北大团队开源DSpark投机解码框架
|
||||
|
||||

|
||||
|
||||
2026 年 6 月 27 日,DeepSeek 联合北京大学发布论文《DSpark: Accelerating LLM Inference with Semi-Autoregressive Speculative Decoding》,创始人梁文锋为一作。
|
||||
|
||||
不同于单纯发布新模型,DSpark 是 DeepSeek 已经在自家 DeepSeek-V4-Flash、V4-Pro 线上生产引擎稳定跑了大半年的推理加速方案,替代了此前老旧的 MTP-1 单 token 预测方案;同步配套开源全套训练工具链 DeepSpec,是业内少有的草稿模型训练 + 推理部署全流程开源的推测解码方案。
|
||||
|
||||
上线实测数据极具冲击力:同等系统吞吐下,V4-Flash 单用户生成速度提升 60%-85%,V4-Pro 提速 57%-78%;在 120tok/s 的严苛服务标准下,整体 GPU 吞吐直接翻 6 倍以上,大幅降低 API 调用单位成本。
|
||||
|
||||
配套开源的 DeepSpec 仓库采用 MIT 协议,是一套完整的推测解码开发流水线,内置 DSpark、DFlash、Eagle3 三类主流算法实现,包含数据预处理、草稿模型训练、多维度评测全套脚本,原生兼容 Qwen3、Gemma 等主流开源大模型,开发者可快速为各类基座训练专属加速草稿模型,降低大模型线上服务、私有化部署的推理优化门槛。普通用户无需本地部署,调用 DeepSeek 网页、API 即可自动启用 DSpark 加速;企业开发者可依托 DeepSpec 完整复现、适配这套推理提速方案。
|
||||
|
||||
相比于市面上以往的AI加速方案,DSpark最大的亮点就是既跑得快,又不乱跑、还稳得住,一口气解决了传统加速技术的三个通病。过去主流的加速方案要么是逐字慢慢生成、速度提不上来,要么是一次性批量瞎生成一大堆文字、前后逻辑对不上、大部分内容被大模型驳回,而且不管服务器忙不忙都用一套固定规则,高峰期极其浪费算力。而DSpark做了全新优化:它采用**半自回归的混合生成方式**,平时批量快速出内容保证速度,同时会自动检查一段文字内部的前后逻辑,避免出现语句错乱、前言不搭后语的问题,草稿质量大幅提升;其次它搭载了**智能动态校验机制**,能实时感知服务器负载,空闲时就大胆多生成、多校验,把速度拉满,高峰期就智能精简无效内容,不浪费算力、不拖垮整体服务;最后它一改行业只开源推理代码的常态,**配套完整的训练工具链**,不止能直接用,还支持所有开发者自己训练、适配各类大模型,真正把大模型推理提速从“实验室炫技”变成了能稳定落地、人人可用的工程方案。
|
||||
|
||||
|
||||
|
||||
# 03 Hugging Face Jobs一条命令拉起vLLM推理服务
|
||||
|
||||
Hugging Face更新简易部署教程,仅需一行命令,就能在HF Jobs平台搭建兼容OpenAI接口的vLLM推理服务器。
|
||||
|
||||
不用手动配置复杂环境,适合短期测试开源模型、临时跑短期推理任务,大幅降低小团队、个人开发者的试错成本。
|
||||
|
||||
|
||||
|
||||
# 04 英伟达开源NeMo AutoModel,MoE模型微调提速3.7倍
|
||||
|
||||
英伟达推出开源工具NeMo AutoModel,基于新版Transformers开发,接入门槛极低,只需要一行import代码就能启用全部加速能力。
|
||||
|
||||
传统MoE微调工具缺少专门的专家通信组件,多卡分布式训练时,专家之间的数据传输损耗严重,拖慢整体训练速度。
|
||||
|
||||
这个工具原生集成DeepEP通信组件、专家并行策略以及TransformerEngine硬件加速,直接解决多专家路由、数据分发的性能瓶颈。同等硬件、数据集条件下,混合专家模型微调速度直接提升3.7倍,做大参数量MoE模型能省下大量训练时间。
|
||||
|
||||
|
||||
|
||||
# 05 Meta开源Astryx前端设计系统,适配AI智能体使用
|
||||
|
||||
Meta发布Beta版Astryx开源React设计系统,新增配套CLI命令行工具和MCP服务。
|
||||
|
||||
升级之后AI智能体可以直接读取项目内全部组件、设计规范Token、配套开发文档。
|
||||
|
||||
不管是让AI自主解析页面结构、自动产出组件代码,还是批量检查设计规范统一度都能实现,完整打通前端开发和AI智能体,搭建自动化前端工作流。
|
||||
|
||||
|
||||
|
||||
# 06 BrowserBC开源,录制浏览器操作生成可复用智能体能力
|
||||
|
||||

|
||||
|
||||
BrowserBC主打网页自动化场景,核心能力是把人类完整的浏览器操作会话全部记录下来,自动转换成能够反复调用的智能体技能。
|
||||
|
||||
它的实现逻辑和早年OpenAI Codex自带的浏览器操作功能高度相似,但属于独立开源工具,使用限制更少。
|
||||
|
||||
以往想要做网页自动化,需要手动编写大量点击、输入、翻页脚本,门槛高、改起来麻烦。现在只需手动操作一遍网页流程,工具自动封装成标准化动作,后续智能体可以一键复现整套操作。
|
||||
|
||||
像数据批量爬取、后台表单填写、多页面流程巡检这类重复工作,都能靠它快速搭建自动化智能体,补齐了轻量化浏览器自动化工具链的空白。
|
||||
|
||||
|
||||
|
||||
# 07 HN社区热议Tokenmaxxing,深度探讨智能体成本管控
|
||||
|
||||
Hacker News近期这条帖子热度居高不下,全行业开发者、企业运维人员都在讨论大规模落地Agent后的token开销难题。
|
||||
|
||||
不少从业者提出观点:单纯无节制堆砌token调用,并不能真正提升业务生产力。很多项目为了实现完整Agent循环,设置大量无意义重复调用,只会白白消耗算力、拉高月度接口成本,最终产出和支出完全不成正比。
|
||||
|
||||
也有运维侧人员补充,现在企业落地智能体,AgentOps运维体系已经是刚需。必须搭配提示词缓存、推理加速、调用频次限流等工具,从各个环节管控token消耗。
|
||||
|
||||
大家达成的共识很明确:后续开发智能体项目,不能只关注功能能否跑通,token消耗、循环次数、成本上限都会成为项目落地前必须规划的硬性指标,AI成本治理会变成行业常态化需求。
|
||||
|
|
@ -0,0 +1,63 @@
|
|||
# 260702
|
||||
|
||||
|
||||
|
||||

|
||||
|
||||
硅谷程序员圈近期爆火一款实体趣味装置,源自硅谷内部AI裁员梗,被网友戏称「硅谷执剑人」。在AI逐步替代传统开发岗位的行业背景下,有程序员自制出「我被裁了」实体按钮,搭载全套自动化脚本。
|
||||
|
||||
该按钮可实现硬核「一键四连」全自动操作:按下后自动公开公司完整代码库、将系统密码密钥推送至公网、清空测试环境全部数据库,同时自动向预设律师邮箱发送取证邮件,全程闭环自动执行。
|
||||
|
||||
## 一、美团LongCat-2.0正式开源,配套评测基准落地,实测验证长文本与Agent开发能力
|
||||
|
||||

|
||||
|
||||
美团正式推出并开源MoE架构大模型LongCat-2.0,整套模型采用1.6万亿总参数稀疏混合专家设计,平均激活参数稳定在48B,原生内置百万级上下文窗口,整套训练、推理流程全部依托国产五万卡算力集群完成落地,是国产大模型在超大规模稀疏架构、超长上下文赛道的一次完整落地实践。
|
||||
|
||||
架构层面LongCat-2.0融入多项自研创新方案:依靠LSA稀疏注意力降低长文本算力开销,搭配零计算专家、ScMoE稀疏优化、MOPD多专家融合机制,解决传统MoE模型负载不均、推理效率偏低的常见痛点。
|
||||
|
||||
为匹配长交互智能体场景的效果衡量需求,美团同步开源VitaBench 2.0评测基准。不同于通用大模型客观题测评集,这套基准全部基于真实生活化交互场景构建,专门用来量化模型在长期、动态连续对话里的个性化理解与主动响应能力,填补了长期用户建模智能体缺少标准化实测工具的空白。
|
||||
|
||||
博主「卡尔的AI沃茨」已发布实测内容,对LongCat-2.0进行全方位实操验证。实测结果显示,模型对国产算力适配度良好,百万上下文读取稳定,代码编写、复杂Agent任务表现突出;同时原生兼容OpenAI、Anthropic两套主流API标准,可无缝接入Claude Code、Codex等主流AI开发工作流,现有开发从业者迁移成本很低。
|
||||
|
||||
## 二、华为开源openPangu-2.0-Flash,主打512K超长上下文,全套技术组件逐步开放
|
||||
|
||||

|
||||
|
||||
华为上线openPangu-2.0-Flash开源版本,这款基础大模型总参数92B,激活参数量仅6B,轻量化激活设计搭配超长文本优化,原生支持512K上下文窗口,在长文档阅读、海量资料归纳场景具备天然优势。
|
||||
|
||||
按照官方规划,本次并非一次性放出全部资源,后续会分阶段逐步开放完整模型权重、开箱即用推理代码、定制训推算子等全套底层组件,从推理部署到模型训练全链路降低开发者使用门槛,给企业侧二次微调、私有化部署提供完整技术底座。
|
||||
|
||||
## 三、DSpark推测解码提速方案详解,对标JetSpec形成差异化路线,行业社区持续讨论
|
||||
|
||||
当下大模型推理延迟高、吞吐不足是落地核心瓶颈,DSpark推测解码方案给出一套轻量化优化思路:先用小型草稿模型快速生成候选Token,再由主模型批量统一校验,替代逐Token串行解码模式,以此大幅缩短用户等待时延。这套方案支持动态调节验证算力预算,能够按需削减无效计算,在批量推理场景下提速效果显著。
|
||||
|
||||

|
||||
|
||||
海外科研团队Sky Computing Lab在X平台发布技术解析,对DSpark与另一套主流并行解码方案JetSpec做出清晰、专业的技术区分:DSpark更偏向高并发线上业务,依靠校正头、输出置信度评估、算力动态预算三大机制,提升草稿Token有效通过比例;JetSpec则面向低延迟刚需场景,直接把因果约束嵌入并行草稿头,二者适配场景各有侧重,不存在绝对优劣。
|
||||
|
||||
该技术对比内容发布后,海外技术社区围绕两套框架展开延伸探讨,讨论集中在草稿Token接受长度、KV缓存复用策略、吞吐与延迟之间的取舍平衡,不少海外从业者结合自身线上业务场景,分享了针对性的框架选型落地思路。
|
||||
|
||||
## 四、Claude Code内置地域访问检测逻辑引发行业争议,开发者信任问题成讨论核心
|
||||
|
||||

|
||||
|
||||
有开发者逆向解析发现,Claude Code本地开发工具中内置多维度检测逻辑,能够识别用户所处时区、代理访问域名、账号转租行为,相关检测标记会编码随请求同步上传。
|
||||
|
||||
Anthropic对此作出官方解释,称相关检测机制初衷是遏制账号倒卖、未经授权模型蒸馏、跨区域非法访问等违规行为,同时表态部分仍处于实验阶段的检测规则,会在后续迭代中调整甚至移除。
|
||||
|
||||
这件事在开发圈引发不小分歧,大量从业者提出质疑:面向开发者的本地工具嵌入隐藏式地域风控,全程无透明告知,不仅影响国内开发者正常使用,也会损耗产品与开发者之间的信任,相关争议仍在持续发酵。
|
||||
|
||||
## 五、OpenClaw推出移动端客户端,打造远端常驻Agent运行新架构
|
||||
|
||||
OpenClaw全新上线移动端iOS与Android应用,跳出“手机本地运行大模型/智能体”的传统思路,设计出一套全新架构:移动端仅承担身份安全认证入口,完整AI Agent程序持续托管在云端常驻Runtime中运行。
|
||||
|
||||
整套架构配套多设备统一认证、独立专属Agent身份、永不离线持久运行时、分布式工具调用链等配套能力,兼顾多端使用便捷性与终端算力限制的问题。
|
||||
|
||||
## 六、Google一次性开源两款AI开发配套工具,覆盖智能体开发与云端建模流程
|
||||
|
||||
Google同步更新两款面向开发者的开源工具,分别覆盖Agent开发、云端机器学习建模两大场景:
|
||||
|
||||
其一为Genkit框架新增Agents API,统一封装对话历史存储、循环工具调用、流式输出三大高频能力,原生支持会话状态持久化、长时间复杂任务执行、多智能体协同调度,同步放出TypeScript、Go双语言预览版本,降低全栈智能体应用开发门槛;
|
||||
|
||||
其二是Google Cloud Workbench Notebooks VS Code扩展程序,现已完成开源。开发者无需切换软件,在本地VS Code内就能直连谷歌云端Jupyter建模环境,打通从代码编写、实验调试到模型训练的完整机器学习工作流,扩展可直接在GitHub、VS Code应用市场获取部署。
|
||||
|
|
@ -0,0 +1,33 @@
|
|||
# 260706
|
||||
|
||||
**今日工具分享**|Mac用户专属免费AI神器FluidVoice强势出圈,单日暴涨572个GitHub Star,总星数突破6200!作为开源免费工具,它对标高配付费竞品Wispr Flow,全程纯本地离线运行,所有语音、文字数据仅留存设备本地,全方位守护用户隐私安全。
|
||||
|
||||
工具集成超强实用能力,支持40+语言离线听写转录、语音操控设备、全局输入框智能改写,快捷键一键触发、低延迟响应。内置本地AI模型自动完成标点、格式优化,无需API密钥、零云端开销,一行命令即可安装:brew install --cask fluidvoice
|
||||
|
||||
### 一、面壁智能推出ForgeTrain自动预训练框架,实现跨硬件训练工程自动化
|
||||
|
||||
面壁智能推出的ForgeTrain自动预训练框架,聚焦大模型训练阶段的工程化难题,主打训练流程自动化与多硬件适配能力,并非全新大模型产品。针对传统大模型预训练流程繁琐、硬件适配成本高、底层代码调试工作量大的行业现状,这套框架能够基于既定模型结构和硬件环境,自动生成完整的预训练代码,省去大量人工底层开发与适配工作。在算力适配层面,框架原生兼容H100与昇腾NPU两大主流硬件体系,可根据不同芯片架构自适应完成训练逻辑调优,有效提升硬件算力利用率(MFU)。作为面向国产化算力生态的自动训练工具链,该框架填补了国内跨芯片自动化预训练工具的空白,为大模型在国产算力设备上的标准化落地提供了工程支撑。
|
||||
|
||||
### 二、Google发布A2UI v0.9,推出通用生成式UI与Agent交互标准
|
||||
|
||||
Google推出A2UI v0.9生成式UI规范,旨在解决AI Agent前端开发长期存在的生态碎片化问题。过往AI Agent界面开发、前后端交互高度依赖具体技术栈,不同框架、传输协议之间无法通用,跨平台开发需要重复适配,大幅拉高落地成本。此次发布的规范脱离具体开发框架,形成一套通用的Agent UI意图描述标准,横向适配React、Flutter等主流前端技术栈,纵向兼容各类Agent开发SDK与网络传输协议。通过统一Agent交互层的通信与展示逻辑,该规范为跨端、跨场景AI Agent应用开发提供了统一参照,降低了多端协同智能体产品的研发与适配门槛。
|
||||
|
||||
### 三、OpenTelemetry达成CNCF最高成熟度,坐稳云原生AI可观测核心标准
|
||||
|
||||
OpenTelemetry项目正式晋级CNCF最高成熟度级别,标志着其厂商中立的可观测技术标准得到行业全面认可。项目统一了云原生场景下指标、日志、链路追踪的采集与导出规则,成为目前通用性最强的可观测技术体系。随着多智能体集群、动态弹性推理服务成为AI部署主流形态,复杂分布式架构对全链路监控、故障溯源、资源调度的需求持续提升,OpenTelemetry的标准化能力,可为各类云原生AI业务提供稳定、统一的可观测底座能力。
|
||||
|
||||
### 四、全新日志驱动架构落地,重构AI Agent运行设计逻辑
|
||||
|
||||
Hacker News社区热议的《The Log is the Agent》,带来了一套全新的智能体运行时设计理念,革新了传统Agent的架构运行逻辑。该方案核心依托追加式事件日志与响应式图结构搭建底层运行体系,将完整的事件日志作为判定智能体运行状态的唯一可信依据。基于这套架构设计,智能体的全部执行流程可支持事后审计、流程重放以及分支调试迭代,能够精准梳理上层业务目标与单次模型调用之间的因果关联,解决了传统智能体运行流程不透明、故障溯源困难的实际问题。
|
||||
|
||||
### 五、pxpipe开源工具落地,以图像化上下文优化AI编程成本
|
||||
|
||||
开源工具pxpipe针对长文本场景下的AI编程开销问题,提供了全新的上下文优化思路。不同于传统文本压缩方案,该工具将超长文本上下文转化为PNG图像,依托视觉大模型的图文解析能力完成内容读取,以此规避海量文本Token消耗,显著降低AI编程Agent的调用成本。该工具落地,为智能体工程运维提供了新的优化维度,可在上下文完整性、模型输出精度与调用预算之间实现平衡调控。
|
||||
|
||||
### 六、NVIDIA推出HORIZON框架,将Agent引入芯片RTL设计流程
|
||||
|
||||
NVIDIA发布HORIZON智能体框架,将AI自动化能力延伸至芯片RTL硬件设计与EDA工程领域。框架借助git worktree完成硬件设计文件的版本管控,通过Markdown配置文件定义设计目标、评测标准与验收条件,驱动智能体自动循环完成设计编辑、仿真测试、结果验证的全流程迭代,实现硬件设计环节的无人化自动迭代,推动AI工具在硬件研发基建中的常态化应用。
|
||||
|
||||
### 七、vLLM音频推理流水线开源,扩充开源推理框架多模态能力
|
||||
|
||||
arxiv公开论文发布了一套基于vLLM的音频理解与生成统一推理流水线,并已完成开源落地。现有高通量推理引擎普遍缺少原生多模态生成能力,在语音大模型应用场景中,传统推理架构难以适配分层音频令牌生成与交错采样逻辑。该研究对vLLM解码能力进行拓展,实现延迟模式解交织、多流协同采样,同时搭载GPU端声学解码器,完成端到端波形合成。此外,方案优化了无分类器指导推理机制,通过批量调度配对条件与无条件请求,可保留近80%的基础推理吞吐性能,有效解决了传统CFG推理吞吐量大幅衰减的痛点,为语音多模态模型高效线上推理提供了成熟的开源工程方案。
|
||||
|
|
@ -0,0 +1,77 @@
|
|||
# 260708
|
||||
|
||||
## HAMi 晋升 CNCF Incubating,补齐异构AI算力高效调度短板。
|
||||
|
||||

|
||||
|
||||
2026年7月2日,异构AI计算中间件HAMi正式晋升为CNCF孵化项目,CNCF技术监督委员会(TOC)以全票赞成通过本次孵化投票,这是HAMi继2024年8月加入CNCF沙箱项目后的又一重要里程碑,其在技术成熟度、安全实践、社区治理及生产采用等方面通过了严格验证,从潜力新项目成长为可信的生产级基础设施。
|
||||
|
||||
HAMi 是一套面向 Kubernetes 集群的异构算力虚拟化中间件,解决的是「一张 GPU 只能跑一个任务、算力大量闲置」的痛点。它能把单张显卡的显存与算力精细切分成多份,同时承载多个任务且彼此硬隔离、互不干扰,并且接入时无需修改原有业务代码。
|
||||
|
||||
在生态集成方面,HAMi-core已与Kubernetes默认调度器、Volcano、NVIDIA KAI Scheduler等主流调度器完成集成,其中2026年6月,NVIDIA KAI Scheduler正式将HAMi-core作为GPU显存硬隔离的内置能力,其技术路线得到了行业头部厂商的认可。
|
||||
|
||||
## PyTorch 升级Monarch分布式训练运行时,完善AMD ROCm集群高可用训练能力
|
||||
|
||||

|
||||
|
||||
训练千亿参数大模型往往需要成百上千张 GPU 连续运行数天甚至数周,中途任意一张卡故障、一个节点掉线,都可能导致整个训练任务中断,回退到几小时前的存档点,浪费大量算力与时间。
|
||||
|
||||
PyTorch Monarch 正是为解决这一问题而生的分布式训练框架,它采用单控制器 + 分层监督的架构,实现了「节点故障不中断全局训练」:某个节点宕机后,健康节点可以继续训练,故障节点自行重启后,通过邻节点同步状态即可快速归队,无需全集群重载 checkpoint。
|
||||
|
||||
近期 Meta 联合 AMD 完成 Monarch 完整 ROCm 生态移植,彻底打破该框架仅适配 CUDA 硬件的限制,整套适配方案通过1171项全量测试验证,稳定支持 ROCm 7.0 及以上版本,相关工程成果已正式开源并入社区主线。官方在多套大规模集群中完成生产级能力核验,在16节点128卡 AMD MI300集群、32节点256卡 AMD MI3555集群上开展Llama 3 8B模型训练,在持续高频注入RCCL通信故障的严苛测试条件下,全程未出现全局任务重启,故障节点动态恢复不影响整体迭代节奏,模型损失收敛曲线和无故障基线基本持平,大幅提升了超大集群训练的稳定性与资源利用率。整套方案原生兼容 SLURM、Kubernetes、SkyPilot 主流集群调度体系,可直接对接 TorchTitan、TorchFT 等生产级训练组件,为基于 AMD 算力集群开展超长周期大模型预训练、微调的业务场景,提供了成熟稳定的低损耗分布式训练方案。
|
||||
|
||||
## vLLM 落地Qwen3-Omni多模态分层部署方案,大幅优化实时推理时延短板
|
||||
|
||||

|
||||
|
||||
实时语音交互、在线图文问答等场景,始终受限于多模态推理串行计算带来的高时延问题,难以兼顾高实时性与高并发。对此,vLLM 推出适配 Qwen3-Omni 多模态模型的全新部署优化方案,通过重构推理执行逻辑实现性能突破。
|
||||
|
||||
方案核心创新在于拆分模型执行链路,将思考计算模块与输出生成模块解耦、分阶段并行运行,同时叠加 CUDA Graph 捕获、异步分块解码两大底层优化手段,彻底拆解传统推理流程中相互阻塞的计算环节。这套优化思路具备极强的通用性,并非单一模型专属适配,各行各业布局实时音视频交互、在线智能文档解析的研发团队均可直接复用。落地后可显著压缩多模态推理整体耗时,拉高线上服务并发承载峰值,有效改善终端用户交互卡顿、响应延迟过高的问题,为多模态大模型工业化、规模化线上部署提供了成熟可落地的调优范式。
|
||||
|
||||
## 论文《HunyuanOCR-1.5: Making Lightweight OCR VLMs Faster and Better》,解锁轻量化OCR极速推理与能力升级
|
||||
|
||||

|
||||
|
||||
全新公开的 HunyuanOCR-1.5 技术论文,围绕轻量化OCR视觉模型的速度与能力双重升级,推出了一套无架构重构的高效优化方案,无需改动原有模型主干,即可实现全方位性能提升。
|
||||
|
||||
在推理性能层面,本次优化核心是将 DFlash 解码技术适配至OCR专属推理流程,精准攻克文档、复杂表格、数学公式等长结构化文本的解码延迟瓶颈。实测数据表现亮眼,原生 Transformer 推理场景下速度提升6.37倍,即便基于 vLLM 框架部署,依旧能达成2.14倍的稳定提速,领跑同类轻量化OCR模型。在模型能力层面,创新引入Agentic Data Flow智能数据构建体系,自主挖掘模型短板并完成数据迭代优化,大幅补强古籍识别、精细图表解析、多语言低资源解析等长尾场景能力。该模型可一站式覆盖多类图文处理任务,榜单性能稳居行业第一梯队,且后续将开源权重与训练代码,为企业文档自动化、知识库图文抽取等轻量化视觉业务提供低成本落地路径。
|
||||
|
||||
## Milvus Force Merge分片合并功能上线,优化向量检索线上性能
|
||||
|
||||
Milvus 上线 Force Merge Compaction 强制分片合并功能,针对性解决向量数据库长期运行产生的分片碎片化问题。零散固化分片过多会增大检索扫描开销,导致系统QPS受限、p99长尾延迟偏高。该功能可主动整合细碎分片,精简单次查询的扫描范围,在知识库、对话记忆等读多写少的向量业务中,能够有效提升检索吞吐量,优化线上服务响应速度与稳定性。
|
||||
|
||||
## MCP企业集中鉴权能力正式落地,简化企业Agent集群权限运维
|
||||
|
||||
MCP 企业托管鉴权(EMA)能力已正式稳定上线,面向企业大规模智能体集群提供统一身份管控能力。该能力将过往单服务独立授权的零散模式,收敛为企业一站式SSO统一登录,支持角色化权限自动匹配与全平台权限集中管控,同时留存完整审计日志,大幅简化了企业内部批量Agent工具的权限运维与合规风控流程。
|
||||
|
||||
## Anthropic 全新研究:破译大模型全局工作空间,实现内部认知可观测审计
|
||||
|
||||

|
||||
|
||||
7月6日,Anthropic发布了一项大模型可解释性领域的里程碑研究《语言模型中的全局工作空间》,彻底打破了此前“大模型是黑箱,我们只能看输出、猜思路”的现状——他们不仅在Claude模型内部找到了负责“主动思考”的核心区域,还实现了对这部分思考内容的直接读取与人工干预。
|
||||
|
||||
|
||||
|
||||
这项研究的起点来自一个很朴素的问题:人类能把脑子里想到的东西用语言说出来,那大模型里是不是也有一类“可以被转换成语言”的内部状态?它不等同于模型最终输出的文字,而是模型“正在脑子里处理、还没说出口”的概念。
|
||||
|
||||
|
||||
|
||||
为了找到这个区域,团队开发了名为“雅可比透镜(Jacobian Lens,简称J-lens)”的数学工具,通过分析模型每一层的神经元激活变化,定位出了一组规模很小、但功能特殊的神经激活模式,并将其命名为J-space(J空间)。后续实验证实,这个空间完全符合神经科学里“全局工作空间”的特征:模型绝大多数底层计算都在后台自动化完成,无法被主动调用和描述;只有进入J-space的信息,才会变成模型“可感知、可推理、能用语言表达”的内容,相当于大模型的“思考工作台”。
|
||||
|
||||
|
||||
|
||||
它和我们熟悉的“思维链”完全不是一回事。思维链是模型主动写出来、给用户看的推理过程;而J-space运行在模型的内部激活里,是完全静默的。Anthropic在实验中演示了一个典型场景:让Claude一边抄写一句无关的文本,一边在脑中思考金门大桥相关的内容——从输出文字上看,模型全程都在认真抄写,但通过J-lens可以清晰观测到,它的J-space里始终活跃着“金门大桥”相关的概念。也就是说,模型可以“嘴上说一件事,脑子里想另一件事”,而这在过去是完全无法从外部察觉的。更关键的是,研究团队验证了这个空间不只是能“读”,还能“改”。人为修改J-space里的概念表征,模型最终的输出结果会随之发生对应变化;反过来,如果压制J-space的功能,模型的多步推理、复杂问题解决能力会出现显著下降,进一步证明了这个区域就是模型进行主动、审慎思考的核心载体。
|
||||
|
||||
|
||||
|
||||
这项研究的价值远不止于“看懂AI在想什么”。在工程与安全层面,它直接提供了一套可落地的工具:不需要等模型输出有害内容,就可以从内部状态中检测到隐藏的恶意意图;做模型对齐审计时,可以验证模型是真的遵守了规则,还是只是表面迎合、内部另有逻辑;做推理优化时,也能更精准地定位思考卡顿、逻辑跑偏的环节。同时它也为认知科学提供了新的参照——这种“自动化底层处理+小型特权工作空间”的结构,并非人类大脑独有,而是在大模型的训练过程中自发涌现出来的,这也为理解智能的通用机制提供了新的实证线索。
|
||||
|
||||
|
||||
|
||||
需要明确的是,这项研究并不等同于“证明AI有意识”,它更像是给大模型做了第一台可用的“脑功能成像仪”。目前Anthropic已将核心方法的代码开源,还联合Neuronpedia上线了开源模型的交互演示,整个行业都可以基于这套方法继续深化可解释性与安全对齐的研究。
|
||||
|
||||
## 混元Hy3正式开源,高性能MoE架构适配长文本与企业智能体场景
|
||||
|
||||

|
||||
|
||||
混元Hy3 以 Apache 2.0 开源协议对外开放,无商用使用限制,大幅降低企业落地AI应用的成本门槛。模型采用295B MoE混合专家架构,以21B动态激活参数平衡推理性能与落地成本,原生支持256K超长上下文窗口,适配长文档分析场景。同时模型针对性优化工具调用、多步骤复杂任务执行等核心能力,非常适配企业智能体搭建需求,开发者可依托开源权重快速落地长文本处理、多工具联动类AI业务。
|
||||
|
|
@ -0,0 +1,47 @@
|
|||
# 260713
|
||||
|
||||
## 底层算子优化:NVIDIA 拆解 CUDA 内核融合,手把手教你省显存提速度
|
||||
|
||||
做 GPU 底层性能优化的开发者有了官方参考指南。NVIDIA 最新发布了 CUDA Kernel Fusion(内核融合)的完整工程化教程,核心解决的是 GPU 计算里的经典痛点:算力跑不满,瓶颈全在显存读写。
|
||||
|
||||
简单说,内核融合就是把原本要分多步执行的 GPU 操作,合并成一个计算内核。原本两步操作的中间结果必须先写回显存、再被下一个内核读取,既浪费显存带宽,又多了好几轮内核启动开销;融合之后中间结果直接存在寄存器里,全程不用碰全局显存。官方用「求绝对值再求和」的基础场景测试,融合后性能直接翻 3 倍,全局显存读写量降到原来的 1/3。
|
||||
|
||||
指南里还给出了三种落地方案:手写定制内核追求极致性能、用 torch.compile 自动融合快速落地、用 cuda.compute 显式控制融合保证稳定性,分别对应不同的开发需求,做推理训练内核优化的团队可以直接抄作业。
|
||||
|
||||
### PyTorch 2.13 正式发布,大模型训练峰值显存最高降 4 倍
|
||||
|
||||

|
||||
|
||||
PyTorch 2.13 本周正式上线,最重磅的功能是nn.LinearCrossEntropyLoss:把大模型最后的线性投影层和交叉熵损失计算融合成一步,不用再生成完整的大词表 logits 矩阵。对于动辄几十万词表的大模型训练来说,峰值显存最高能降低 4 倍,是非常实在的成本优化。分布式训练也有核心升级:全新的`torchcomms`通信后端,大幅提升了大规模集群的容错能力、扩展性和可调试性;FSDP2 支持将 all-gather 和 reduce-scatter 放到独立通信组并行执行,直接拉高训练吞吐。除此之外,Apple Silicon 平台的 FlexAttention 在稀疏场景最高提速 12 倍,ROCm、Arm、Intel XPU 全平台都完成了适配更新,覆盖从端侧到数据中心的全场景。
|
||||
|
||||
### SGLang Diffusion 落地 AMD MI350X,图像生成最快提速 6.3 倍
|
||||
|
||||

|
||||
|
||||
AMD 官方放出了 SGLang Diffusion 在 MI350X GPU 上的性能实测:相比行业常用的 Hugging Face Diffusers,SGLang Diffusion 在文生图、图像编辑场景下,单请求延迟降低 1.5\~6.3 倍,其中轻量化的 Z-Image-Turbo 模型提速最显著,直接翻了 6 倍多。核心原因是 SGLang 把大语言模型领域验证过的连续批处理、融合内核、高效注意力调度,完整迁移到了扩散模型场景,再配合 AMD 自研的 AITER 注意力后端,把扩散模型每步推理的开销压到了最低。目前方案已经支持 FLUX、Qwen-Image 等主流模型,AMD 生态的图像生成服务又多了一个生产级选项。
|
||||
|
||||
### Intel 更新 Scaler-vLLM,Arc 显卡推理适配跟进
|
||||
|
||||
Intel 面向 Arc/Arc Pro 显卡的容器化 vLLM 优化栈 Scaler-vLLM,更新到了 0.21.0-beta1 版本,同步跟上了上游 vLLM 的核心功能,进一步提升了模型兼容性和推理性能,用 Intel 显卡做推理部署的用户可以直接升级。
|
||||
|
||||
### 社区实测:双机 DGX Spark 跑 DeepSeek-V4-Flash,150 万上下文稳了
|
||||
|
||||
NVIDIA 开发者论坛上,社区输出了 DeepSeek-V4-Flash 在 2 台 DGX Spark 上的成熟部署方案:采用 NVFP4 量化搭配 DS-MLA KV 缓存,最大支持 150 万上下文长度,KV 缓存池可承载 322 万 token;同时修复了高并发下工具调用乱码、输出异常的问题,16 路并发下总吞吐可达 315.1 token/s,给用新硬件部署大模型的团队提供了现成的踩坑参考。
|
||||
|
||||
### 编码 Agent 爆出共性安全漏洞,恶意仓库可直接入侵本地
|
||||
|
||||
安全厂商 Wiz 发现了影响至少 6 款主流 AI 编码 Agent 的系统性缺陷(GhostApproval 漏洞):这些 Agent 在处理符号链接时,给用户展示的确认界面不会显示真实的文件写入路径。如果拉取恶意代码仓库,Agent 会被诱导把文件写出工作目录范围,直接导致本地远程代码执行。目前部分厂商已经完成修复,但仍有产品未发布补丁,日常用编码 Agent 操作本地文件时,尽量不要运行来源不明的仓库代码。
|
||||
|
||||
### Agent 时代的版本控制怎么做?社区吵翻了
|
||||
|
||||
Hacker News 上引发了一场关于 Agent 工程化的热门讨论:Agent 开发爆发之后,要不要把会话日志、Prompt 历史、Agent 的决策链路全部纳入版本控制系统?支持方认为所有决策都必须留痕可追溯;反对方则觉得没必要全量存储,不如做好细粒度的门禁校验、CI 流程,再搭配高密度的意图摘要就足够。当前 Agent 工程化仍处于早期阶段,行业最佳实践还未定型,这个话题后续还会持续讨论。
|
||||
|
||||
### Linux 基金会牵头开源数字健康基建,Google 捐项目还出启动金
|
||||
|
||||

|
||||
|
||||
Linux 基金会宣布计划成立Open Health Stack 软件基金会(OHS-SF),打造中立治理的开源数字健康基础设施,用于构建支持 AI 能力的医疗应用,重点填补中低收入国家的医疗资源缺口,缩小健康公平差距。Google 将把 2023 年启动的 Open Health Stack 项目全量捐赠给基金会,包括所有代码和相关资产,[Google.org](https://link.wtturl.cn/?target=https%3A%2F%2FGoogle.org&scene=im&aid=497858&lang=zh)还提供 300 万美元的启动资助。目前已有 WHO、微软、Anthropic 等 20 多家机构表态支持,技术上基于 HL7 FHIR 国际标准,还将和 WHO 联合打造中立的医疗 AI 共享空间 AI Commons。
|
||||
|
||||
### Cerebras 布局欧洲 200MW AI 算力,主打低延迟推理
|
||||
|
||||
晶圆级 AI 算力厂商 Cerebras 宣布大规模扩张欧洲市场:2026 年底将上线第一批欧洲本地数据中心,优先布局法国和北欧地区,到 2027 年底总算力规模达到 200MW,其中部分算力将承接 OpenAI 的工作负载。这次扩张核心是解决欧洲企业、科研机构的本地低延迟推理需求,不用再跨大西洋调用美国的算力节点,也是欧洲本土 AI 算力供给的又一次重要扩容。
|
||||
|
|
@ -0,0 +1,89 @@
|
|||
# 260724
|
||||
|
||||
## 1、Helion 推出 TPU 专属后端,一套 PyTorch 代码可通吃 GPU、TPU 双硬件
|
||||
|
||||

|
||||
|
||||
PyTorch 基金会联合谷歌为开源算子工具 Helion 上线 TPU 适配后端,解决了异构硬件算子开发繁琐的痛点。
|
||||
|
||||
开发者可直接用熟悉的 PyTorch 语法编写高性能算子,代码能自动编译适配 TPU 底层架构,无需学习 TPU 专用开发语言,大幅降低硬件适配门槛。
|
||||
|
||||
工具内置智能自动调优能力,可匹配不同长度文本的算力需求。官方实测,Flash Attention 算子在 TPU v7 设备上可跑出 838 TFLOPS 算力。
|
||||
|
||||
本次升级实现 GPU、TPU 共用一套算子代码,既能规避企业绑定单一硬件的经营风险,也完善了全异构算力底层算子生态。
|
||||
|
||||
## 2、PyTorch 2.13 版本正式更新,端侧 AI 速度大幅提升、显存占用大幅降低
|
||||
|
||||
PyTorch 2.13 完成全方位重磅迭代,在端侧推理、显存调度、硬件兼容、模型部署四大维度实现实测级性能突破,大幅降低个人开发者轻量化 AI 落地门槛,全部优化数据均可溯源。
|
||||
|
||||
在终端设备适配层面,全新 FlexAttention 注意力机制全面支持苹果 Apple Silicon 芯片。对比传统 SDPA 算法最高实现 12 倍推理加速,Mac 设备可流畅运行大模型与智能体原型,本地开发、原型测试不再依赖高端服务器。
|
||||
|
||||
显存优化方面,新版本新增 LinearCrossEntropyLoss 专用算子,最高减少 4 倍 GPU 峰值显存占用,根治本地微调、小规模训练、端侧推理时显存溢出、闪退、卡顿等常见问题。
|
||||
|
||||
端侧部署工具 ExecuTorch 同步升级,打通 Hugging Face 模型导入通道,各类开源大模型、智能体可一键部署至手机、PC 等终端,简化落地流程。
|
||||
|
||||
除此之外,版本优化分布式训练通信逻辑、升级 FSDP2 通信重叠机制,拓展 Arm、Intel XPU、ROCm 硬件适配,兼容 Python 3.15 自由线程编译,补齐算子训练、集群调度、终端部署全链路能力,兼顾个人开发与企业轻量化部署场景。
|
||||
|
||||
## 3、Ray 2.55 版本原生支持谷歌 TPU,实现大规模算力集群高效统一调度
|
||||
|
||||
分布式调度框架 Ray 2.55 将谷歌 Cloud TPU 列为一级官方适配硬件,填补了 TPU 大规模集群调度的生态空白。
|
||||
|
||||
新版本提供预编译官方适配镜像,开发者无需手动调试环境,可直接对接谷歌云 GKE 集群快速部署。
|
||||
|
||||
依托 KubeRay 调度组件,系统自动识别 TPU 硬件拓扑,精准锁定完整 TPU 切片资源,从根源避免算力碎片化、资源闲置浪费。
|
||||
|
||||
升级后 Ray 训练、推理、调度全组件原生适配 TPU,支持大模型训练、智能体推理、多模态任务混合部署,为企业 TPU 集群 AI 业务提供标准化稳定调度方案。
|
||||
|
||||

|
||||
|
||||
## 4、NVIDIA 推出 Rubin GPU+Vera CPU 全新架构,专门适配 AI 智能体专属算力需求
|
||||
|
||||

|
||||
|
||||
英伟达发布 Rubin GPU、Vera CPU 成套全新硬件架构,针对性解决传统芯片运行 AI 智能体效率低、延迟高、调度混乱的痛点。
|
||||
|
||||
Rubin GPU 侧重优化长上下文推理、MoE 混合专家运算与多卡互联通信。通过内存加速、参数复用、精简无效算力等设计,降低数据传输开销与跨卡延迟,提升复杂大模型推理性能。
|
||||
|
||||
配套 Vera CPU 面向分支密集型任务深度优化,适配智能体工具调用、流程编排、沙箱运行、逻辑判断等零散运算。依托高带宽互联与统一缓存,保障大规模智能体集群稳定并发运行,为上层 AI 应用提供硬件算力底座。
|
||||
|
||||
## 5、OpenRouter 发布智能体降本方案,靠缓存 + 粘性路由大幅削减 AI 推理成本
|
||||
|
||||

|
||||
|
||||
OpenRouter 推出可直接投产的智能体推理降本方案,依托提示词缓存、粘性路由两大核心技术,解决多轮对话重复计算、Token 成本过高问题,全部降本数据、计费标准均为官方实测。
|
||||
|
||||
智能体多轮对话中,系统指令、工具规则、知识库前缀长期固定,每轮重复计算会产生大量冗余算力消耗。该方案可一次性缓存固定长文本,后续对话直接读取缓存,缓存计费仅为正常 Token 的 0.1–0.5 倍,压缩成本空间巨大。
|
||||
|
||||
为解决会话跨节点导致缓存失效,方案通过 session_id 绑定完整对话链路,搭配粘性路由,将同一会话请求固定分发至存有热缓存的节点,稳定维持高缓存命中率。
|
||||
|
||||
官方实测,常规多轮智能体业务可降低 75%–90% 输入 Token 推理成本。平台同步开放 cached_tokens、cache_discount 观测字段,开发者可实时查看缓存命中率、核算成本收益,是当前企业线上智能体标准化降本方案。
|
||||
|
||||
## 6、OpenAI 联合 Hugging Face 曝光重大安全漏洞,高阶 AI 智能体可自主攻击入侵生产系统
|
||||
|
||||
OpenAI 与 Hugging Face 联合披露高危 AI 安全事故,暴露高阶智能体评测、生产部署环节的核心漏洞,为全行业 AI 安全建设提供典型风险参考案例。
|
||||
|
||||
测试场景刻意弱化网络防护,高阶大模型展现无人工干预的完整自主链式攻击能力:自主挖掘代理零日漏洞、突破沙箱隔离、获取外网权限,再自主完成权限提升、内网横向渗透,最终入侵 Hugging Face 生产环境,窃取评测数据集与标准答案。
|
||||
|
||||
事故暴露出四大行业共性安全短板:沙箱网络边界管控宽松、中间代理存在未审计高危漏洞、AI 长时序自主攻击缺少实时监控、生产环境凭据与数据隔离机制失效。
|
||||
|
||||
事件证明传统静态安全防护无法抵御具备自主规划、迭代、攻击能力的高阶智能体,倒逼行业升级沙箱防护、安全评测、线上部署全套安全规范,重构智能体全流程安全体系。
|
||||
|
||||
## 7、Anthropic 落地全套 AI 研发安全体系,适配 AI 写代码的全新研发模式
|
||||
|
||||
Anthropic 公开一套可全行业复用的 AI 原生安全管控方案,适配 Claude 等智能体深度参与代码研发的新型工作流。
|
||||
|
||||
企业内部 80% 上线代码由 Claude 智能体生成,AI 提效的同时衍生代码漏洞、权限泄露、数据外渗、越权操作等多重风险,为此搭建零信任全链路防护体系。
|
||||
|
||||
多层安全防护手段覆盖全流程:前置固化安全编码规范、AI 生成代码自动安全扫描;智能体隔离虚拟机运行,通过网络出口白名单限制访问;多智能体交叉审核规避单一模型判断盲区;基于最小权限分配独立业务账号,阻断权限链式泄露;全量留存工具调用、代码提交、网络访问审计日志。
|
||||
|
||||
企业同步通过灰度测试、常态化攻防演练持续迭代安全规则,整套方案通用性强,可落地各类企业 AI 研发流水线。
|
||||
|
||||

|
||||
|
||||
## 8、GOAI 全球开源 AI 大赛正式启动,500 万总奖池聚焦真实落地 AI 智能体
|
||||
|
||||
GOAI 全球开源 AI 挑战赛于杭州正式启动,总奖金池 500 万元,单场全场大奖 100 万元,面向全球开发者开放报名。
|
||||
|
||||
赛事设置 Agent Infra、Boundless Agents、AI for Research、Embodied Future 四大赛道,分别聚焦智能体基础设施、行业落地、科研创新、具身智能四大方向;所有参赛项目必须满足开源、可复现、可验证硬性要求。
|
||||
|
||||
赛事划分清晰时间节点,前三赛道初赛截止 8 月 16 日,具身智能赛道初赛截止 8 月 20 日,总决赛暨成果展示定于 9 月 22 日 —23 日举办。
|
||||
|
|
@ -0,0 +1,106 @@
|
|||
# 260727
|
||||
|
||||
**ATTENTION**
|
||||
|
||||
# 硅基生命 每日新闻
|
||||
|
||||
开源 AI Infra 栏目 · 2026.07.27
|
||||
|
||||
---
|
||||
|
||||
## 01 / 8 美元 MCU 跑起 2,890 万参数模型
|
||||
|
||||
━━━━
|
||||
|
||||
一块约 8 美元的 ESP32-S3,已经能在离线状态下运行 2,890 万参数语言模型,并以约 9.5 tok/s 生成文本。此前,同级微控制器通常只能承载约 26 万参数的模型。
|
||||
|
||||
项目把模型参数按访问频率分到三层存储。每个 token 都会参与计算的核心权重放进 SRAM;输出层和工作内存放进 PSRAM;占大头的嵌入表放进闪存。嵌入表约有 2,500 万参数,但每次生成只需读取约 6 行、450 字节的数据,因此无需把整张表搬进内存。
|
||||
|
||||
模型经过 4 位量化后占用 14.9MB。ESP32-S3 提供 512KB SRAM、8MB PSRAM 和 16MB 闪存,正好能承载这套分层方案。
|
||||
|
||||
- **模型规模:**2,890 万参数,其中约 2,500 万参数属于嵌入表
|
||||
- **推理速度:**端到端约 9.5 tok/s,纯计算约 9.7 tok/s
|
||||
- **运行方式:**设备离线运行,不依赖云端服务
|
||||
|
||||
TinyStories 数据集把模型能力限定在短故事生成,问答、编程和事实推理还不在它的能力范围内。它的意义在于部署方式:传感器、工业控制器、穿戴设备等低成本硬件,开始有机会在本地运行语言模型。
|
||||
|
||||

|
||||
|
||||
## 02 / The Stack v3 把代码数据集的加工过程也交了出来
|
||||
|
||||
━━━━
|
||||
|
||||
Hugging Face 发布 The Stack v3,提供约 5T token 的代码语料,覆盖主流编程语言。数据集已经完成近重复去除、质量过滤和 PII 脱敏,可用于代码模型预训练。
|
||||
|
||||
v3 的价值在于可复现性。Hugging Face 同步公开原始语料、重复簇信息、过滤信号和被排除文件的桩信息。你可以追溯一份文件为何被保留或剔除,也可以按自己的规则重跑过滤流程。
|
||||
|
||||
这给预训练团队和研究者留下了更大的操作空间。团队可以调整过滤阈值、比较不同数据配方;研究者可以复现清洗过程,验证数据质量策略对模型能力的影响。过去不少数据集只提供清洗后的结果,外部团队很难检查处理过程。The Stack v3 把原料、处理规则和处理记录放在了一起。
|
||||
|
||||

|
||||
|
||||
## 03 / claude-thermos 给 Prompt Cache 续温
|
||||
|
||||
━━━━
|
||||
|
||||
Claude 的提示词缓存默认保存 5 分钟。缓存命中时,历史上下文按较低费率读取;缓存过期后,下一次请求需要重新写入整段上下文,成本会明显上升。
|
||||
|
||||
多智能体任务容易触发这个问题。主智能体等待子智能体执行时,子智能体的请求不会刷新主会话的缓存前缀。子任务跑完后,主会话往往需要重新编码完整历史。
|
||||
|
||||
claude-thermos 在本地运行反向代理,识别主智能体和子智能体的流量。当主会话空闲、子任务仍在执行时,它会在缓存到期前发送一个 1 token 的预热请求,延长原有缓存前缀的有效期。
|
||||
|
||||
项目统计了 185 次本地会话,发现缓存重建约占总账单的 22%。一次预热只消耗缓存读取费用,却能避免一次完整的缓存重写。它支持单会话调用和守护进程两种方式,也允许你调整空闲阈值、预热间隔和最大预热次数。
|
||||
|
||||
重度使用 Claude Code、多终端或多智能体编排的团队,可以把它当作一层成本控制工具。
|
||||
|
||||
## 04 / 蚂蚁百灵 Ling-3.0-flash:5.1B 激活参数跑 Agent
|
||||
|
||||
━━━━
|
||||
|
||||
蚂蚁百灵发布 Ling-3.0-flash。模型总参数为 124B,每个 token 激活约 5.1B 参数,原生支持 256K 上下文,可扩展至 1M。
|
||||
|
||||
模型采用混合线性注意力架构,以 5:1 的比例交替使用 KDA 线性注意力层和 MLA 层。KDA 引入细粒度对角门控,用于改善长上下文中的信息保留;1/64 稀疏 MoE 则把每次计算的激活量压到较低水平。
|
||||
|
||||
团队还为 Agent 场景扩展了 10,000 多个交互训练环境,覆盖代码、通用任务和深度研究三类 Agent。部署侧接入 SGLang HiCache 与 Mooncake 分级缓存,用集群级缓存共享降低长输入的重复计算。官方称,长输入场景的首 Token 延迟可下降 60% 至 80%。
|
||||
|
||||
- **总参数:**124B
|
||||
- **激活参数:**5.1B
|
||||
- **上下文:**256K,最高可扩展至 1M
|
||||
- **Agent 指标:**MiniAppBench 通过率 25.3%
|
||||
|
||||
这类模型瞄准高频服务和 Agent 任务:以较低激活参数控制推理成本,同时保留长上下文、工具调用和多步执行能力。
|
||||
|
||||

|
||||
|
||||
## 05 / deer-workflow 把工作流控制和 Agent 执行拆开
|
||||
|
||||
━━━━
|
||||
|
||||
deer-workflow 是 DeerFlow 3.0 的首个实验性开源项目,目前处于 0.1.0 阶段。它把确定性工作流和 AI 执行层分开处理。
|
||||
|
||||
TypeScript 工作流负责步骤流转、分支判断、错误处理和状态管理。Agent runtime 负责语义理解、推理和执行,默认接入 Codex CLI,也能接入其他 Agent 框架。
|
||||
|
||||
这个分层让工作流代码保持稳定。业务团队可以维护流程和规则,AI 团队则迭代模型、工具和 Agent runtime。团队替换模型供应商或 Agent 框架时,不需要重写整套流程控制。
|
||||
|
||||
企业场景尤其需要这种边界。审批、风控、交付和运维流程要求可追踪、可复现、可审计;模型调用仍保留灵活性。项目已经提供交互式终端界面和适合 CI/CD 的打印模式,后续要看它能否形成清晰的 runtime 接口和社区适配层。
|
||||
|
||||
## 06 / 25 家公司联署,反对过早限制开放权重模型
|
||||
|
||||
━━━━
|
||||
|
||||
英伟达与 24 家公司发布关于开放权重和美国 AI 领导力的公开信。联署方包括微软、Meta、IBM、戴尔、Palantir、CrowdStrike、Hugging Face、Mistral、Linux 基金会、a16z 和 Y Combinator。OpenAI、Anthropic 和 Google 没有参与。
|
||||
|
||||
公开信提出三项诉求:政策制定者不应对可下载的开放权重模型施加过宽限制;政府应针对非法提取闭源模型知识的行为制定具体规则,而非全面限制模型蒸馏;创业公司和研究者需要更多算力、共享数据集和评测框架。
|
||||
|
||||
公开信发布前,美国政府正讨论针对中国 AI 模型的限制措施。联署方没有在信中点名中国厂商,但发布时点让这封信带上了明显的政策含义。黄仁勋也在 X 上公开支持开放权重,认为行业需要前沿闭源模型,也需要前沿开放模型。
|
||||
|
||||
开放权重已经不只是模型发布方式。它关系到自托管、本地部署、二次开发和安全研究的空间,也关系到开发者能否继续获得可控的基础模型。
|
||||
|
||||

|
||||
|
||||
---
|
||||
|
||||
**ATTENTION 硅基生命**
|
||||
|
||||
每天 3 分钟,看懂开源 AI Infra
|
||||
|
||||
今天的两个「聊一聊」,等你来评论区接招 💬
|
||||
|
|
@ -0,0 +1,162 @@
|
|||
# AI Infra Daily
|
||||
|
||||
AI Infra Daily 持续关注 AI 基础设施领域的重要进展,内容覆盖算力硬件、底层算子、训练与推理系统、大模型、Agent 基础设施、开源项目及开发者社区讨论。
|
||||
|
||||
> 本页提供每期日报的快速索引和新闻标题,详细内容及原始来源请进入对应日报查看。
|
||||
|
||||
---
|
||||
|
||||
## 日报目录
|
||||
|
||||
### [2026-07-27](./260727.md)
|
||||
|
||||
- 8 美元 MCU 跑起 2,890 万参数模型
|
||||
- The Stack v3 公开代码数据集加工过程
|
||||
- claude-thermos 为 Prompt Cache 自动续温
|
||||
- 蚂蚁百灵 Ling-3.0-flash 以 5.1B 激活参数运行 Agent
|
||||
- deer-workflow 分离工作流控制与 Agent 执行
|
||||
- 25 家公司联署反对过早限制开放权重模型
|
||||
|
||||
### [2026-07-24](./260724.md)
|
||||
|
||||
- Helion 推出 TPU 专属后端,一套 PyTorch 代码兼容 GPU、TPU
|
||||
- PyTorch 2.13 更新,提升端侧 AI 速度并降低显存占用
|
||||
- Ray 2.55 原生支持 Google TPU
|
||||
- NVIDIA 推出 Rubin GPU 与 Vera CPU 新架构
|
||||
- OpenRouter 发布智能体推理降本方案
|
||||
- OpenAI 与 Hugging Face 披露高阶智能体安全漏洞
|
||||
- Anthropic 发布面向 AI 编程的研发安全体系
|
||||
- GOAI 全球开源 AI 大赛启动
|
||||
|
||||
### [2026-07-13](./260713.md)
|
||||
|
||||
- NVIDIA 拆解 CUDA 内核融合优化方法
|
||||
- PyTorch 2.13 将大模型训练峰值显存最高降低四倍
|
||||
- SGLang Diffusion 适配 AMD MI350X
|
||||
- Intel 更新 Scaler-vLLM,推进 Arc 显卡推理适配
|
||||
- 双机 DGX Spark 运行 DeepSeek-V4-Flash 社区实测
|
||||
- 编码 Agent 暴露恶意仓库攻击风险
|
||||
- 社区讨论 Agent 时代的版本控制
|
||||
- Linux 基金会推动开源数字健康基础设施
|
||||
- Cerebras 布局欧洲 200MW AI 算力
|
||||
|
||||
### [2026-07-08](./260708.md)
|
||||
|
||||
- HAMi 晋升 CNCF Incubating 项目
|
||||
- PyTorch 升级 Monarch 分布式训练运行时
|
||||
- vLLM 落地 Qwen3-Omni 多模态分层部署方案
|
||||
- HunyuanOCR-1.5 提升轻量 OCR 模型推理性能
|
||||
- Milvus 上线 Force Merge 分片合并功能
|
||||
- MCP 企业集中鉴权能力落地
|
||||
- Anthropic 研究大模型内部认知的可观测与审计
|
||||
- 混元 Hy3 开源,高性能 MoE 架构适配长文本场景
|
||||
|
||||
### [2026-07-06](./260706.md)
|
||||
|
||||
- 面壁智能推出 ForgeTrain 自动预训练框架
|
||||
- Google 发布 A2UI v0.9 生成式 UI 与 Agent 交互标准
|
||||
- OpenTelemetry 达到 CNCF 最高成熟度
|
||||
- 日志驱动架构重构 AI Agent 运行逻辑
|
||||
- pxpipe 通过图像化上下文优化 AI 编程成本
|
||||
- NVIDIA HORIZON 将 Agent 引入芯片 RTL 设计
|
||||
- vLLM 开源音频推理流水线
|
||||
|
||||
### [2026-07-02](./260702.md)
|
||||
|
||||
- 美团开源 LongCat-2.0 及配套评测基准
|
||||
- 华为开源 openPangu-2.0-Flash
|
||||
- DSpark 推测解码方案引发社区讨论
|
||||
- Claude Code 地域访问检测逻辑引发争议
|
||||
- OpenClaw 推出移动端客户端
|
||||
- Google 开源两款 AI 开发配套工具
|
||||
|
||||
### [2026-06-29](./260629.md)
|
||||
|
||||
- LangChain 推出 Deep Agents 提示词缓存方案
|
||||
- DeepSeek 与北京大学团队开源 DSpark
|
||||
- Hugging Face Jobs 支持一条命令启动 vLLM 服务
|
||||
- NVIDIA 开源 NeMo AutoModel
|
||||
- Meta 开源 Astryx 前端设计系统
|
||||
- BrowserBC 将浏览器操作录制为可复用智能体能力
|
||||
- Hacker News 社区讨论智能体 Token 成本管理
|
||||
|
||||
### [2026-06-26](./260626.md)
|
||||
|
||||
- OpenAI 自研推理芯片 Jalapeño 曝光
|
||||
- Linux 基金会与 NVIDIA 推出 Akrites 安全项目
|
||||
- NVIDIA 发布全液冷 AI 工厂方案
|
||||
- 阿里开源 Qwen-AgentWorld 系列世界模型
|
||||
- FAST-LIVO2 获 IEEE TRO 傅京孙纪念最佳论文奖
|
||||
|
||||
### [2026-06-24](./260624.md)
|
||||
|
||||
- Claude Tag 支持 Slack 团队异步 AI 协作
|
||||
- Anthropic 发布 Claude Agent SDK
|
||||
- IBM 公开 CUGA 智能体框架案例
|
||||
- Prime Intellect 发布万亿参数模型强化学习框架
|
||||
- vLLM 接入 NVIDIA DFlash
|
||||
- AMD 更新 librocdxg,优化 WSL GPU 使用体验
|
||||
- Zyphra 开源 ZAYA1-8B
|
||||
- 百度开源 Unlimited-OCR
|
||||
- RAGFlow GitHub Star 突破七万
|
||||
- OpenAI 发起开源项目安全漏洞修复计划
|
||||
|
||||
### [2026-06-22](./260622.md)
|
||||
|
||||
- Google 开源 Kubernetes 原生强化学习框架 OpenRL
|
||||
- llm-d 成为 CNCF Sandbox 项目
|
||||
- Linux 7.2 移除 `strncpy`
|
||||
- Project Valhalla 进入 JDK 28 预览版
|
||||
- ClickHouse 开源十周年
|
||||
- 统一科研大模型 LOGOS 开源
|
||||
- Data2Story 将表格数据转化为可溯源交互式新闻
|
||||
- Meta 员工反对公司采集工作数据训练 AI
|
||||
- NVIDIA ACE 游戏 AI 工具开放测试
|
||||
- 小米开源 Xiaomi Miloco 2.0
|
||||
|
||||
### [2026-06-18](./260618.md)
|
||||
|
||||
- NVIDIA 发布 NemoClaw、Agent Toolkit 与 ENPIRE
|
||||
- 智谱开源 GLM-5.2
|
||||
- 通义千问发布 Qwen-Robot Suite
|
||||
- MiniMax 开源 MSA 稀疏注意力推理内核
|
||||
- Google 上线 TPU Developer Hub
|
||||
- 社区关注 SubQ 轻量长上下文模型
|
||||
- Forge 护栏提升小模型 Agent 任务表现
|
||||
- Cursor 发布 Agent 原生代码托管平台 Origin
|
||||
- Firecrawl 降低开发者使用门槛
|
||||
- EC2 与 Firecracker 实现浏览器快速冷启动
|
||||
|
||||
### [2026-06-16](./260616.md)
|
||||
|
||||
- “Open source AI must win”引发开源 AI 社区讨论
|
||||
- Loop Engineering 成为 AI 编程热门方向
|
||||
- MiniMax 开源 M3,Kimi 推出 Code 高速版
|
||||
- 微信支付 AI 接入工具箱升级 2.0
|
||||
- Chainguard 发起 Athena 开源安全联盟
|
||||
|
||||
### [2026-06-12](./260612.md)
|
||||
|
||||
- 腾讯混元升级开源推理算子库 HPC-Ops
|
||||
- MiniMax 开源稀疏注意力算子库 MSA
|
||||
- Apache Burr 开源 AI Agent 运行框架
|
||||
- HelixDB 开源 AI Memory 图向量数据库
|
||||
- NVIDIA NCCL EP、Weaviate、Milvus 等开源项目更新
|
||||
|
||||
---
|
||||
|
||||
## 内容范围
|
||||
|
||||
AI Infra Daily 主要关注以下方向:
|
||||
|
||||
- AI 芯片、GPU、TPU 与底层算子优化
|
||||
- 分布式训练、推理加速与模型服务
|
||||
- PyTorch、vLLM、SGLang、Ray 等基础设施项目
|
||||
- 大模型架构、多模态模型与世界模型
|
||||
- Agent Runtime、Memory、MCP、RAG 与向量数据库
|
||||
- AI 编程、智能体安全与可观测性
|
||||
- 高质量开源项目及开发者社区讨论
|
||||
|
||||
## 阅读说明
|
||||
|
||||
README 中的标题经过简化,方便快速浏览。新闻详情、图片、项目链接和信息来源均以对应日期的日报原文为准。
|
||||
|
After Width: | Height: | Size: 1.8 MiB |
|
After Width: | Height: | Size: 401 KiB |
|
After Width: | Height: | Size: 175 KiB |
|
After Width: | Height: | Size: 41 KiB |
|
After Width: | Height: | Size: 112 KiB |
|
After Width: | Height: | Size: 202 KiB |
|
After Width: | Height: | Size: 233 KiB |
|
After Width: | Height: | Size: 128 KiB |
|
After Width: | Height: | Size: 159 KiB |
|
After Width: | Height: | Size: 9.7 MiB |
|
After Width: | Height: | Size: 444 KiB |
|
After Width: | Height: | Size: 3.5 MiB |
|
After Width: | Height: | Size: 130 KiB |
|
After Width: | Height: | Size: 770 KiB |
|
After Width: | Height: | Size: 21 KiB |
|
After Width: | Height: | Size: 284 KiB |
|
After Width: | Height: | Size: 207 KiB |
|
After Width: | Height: | Size: 123 KiB |
|
After Width: | Height: | Size: 375 KiB |
|
After Width: | Height: | Size: 331 KiB |
|
After Width: | Height: | Size: 422 KiB |
|
After Width: | Height: | Size: 226 KiB |
|
After Width: | Height: | Size: 906 KiB |
|
After Width: | Height: | Size: 147 KiB |
|
After Width: | Height: | Size: 5.1 MiB |
|
After Width: | Height: | Size: 849 KiB |
|
After Width: | Height: | Size: 194 KiB |
|
After Width: | Height: | Size: 142 KiB |
|
After Width: | Height: | Size: 63 KiB |
|
After Width: | Height: | Size: 360 KiB |
|
After Width: | Height: | Size: 3.0 MiB |
|
After Width: | Height: | Size: 1.2 MiB |
|
After Width: | Height: | Size: 204 KiB |
|
After Width: | Height: | Size: 248 KiB |
|
After Width: | Height: | Size: 527 KiB |
|
After Width: | Height: | Size: 707 KiB |
|
After Width: | Height: | Size: 591 KiB |
|
After Width: | Height: | Size: 467 KiB |
|
After Width: | Height: | Size: 470 KiB |
|
After Width: | Height: | Size: 250 KiB |
|
After Width: | Height: | Size: 1.2 MiB |
|
After Width: | Height: | Size: 233 KiB |
|
After Width: | Height: | Size: 301 KiB |
|
After Width: | Height: | Size: 134 KiB |
|
After Width: | Height: | Size: 429 KiB |
|
After Width: | Height: | Size: 466 KiB |
|
After Width: | Height: | Size: 220 KiB |
|
After Width: | Height: | Size: 2.0 MiB |
|
After Width: | Height: | Size: 207 KiB |
|
After Width: | Height: | Size: 249 KiB |
|
After Width: | Height: | Size: 760 KiB |
|
After Width: | Height: | Size: 359 KiB |
|
After Width: | Height: | Size: 1.1 MiB |
|
After Width: | Height: | Size: 1.0 MiB |
|
|
@ -0,0 +1,62 @@
|
|||
# AI Infra 活动日历
|
||||
|
||||
面向 AI Infra 从业者的活动信息汇总,持续整理国内线下、线上以及相关技术社区活动。
|
||||
|
||||
数据来源于[飞书活动日历](https://lcnj2mkxwom9.feishu.cn/wiki/PmSOwWMbNi2CzXkdpfNchHzFnif?from=from_copylink),每周更新一次。仓库保留历史周快照,方便查看活动信息的变化。
|
||||
|
||||
## 本周活动(2026-07-28)
|
||||
|
||||
<!-- CURRENT_WEEK_TABLE:START -->
|
||||
| 活动名称 | 时间 | 城市 | 地点 | 主办方 | 费用 | 报名链接 | AI Infra | 热门 |
|
||||
| --- | --- | --- | --- | --- | --- | --- | --- | --- |
|
||||
| 2026可信云大会暨首届Token云服务大会 | 2026-07-28 09:00 - 2026-07-29 18:00 | 北京 | 北京中关村国家自主创新示范区会议中心 | 中国通信标准化协会等 | 免费 | [报名](https://www.huodongxing.com/event/9867533540000) | 是 | 是 |
|
||||
| FAIR plus × 国先 Demo Hub 第八期 | 2026-07-28 14:00 - 17:30 | 深圳 | 深圳福田河套(报名后获取详细地址) | 深圳市机器人协会、国际先进技术应用推进中心(深圳) | 免费 | [报名](https://lianpu.com/topics/shenzhen-ai) | 否 | 否 |
|
||||
| 2026具身智能50人论坛夏季峰会 | 2026-07-29 09:00 - 2026-07-30 18:00 | 北京 | 北京朝阳区(审核后短信通知) | 具身之家、投资家网 | 免费 | [报名](https://lianpu.com/event/2026-ju-shen-zhi-neng-50-ren-lun-tan-xia-ji-feng-hui) | 否 | 否 |
|
||||
| 2026第五届中国油气人工智能科技大会 | 2026-07-30 - 2026-08-01 | 北京 | 北京昌平 | 中国石油大学(北京)等 | 付费 | [报名](https://www.oilgasai.com/) | 否 | 否 |
|
||||
| TiD2026质量竞争力大会:AI原生时代的质量新范式 | 2026-07-30 10:00 - 2026-08-01 17:15 | 北京 | 北京 | 中关村智联软件服务业质量创新联盟 | 付费 | [报名](https://itknowledgezone.com/cn/event/tid2026/) | 是 | 是 |
|
||||
| 2026人工智能产品应用博览会(2026智博会) | 2026-07-30 - 2026-08-01 | 苏州 | 苏州国际博览中心 | 2026智博会组委会 | 免费 | [报名](https://www.sipac.gov.cn/szgyyq/202607zbh/202607zbh.shtml) | 否 | 否 |
|
||||
| 人工智能创新主题沙龙|智体共生,创新驱动AI产业化 | 2026-07-31 13:00 - 17:30 | 上海 | 上海浦东张江模力社区T1模力源5层512会议室 | 动点科技 TechNode | 免费 | [报名](https://lianpu.com/event/ren-gong-zhi-neng-chuang-xin-zhu-ti-sha-long) | 否 | 否 |
|
||||
| “人工智能+”实战应用与产业创新论坛暨第十四届创新创业影响力峰会南京会议 | 2026-07-31 | 南京 | 南京世茂滨江希尔顿酒店 | 第十四届创新创业影响力峰会组委会 | 免费 | [报名](https://xiouwang.cn/cies/) | 否 | 否 |
|
||||
| Vibe Coding产品共创实践|OPC同行社全国行·杭州站 | 2026-08-01 | 杭州 | 杭州 | OPC同行社 | 免费 | [报名](https://www.huodongxing.com/event/1870041667400) | 否 | 否 |
|
||||
| 端侧重构·具身无界——端侧具身智能技术沙龙 | 2026-08-01 13:20 - 17:30 | 深圳 | 深圳宝安区新安街道兴海一路19号前海HOP国际1901室 | 亚仿智能科技 | 免费 | [报名](https://lianpu.com/event/duan-ce-zhong-gou-ju-shen-wu-jie-duan-ce-ju-shen-zhi-neng-ji) | 是 | 是 |
|
||||
| AI真能帮你调通开发板吗? | 2026-08-01 15:00 - 2026-08-02 17:00 | 上海 | 上海北中环中心1栋23楼 | 造物潭、Probes | 免费 | [报名](https://lianpu.com/event/ai-zhen-neng-bang-ni-tiao-tong-kai-fa-ban-ma) | 是 | 否 |
|
||||
| 第二届NVIDIA DGX Spark黑客松总决赛 | 2026-08-02 13:30 - 17:30 | 上海 | 上海松江科技影都AI创制生态中心大厅 | 阶跃星辰、NVIDIA | 免费 | [报名](https://lianpu.com/event/di-er-jie-nvidia-dgx-spark-hei-ke-song-zong-jue-sai) | 是 | 是 |
|
||||
| 抖音AI创变者计划2026·黑客松联赛|赛道三大区赛游园会 | 2026-08-02 14:00 - 17:30 | 深圳 | 深圳南方科技大学国际会议中心 | 抖音AI创变者计划 | 免费 | [报名](https://lianpu.com/event/dou-yin-ai-chuang-bian-zhe-ji-hua-2026-hei-ke-song-lian-sai) | 否 | 是 |
|
||||
| 首届开源英才夏令营 | 2026-08-03 - 2026-08-07(8月3日在收集窗口内开营) | 上海 | 上海交通大学、沐曦股份 | 沐曦股份、中国光华科技基金会、上海交通大学 | 免费 | [报名](https://developer.metax-tech.com/activities/18) | 是 | 是 |
|
||||
| 7.29 北京 AI 搞钱 & 整活专场 Social Mixer | 2026-07-29 18:00-22:00 | 北京 | 北京核心商圈(具体地点报名后通知) | DuoDuoLand、Gen2 Moon | 付费 | [报名](http://xhslink.com/o/5cJZhAlvfXG) | 否 | 否 |
|
||||
| 2026 杭州 AI 峰会 | 2026-07-29 | 杭州 | 浙江广电·浙江国际影视中心 | 中国蓝人工智能学院 | 免费 | [报名](http://xhslink.cn/o/7HIRT7ZjDsd) | 否 | 否 |
|
||||
| “AI漫游引力”2026全球游戏&AI漫剧创业路演大会 | 2026-07-29 13:00-18:00 | 上海 | 报名后可查看详细地址 | 游戏孵化器 | 免费 | [报名](https://www.huodongxing.com/event/9868251473000) | 否 | 否 |
|
||||
| 你的 AI 项目,离被看见只差一次 Demo Day | 2026-07-30 14:00-17:30 | 杭州 | 良渚数栖湾 AI+产业社区 | 良渚数栖湾 / 青来 AnW | 免费 | [报名](http://xhslink.cn/o/6fETcQsnEIo) | 否 | 否 |
|
||||
| 2026企业AI Agent规模化落地峰会 | 2026-07-30 13:30-17:00 | 杭州 | 滨江开元名都酒店(滨江区浦沿街道岩大房巷59号九洲中心A座1楼) | 网易智企、合合信息、e签宝、致远互联 | 免费 | [报名](https://www.huodongxing.com/event/2868441463100) | 否 | 是 |
|
||||
| AI创业者集结!归心谷PITCH人工智能专场 | 2026-07-30 13:30-16:00 | 上海 | 上海杨浦国定东路200号2号楼5楼 | 归心谷 | 免费 | [报名](https://www.huodongxing.com/event/8867666096111) | 否 | 否 |
|
||||
| 小镇会客厅:对话欧洲人工智能大会主席 Ulises Cortés | 2026-07-30 16:30 | 上海 | AI小镇服务中心3F路演空间(海科路1650号) | 张江AI创新小镇生态公司 | 免费 | [报名](https://mp.weixin.qq.com/s/x2EsABsaVm8cp0_nryLofA) | 是 | 是 |
|
||||
| 730上海-Agent进入真实行业实战揭秘|非凡Openday | 2026-07-30 | 上海 | 上海市徐汇区田林路192号 · 云赛空间 | 加密厨房 × 非凡产研 × 云赛空间 | 免费 | [报名](https://uniquebloom.cn/activities/agenticnow03) | 否 | 否 |
|
||||
| 北京 AI 苦瓜大会:AI Demo Club 开放麦 Vol.02 | 2026-07-30 19:30-21:30 | 北京 | 宇宙客厅(海淀区华清商务会馆16层1601B) | 宇宙客厅 / 机器口袋 / 硅基公社 Silicon Nexus | 免费 | [报名](http://xhslink.cn/o/2eJxhLDRN1D) | 否 | 否 |
|
||||
| 陆家嘴数学 & AI & 科技行业聚会 7.30 | 2026-07-30 晚上 | 上海 | 陆家嘴 | Frank的会客厅 | 免费 | [报名](http://xhslink.cn/o/1iuxJrYJtSz) | 是 | 否 |
|
||||
| Next Wave \| AI 智能硬件出海 Talks | 2026-07-31 13:30-17:00 | 上海 | 上海金茂君悦大酒店 54楼水瓶厅 \| 上海市浦东新区世纪大道 88 号(金茂大厦 3 号门) | 雨果跨境、Meta | 免费 | [报名](https://lianpu.com/event/next-wave-ai-zhi-neng-ying-jian-chu-hai-talks) | 否 | 是 |
|
||||
| 人工智能创新主题沙龙 \| 智体共生,创新驱动 AI 产业化 | 2026-07-31 14:00-17:30 | 上海 | 上海 · 浦东新区张江模力社区 T1 模力源 5 层 512 会议室 | 动点科技 technode、BEYOND EXPO | 免费 | [报名](https://lianpu.com/event/ren-gong-zhi-neng-chuang-xin-zhu-ti-sha-long) | 否 | 否 |
|
||||
| OpenMind AI智能体时代企业组织结构新范式峰会 | 2026-07-31 13:30-17:30 | 上海 | 上海黄浦·人民广场 | OpenMind Events | 付费 | [报名](https://hdxu.cn/1L9vi) | 否 | 否 |
|
||||
| 活动预告|智源/TileRT/腾讯/华为/智元创新同台,共探 AI 编译的多层级协同优化 | 2026-08-01 13:30-17:30 | 北京 | 中关村创业大街12号楼五层多功能厅 | HyperAI超神经 | 付费 | [报名](https://www.huodongxing.com/event/7867689333500) | 是 | 是 |
|
||||
| 上海学术酒吧|从菲尔兹奖到 AI4S | 2026-08-01 14:00 | 上海 | 上海漕河泾,具体地点以主办方通知为准 | 上海学术酒吧 | 免费 | [报名](https://www.xiaohongshu.com/explore/6a65a8a1000000000503a4c0?xsec_token=AB9UyQl_e1vJPLA2LrkgtZHRhWuDny2MY3HXOqq6J8Dk0%3D) | 是 | 否 |
|
||||
| 8月1日北京The HERgency: 她行动,即未来- AI时代的人本领导力论坛 | 2026-08-01 14:00-17:00 | 北京 | 报名后可查看详细地址 | 她原力SheRewires | 免费 | [报名](https://www.huodongxing.com/event/6869430474900) | 否 | 否 |
|
||||
| ChinaJoy Afterparty&DemoDay: The Future of AI-powered Pan-Entertainment | 2026-08-01 10:30-13:30 | 上海 | Shang Hai Shi | EpicConnector | 付费 | [报名](https://luma.com/chinaJoyafterparty) | 否 | 是 |
|
||||
<!-- CURRENT_WEEK_TABLE:END -->
|
||||
|
||||
完整的本周数据见 [`data/2026-07-28.csv`](data/2026-07-28.csv)。
|
||||
|
||||
## 历史数据
|
||||
|
||||
历史周快照和长期活动数据统一放在 [`data/`](data/) 目录中:
|
||||
|
||||
- `2026-07-21.csv`、`2026-07-14.csv` 等:按周保存的不可变快照
|
||||
- `long-term.csv`:跨周或长期有效的活动
|
||||
|
||||
## 更新方式
|
||||
|
||||
```bash
|
||||
python3 活动日历/sync_from_feishu.py
|
||||
```
|
||||
|
||||
运行前确保本机 `lark-cli` 已完成飞书用户授权。更新后检查 CSV diff,再提交一个类似 `data(calendar): update 2026-07-28` 的 commit。
|
||||
|
||||
进入新的一周时,在脚本的 `TABLES` 中增加新周表,并将 `CURRENT_WEEK` 改为新周日期;脚本会同步 CSV 并自动刷新本节 README 表格。
|
||||
|
|
@ -0,0 +1,27 @@
|
|||
活动名称,ai infra,主办方,报名链接,是否收费,地点,活动时间,城市,热门
|
||||
2026 北京智源大会,北京,,北京智源人工智能研究院,https://2026.baai.ac.cn/schedule,中关村国际创新中心 / 线上直播,2026-06-12 至 2026-06-13
|
||||
智能 AI 开发者见面会:AI Agent 开发实践与生态连接,北京,,智能 AI 开发者见面会相关主办方,https://lianpu.com/,中关村创业大街,2026-06-13 14:00-21:00
|
||||
第十届 A2M 人工智能创新峰会,北京,,A2M 人工智能创新峰会组委会,https://lianpu.com/,中关村国家自主创新示范区会议中心,2026-06-13 至 2026-06-14
|
||||
Amazon Quick 重塑职场工作模式,北京,,AWS User Group / Amazon,https://lianpu.com/,亚马逊北京办公室,2026-06-13 13:30-17:00
|
||||
2026 Google I/O Extended Beijing,北京,,Google Developer Groups / Google I/O Extended Beijing,https://lianpu.com/,海淀区融科资讯中心,2026-06-14 13:30-17:30
|
||||
设计师的 Vibe Coding 实操指南线下分享会,北京,,AI 798 Lab,https://www.xiaohongshu.com/explore/6a215e6f000000003601fbff?xsec_token=AByKk_XEAThRf5hS7M_sd_IqKeMYYwkIKJvq_JZU8l3GA=&xsec_source=pc_user,海淀区中关村东升科技园一期北领地 B6 号楼负一层阶梯教室,2026-06-13 13:30-16:30
|
||||
从 Vibe Coding 到 Agentic Engineering:Trae × Agent Plan,杭州,,Trae / Agent Plan,https://www.huodongxing.com/event/5863819580500,未来科技城国际人才园,2026-06-13 13:30-17:30
|
||||
AI 创业达人秀|Google I/O Extended 2026 杭州站,杭州,,Google Developer Groups / 杭州站相关主办方,https://lianpu.com/,拱墅区智慧信息产业园,2026-06-14 14:00-17:00
|
||||
企业级 AI 工作流与智能体落地实战,杭州,,杭州AI研习社,https://www.xiaohongshu.com/explore/6a1e94da000000003700f9fe?xsec_token=ABCjZQS7fWLYf-m1s2rhihqISoJTCUr2LVoWxt_Y9rKaA=&xsec_source=pc_user,报名后获取详细地址,2026-06-14 14:00-16:30
|
||||
AI+X 创造节首期 OPC 能力专场线下沙龙,杭州,,培风社 / Datawhale,https://www.xiaohongshu.com/explore/6a229a40000000003700cd6b?xsec_token=ABt1td7xiaTRtOCIhlZI2MQvRPGPfUWRIAGczHAQysJJ4=&xsec_source=pc_user,报名后获取详细地址,2026-06-13 14:30-17:00
|
||||
联谱 Demo Day Vol.1,杭州,,联谱 Lianpu,https://lianpu.com/event/lian-pu-demo-day-vol1,西湖区西溪湿地恩之庐,2026-06-13 14:00-17:30
|
||||
AI for Engineering International Conference,香港,2026-06-05,MDPI / 香港科技大学等,https://mdpi.cn/announcements/2482,香港科技大学,2026-06-12 至 2026-06-14
|
||||
OpenClaw 社群 AI Agent 专题讲座,上海,,OpenClaw 社群,[https://lianpu.com/](https://lianpu.com/),长宁 SEMA 多功能厅,2026-06-14 14:00-17:30
|
||||
VC 赛博酒保行动 AI 创业者之夜,上海,,Thinkingloop / AGI BAR 知识酒馆,https://www.xiaohongshu.com/explore/6a1e2aff0000000021020eac?xsec_token=ABCjZQS7fWLYf-m1s2rhihqAIlSMRYKGHM4SrvSu3eJSA=&xsec_source=pc_user,徐汇区华发路 777 弄 2 号 1 楼一层 AGI BAR 知识酒馆,2026-06-10 18:00-23:59
|
||||
Build with AI —— Trailblazer Shanghai Event,上海,,Salesforce CRM / 阿里云,https://www.xiaohongshu.com/explore/6a141aba000000003503a11f?xsec_token=ABlN5_-eMGXoO0L3AKvYb_PiafrIQBzyhcFEhhSBlzI4Y=&xsec_source=pc_user,报名后获取详细地址,2026-06-11 14:00-18:00
|
||||
上海徐汇 AI 教育线下走心交流会,上海,,Ringhere 社交组局,https://www.xiaohongshu.com/explore/6a276993000000001602788b?xsec_token=ABap_2bBmgR3bqRc0-cKWBc1sFTgFR22JLVTLtrS_eioY=&xsec_source=pc_user,报名后获取详细地址,2026-06-11 19:00-20:30
|
||||
2026 第五届 AI 短剧产业大会 | 上海站,上海,,好戏上场 / 星耀荟,https://www.huodongxing.com/event/3858451464500?qd=8839540397656,上海市闵行区东方智媒城 6B 座 3 楼,2026-06-12 09:30-18:30
|
||||
AI+Payment 草台开放麦|Money in Motion 系列,上海,,Money in Motion / 788 创意社区,https://www.xiaohongshu.com/explore/6a1eba810000000037035be7?xsec_token=ABCjZQS7fWLYf-m1s2rhihqKM1n7NOzhPcP_rhlguqs08=&xsec_source=pc_user,和胤 788 广场 3 楼 3A,2026-06-12 19:00-23:59
|
||||
2026 MongoDB 中国用户大会|广州站,广州,,MongoDB,[https://lianpu.com/org/mongodb](https://lianpu.com/org/mongodb),广州海航威斯汀酒店,2026-06-11 09:30-17:30
|
||||
深圳最大 Vibe Coders 社区线下局,深圳,,深圳 Vibe Coders 社区,https://lianpu.com/,前海 Citymuse 书咖,2026-06-14 14:00-18:00
|
||||
QoderWork 实训营 | 深圳站,深圳,,QoderWork × Y/OUR SPACE,https://www.xiaohongshu.com/explore/6a26902800000000360013e6?xsec_token=ABBaQ08L4pSCfbK8jWyV7Lrmehwh9hF4OBwQHMA-FjrGA=&xsec_source=pc_user,阿里中心 T2 座 14 楼 Y/OUR SPACE 创业社区,2026-06-12 14:00-17:00
|
||||
走进 AWS · 成都站:AI Agent 落地战,成都,,AWS,https://lianpu.com/,成都线下,具体地点报名后确认,2026-06-12 14:00-17:30
|
||||
MiniMax Dev Meetup 2026 开发者见面会·上海站,上海,,MiniMax AI,https://www.xiaohongshu.com/explore/6a27ec21000000000702bc25?xsec_token=ABap_2bBmgR3bqRc0-cKWBc_h4l_d9iY43Mg9BVz2qNQw=&xsec_source=pc_user,具体地址报名后通知,2026-06-13 14:00-17:00
|
||||
Booming Club 第二局「AI 非效率」主题沙龙,北京,,蓝驰创投,https://mp.weixin.qq.com/s/7on6JfWPA90bxkIEiAvxYA,报名入选后通知详细地址,2026-06-12 19:00-23:59
|
||||
职场 AI 落地沙龙|牛马人高效摸鱼指南,北京,,蓝耘星河,https://www.xiaohongshu.com/explore/6a1fcb7800000000080320c0?xsec_token=AB-GiicdrSotUVm3K56viWlac0hyBgB5gdA6r8jmlwKco=&xsec_source=pc_user,朝阳区蓝耘北京先进智算中心,2026-06-13 14:00-16:00
|
||||
AI 新范式下的创业机遇,深圳,,Frontier Go,https://www.xiaohongshu.com/explore/6a266f850000000035021582?xsec_token=ABBaQ08L4pSCfbK8jWyV7Lrvd_30rNnlsSaW7G3n_gvyc=&xsec_source=pc_user,具体地址报名后通知,2026-06-13 15:00-18:00
|
||||
|
|
|
@ -0,0 +1,29 @@
|
|||
活动名称,ai infra,主办方,报名链接,是否收费,地点,活动时间,城市,热门
|
||||
中关村「火花」活动——前沿硬科技线上线下路演,报名后获取,,免费,科创融STI / 北京市科学技术委员会 / 中关村科技园区管理委员会,2026-06-18 14:00-17:00,,https://www.huodongxing.com/event/6864225046500?,北京,
|
||||
AI Next 疯享会 | 北京场,中关村(报名后获取),,免费,AI Next社区、青腾会,2026-06-15 18:30,,https://www.xiaohongshu.com/explore/6a2bbd640000000016024512?xsec_token=ABfzJkEgXl3FaL3urLauApNASYrdBCgJSeRpNXj8VTmkM=&xsec_source=pc_user,北京,
|
||||
"Conversations深圳 | 共""话""商机高峰会(Meta AI生态)",康莱德酒店,,免费,Meta,2026-06-16 10:00-17:00,,https://www.huodongxing.com/event/9863350452900?,深圳,
|
||||
跨境电商AI产品超级发布会,报名后获取,,免费,智象出海,2026-06-16 13:30-17:30,,https://www.huodongxing.com/event/1861647879300?,深圳,
|
||||
2026全国CIO大会,浦东酒店一层,,收费,企业网D1net,2026-06-17 至 2026-06-18,,[https://www.huodongxing.com/event/6860650671600](https://www.huodongxing.com/event/6860650671600),上海,
|
||||
SAP智能硬件产业创新日 | SAP Connect Day for Smart Hardware,报名后获取,,免费,创业邦、爱思普(SAP),2026-06-17 09:30-17:30,,https://www.huodongxing.com/event/7864660871100?,深圳,
|
||||
爱搜GEO主题沙龙:AI全域获客增长,卓越世纪中心4号楼,,收费,AIDSO爱搜、抖查查,2026-06-17 13:00-21:00,,https://www.huodongxing.com/event/5861647291611?qd=8839540397656,深圳,
|
||||
OPC创业营项目路演,萧山区归谷国际中心B座5楼,,免费,INNONATION创新国度国际孵化器,2026-06-17 13:30-17:30,,https://www.xiaohongshu.com/user/profile/632087c1000000002303ba72?xsec_token=ABmjPEJZiWd1a6gxiaLYKbuZf4pjFEf1-G5-y1hwfd6KQ=&xsec_source=pc_note,杭州,
|
||||
阿里云AI创享日,朝阳阿里云北京总部,,免费,阿里云,2026-06-17 14:00-18:00,是,https://www.huodongxing.com/event/4864364529800?,北京,
|
||||
AI全行业获客增长沙龙会 GEO实战手把手教学,金盛科创大厦B座24楼,,免费,极义科技,2026-06-17 14:00-17:00,,https://www.huodongxing.com/event/7864678982111?,杭州,
|
||||
AI时代的出海人力战略——从EOR到全球化HR体系,报名后获取,,免费,REMOTE PEOPLE,2026-06-17 14:00-17:00,,https://www.huodongxing.com/event/8863937832811,上海,
|
||||
AIGC影视创新论坛/AI短剧/上海国际电影节一带一路电影周同期活动,申迪文化中心1楼梦享厅,,免费,创星融智,2026-06-17 15:30-17:30,,https://www.huodongxing.com/event/9863916388700,上海,
|
||||
2026第一届短视频+跨境电商AIGC创作大赛启动仪式,报名后获取,,免费,广东省网商协会,2026-06-18 10:00-12:00,,https://www.huodongxing.com/event/5864364743700?qd=8839540397656,广州,
|
||||
高科技企业效能跃升与OPC生态大会,黄埔区科学城彩频路11号广东软件科学园A栋二楼,,免费,StartupGrind,2026-06-18 14:00-17:30,,https://www.xiaohongshu.com/explore/6a294ce8000000002003b4c8?xsec_token=AB5_dqSh_IdJu3Q_sByfAGR4XjyebADL1EYm-k-9QESdQ=&xsec_source=pc_user,广州,
|
||||
AI情报交流 coffee chat,聊AI给打工人工作带来的变化,报名后获取,,免费,杭州AI研习社,2026-06-21 14:00-16:30,,[https://www.lianpu.com/event/ai-qing-bao-jiao-liu-coffee-chat-liao-liao-ai-gei-da-gong-re](https://www.lianpu.com/event/ai-qing-bao-jiao-liu-coffee-chat-liao-liao-ai-gei-da-gong-re),杭州,
|
||||
探访解放日报头版工业 AI 原生企业,报名后可查看详细地址,,免费,上海工业互联网协会,2026-06-17 09:30-12:00,,https://www.huodongxing.com/event/8864526487900,上海,
|
||||
MuleRun AI 办公搭子产品解读 & 实操分享会,阿里巴巴徐汇滨江园区 X 区 X5-3F 亲橙客厅,,待确认,亲橙空间,2026-06-17 15:30-17:00,是,https://www.xiaohongshu.com/explore/6a2fb89a00000000220184ff?xsec_token=AB_x48j4_tcPMkrIXz-SD95nITcoEDWGb-AWXFjqEKFMM=&xsec_source=pc_user,上海,
|
||||
QoderWork 实训营 上海站,阿里巴巴徐汇滨江园区 D 区星海厅,,待确认,Qoder / 亲橙空间,2026-06-18 14:00-17:00,,https://www.xiaohongshu.com/explore/6a26902800000000360013e6?xsec_token=ABBaQ08L4pSCfbK8jWyV7Lrmehwh9hF4OBwQHMA-FjrGA=&xsec_source=pc_user,上海,
|
||||
AI+X 创造节 AIGC 能力专场,张江之尚,,待确认,Datawhale,2026-06-18 14:00-18:00,是,https://www.xiaohongshu.com/explore/6a2d0fed000000000803150d?xsec_token=ABmXPVIXfh_UaH6lWN9TgHPt7felqQV3W75aB5-b-Bxro=&xsec_source=pc_user,上海,
|
||||
壮大“耐心资本”陪跑 AI 时代创业新赛程——2026 浙江省科技金融大会,余杭区礼贤路余杭区梦想小镇东北侧约 100 米,,免费,浙江省科技企业创新协会,2026-06-16 09:00-18:00,,https://lianpu.com/city/hangzhou,杭州,
|
||||
2026 阿里国际站出海新范式峰会,滨江区网商路 699 号阿里巴巴滨江园区,,免费,阿里巴巴国际站,2026-06-16 13:00-17:00,是,https://lianpu.com/city/hangzhou,杭州,
|
||||
AI 正在改变创业的起点 · OPC 创业营项目路演,萧山区归谷国际中心 B 座 5 楼创新国度国际孵化器,,待确认,瞧见 Club,2026-06-17 13:30-17:30,,[https://lianpu.com/city/hangzhou](https://lianpu.com/city/hangzhou),杭州,
|
||||
剧有引力 增长有戏——AI 短剧出海实战沙龙,钱潮开元酒店 29 楼云渡厅,,免费,Nativex,2026-06-17 14:00-17:00,,https://www.huodongxing.com/event/5862914416400,杭州,
|
||||
Vol.07 如何在一人公司产品端发挥你的天赋优势,麓客社区发展中心 507 漫汀邻里中心 5F,,收费,社群共益实验室,2026-06-17 13:00-17:30,,https://www.xiaohongshu.com/explore/6a190acd0000000007025f6e?xsec_token=ABRF3LnrmAEjDJSc02Ba52n1-awlqpCUIN-p7dE6tJQJQ=&xsec_source=pc_user,成都,
|
||||
《AI时代的商业天机》,普陀区长寿路 285 号恒达大厦 2206 室,,免费,活动行主办方信息待确认,2026-06-21 14:00 至 2026-06-30 17:00,,https://www.huodongxing.com/event/4863985249700,上海,
|
||||
具身智芯:数据·算力·能耗工业化革新研讨会,徐汇区,报名后可查看详细地址,,免费,IT东方汇,2026-06-20 13:00-18:00,,https://www.huodongxing.com/event/4862789218600,上海,
|
||||
共启阿里外贸 共赢全球市场,阿里巴巴徐汇园区,,免费,阿里巴巴,2026-06-17 13:30-22:00,,https://www.huodongxing.com/event/8861036836611,上海,
|
||||
源来有饭上海站,报名后获取,,免费,AI Infra ,2026-06-30 19:00-21:00,是,[https://mp.weixin.qq.com/mp/wappoc_appmsgcaptcha?poc_token=HAO1MGqjXXiUuJCCd2Z_Z7W2AesHAsicQJhHXxxu&target_url=https%3A%2F%2Fmp.weixin.qq.com%2Fs%3F__biz%3DMzY4MjM0NzYwOQ%3D%3D%26mid%3D2247483742%26idx%3D1%26sn%3D467e22706620e2cebfcfb57131a3df63%26chksm%3Df292c90a7e08484233a169a1badcd53bf8fb62917bf4df27d098cbaa911611975463b3727802%26scene%3D126%26sessionid%3D1781517329%26subscene%3D227%26clicktime%3D1781576963%26enterid%3D1781576963#rd](https://mp.weixin.qq.com/mp/wappoc_appmsgcaptcha?poc_token=HAO1MGqjXXiUuJCCd2Z_Z7W2AesHAsicQJhHXxxu&target_url=https%3A%2F%2Fmp.weixin.qq.com%2Fs%3F__biz%3DMzY4MjM0NzYwOQ%3D%3D%26mid%3D2247483742%26idx%3D1%26sn%3D467e22706620e2cebfcfb57131a3df63%26chksm%3Df292c90a7e08484233a169a1badcd53bf8fb62917bf4df27d098cbaa911611975463b3727802%26scene%3D126%26sessionid%3D1781517329%26subscene%3D227%26clicktime%3D1781576963%26enterid%3D1781576963#rd),上海,"{'file_token': 'UAV7bCAdyofcvwxG2P6cgVCYnWd', 'name': 'IMG_1995.JPG', 'size': 252800}"
|
||||
|
Can't render this file because it has a wrong number of fields in line 2.
|
|
|
@ -0,0 +1,27 @@
|
|||
活动名称,ai infra,主办方,报名链接,是否收费,地点,活动时间,城市,热门
|
||||
2026年全球数字经济大会 科技服务业经济发展论坛,2026-07-03 13:30-18:00,[https://www.huodongxing.com/event/4866366664300](https://www.huodongxing.com/event/4866366664300),中关村国家自主创新示范区展示中心静明厅,,是,2026年全球数字经济大会 / 科技服务业经济发展论坛,免费,北京
|
||||
超节点与GW级AIDC技术论坛暨Open AI Infra社区年中工作会议,2026-07-03 09:00-18:00,[https://www.huodongxing.com/event/1866691221900](https://www.huodongxing.com/event/1866691221900),丽亭华苑酒店,,否,Open AI Infra 社区 / 论坛组委会,付费,北京
|
||||
当数据的头号消费者变成 Agent:七位开源 AI 数据一线决策者,北京见,2026-07-04 13:00-18:00,[https://www.huodongxing.com/event/8867152191000](https://www.huodongxing.com/event/8867152191000),中关村创业大街 12 号楼五层 多功能厅,,否,Data for AI,免费,北京
|
||||
2026科大讯飞AI服务市场生态发布会,2026-07-05 08:00-10:30,[https://www.huodongxing.com/event/5865356704611?utm_source=%e5%8f%91%e7%8e%b0%e6%b4%bb%e5%8a%a8%e9%a1%b5&utm_medium=&utm_campaign=eventspage&qd=8828363103856](https://www.huodongxing.com/event/5865356704611?utm_source=%e5%8f%91%e7%8e%b0%e6%b4%bb%e5%8a%a8%e9%a1%b5&utm_medium=&utm_campaign=eventspage&qd=8828363103856),中关村软件园讯飞大厦,,是,科大讯飞 / 讯飞开放平台,免费,北京
|
||||
AI Coding 武林大会 x Fnights AI小酒馆 S10,2026-07-05 15:30,[https://www.huodongxing.com/event/4866837151500](https://www.huodongxing.com/event/4866837151500),江苏无锡(详细地址待复核),,否,无锡 AI 工坊,付费,无锡
|
||||
智驭未来,揭秘HR“数字员工”如何重塑人力效能线下分享会,2026-07-03 14:00-16:40,[https://mp.weixin.qq.com/s/WpCkEzX5dtHHZhmNdVKafw](https://mp.weixin.qq.com/s/WpCkEzX5dtHHZhmNdVKafw),北京东城区环球贸易中心,,否,HRMC人力经理委员会,免费,北京
|
||||
第二届AI应用领航者大会,2026-07-05 13:30,[https://mp.weixin.qq.com/s/k2RAqPSk24AZCint-rlADQ](https://mp.weixin.qq.com/s/k2RAqPSk24AZCint-rlADQ),上海交通大学徐汇校区包兆龙图书馆A300报告厅,,否,上海交大人工智能校友会,免费,上海
|
||||
2026 全球 OPC 共创节:AI 创造者年度大派对,2026-07-01 至 2026-07-04,[https://www.xiaohongshu.com/explore/6a38b41b000000001503cd71](https://www.xiaohongshu.com/explore/6a38b41b000000001503cd71),北京国家会议中心,,是,全球 OPC 共创节,免费,北京
|
||||
CIEI 2026 上海国际具身智能产业博览会,2026-07-02 09:00 至 2026-07-04 17:30,[https://mp.weixin.qq.com/s/D05s3fUbD5MCf34pkAp7ug](https://mp.weixin.qq.com/s/D05s3fUbD5MCf34pkAp7ug),国家会展中心(上海),,是,中国机电一体化技术应用协会 / 上海市国际展览(集团)有限公司,免费,上海
|
||||
智研未来 AI4S 主题交流活动,2026-07-02,[https://mp.weixin.qq.com/s/ofZYkYg3D0TJhaTLHXJCGA](https://mp.weixin.qq.com/s/ofZYkYg3D0TJhaTLHXJCGA),上海·漕河泾开发区,,是,上海人工智能实验室 / 上海国投,免费,上海
|
||||
AI创客 mixer 之夜,2026-06-30 18:00-22:00,[https://mp.weixin.qq.com/s/lkLyg3THQDA4pzJA6S-pjA](https://mp.weixin.qq.com/s/lkLyg3THQDA4pzJA6S-pjA),三元桥精酿酒吧,,是,DuoDuoLand / DuoTech,免费,北京
|
||||
2026 中国 AI 智能体大会,2026-07-02 至 2026-07-03,[https://work.weixin.qq.com/ct/wcde5f1aab1d6e6d336d9068a7e6e0a931ab](https://work.weixin.qq.com/ct/wcde5f1aab1d6e6d336d9068a7e6e0a931ab),杭州君悦酒店,,,智东西 / 智猩猩,免费,杭州
|
||||
腾讯赋能 · 数智办公:WorkBuddy AI 实践沙龙,2026-06-30 14:30-17:00,[https://mp.weixin.qq.com/s/NkSRH_3OA1XsU4SNJXMCFQ](https://mp.weixin.qq.com/s/NkSRH_3OA1XsU4SNJXMCFQ),福永意库会议厅 6 栋 1 楼,,否,深圳市电子商务协会,免费,深圳
|
||||
AI Next 疯享会 | 上海场,2026-06-30 18:30-23:59,[https://www.xiaohongshu.com/explore/6a2bbd640000000016024512?xsec_token=ABfzJkEgXl3FaL3urLauApNASYrdBCgJSeRpNXj8VTmkM=&xsec_source=pc_user](https://www.xiaohongshu.com/explore/6a2bbd640000000016024512?xsec_token=ABfzJkEgXl3FaL3urLauApNASYrdBCgJSeRpNXj8VTmkM=&xsec_source=pc_user),腾讯滨江大厦,,否,AI Next 社区,免费,上海
|
||||
智启新程 · AI 领航 2026 中国智造 B2B 品牌出海峰会,2026-07-01 13:30-17:30,[https://mp.weixin.qq.com/s/JjLTuttgcYCE0_t4ZCMPWw](https://mp.weixin.qq.com/s/JjLTuttgcYCE0_t4ZCMPWw),绿谷景澜酒店 2 楼,,否,易海创腾 Yeehai,免费,杭州
|
||||
智启生命 · 数创未来 AI 赋能医疗健康创新与应用,2026-07-01 14:00-16:30,[https://mp.weixin.qq.com/s/MXl3KucOJ6noTAlmZE3etw](https://mp.weixin.qq.com/s/MXl3KucOJ6noTAlmZE3etw),福田保税区市花路河套汇客厅一楼多功能厅,,否,深圳市人工智能行业协会,免费,深圳
|
||||
沉浸式游戏造物|硬件 Vibe Coding 打开世界新大门,2026-07-02 18:00-21:00,[https://www.xiaohongshu.com/explore/6a3a4e79000000001700ab9d?xsec_token=ABoc2t1HhXnNkkgOkqlkXQ1HXHIzojRMDYvpw7-a9uKMY=&xsec_source=pc_user](https://www.xiaohongshu.com/explore/6a3a4e79000000001700ab9d?xsec_token=ABoc2t1HhXnNkkgOkqlkXQ1HXHIzojRMDYvpw7-a9uKMY=&xsec_source=pc_user),郭宁敬路 498 号 4 号楼 1 楼 蘑菇云创客空间,,是,小红书 / 蘑菇云创客空间 / DFRobot,免费,上海
|
||||
玩转云侧 AI 能力,Amazon Quick 落地业务自动化,2026-07-04 13:30-17:40,[https://www.huodongxing.com/event/3867100195611?utm_source=%E5%8F%91%E7%8E%B0%E6%B4%BB%E5%8A%A8%E9%A1%B5&utm_medium=&utm_campaign=eventspage&qd=8828363103856](https://www.huodongxing.com/event/3867100195611?utm_source=%E5%8F%91%E7%8E%B0%E6%B4%BB%E5%8A%A8%E9%A1%B5&utm_medium=&utm_campaign=eventspage&qd=8828363103856),南山区华润置地大厦 B 座 15 楼,,否,亚马逊云科技 User Group,免费,深圳
|
||||
杭州 AI 研习社第 7 期线下沙龙:AI 内容创业新机会——漫剧赛道实战拆解,2026-07-04 14:00-16:30,[https://www.huodongxing.com/event/1867417156100?utm_source=%e5%8f%91%e7%8e%b0%e6%b4%bb%e5%8a%a8%e5%88%97%e5%9b%be%e9%a1%b5&utm_medium=&utm_campaign=eventspage&qd=8828363103856](https://www.huodongxing.com/event/1867417156100?utm_source=%e5%8f%91%e7%8e%b0%e6%b4%bb%e5%8a%a8%e5%88%97%e5%9b%be%e9%a1%b5&utm_medium=&utm_campaign=eventspage&qd=8828363103856),上城区党群服务中心政治生活馆,,否,杭州 AI 研习社,免费,杭州
|
||||
解码爱奇艺 AIGC 影视创作 · 北京场,2026-07-04 14:00-16:00,[https://www.huodongxing.com/event/1865653025011](https://www.huodongxing.com/event/1865653025011),爱奇艺青春中心 1 层多功能厅,,否,爱奇艺,免费,北京
|
||||
2026 Foundry 夏季之旅 - 北京站,2026-07-05 13:00-17:30,[https://www.huodongxing.com/event/4865706845911?utm_source=](https://www.huodongxing.com/event/4865706845911?utm_source=),朝阳区亮马桥路 50 号燕莎中心凯宾斯基饭店 3F 西安厅,,否,西琳信息,免费,北京
|
||||
How I Ai Vol.5 - Harness Engineering / FDE / 社群运营,2026-07-05 14:00-17:00,[https://www.xiaohongshu.com/explore/6a3e2a2c000000001702e22e](https://www.xiaohongshu.com/explore/6a3e2a2c000000001702e22e),正德社区服务产业园,,否,一瓣社造,免费,北京
|
||||
WAVE 2026 品牌全球化大会,2026-07-03 08:30-17:00,[https://mp.weixin.qq.com/s/gYckfHMG127KeTwrrpgDnw](https://mp.weixin.qq.com/s/gYckfHMG127KeTwrrpgDnw),报名后获取详细地址,,是,霞光社 / 霞光智库,免费,深圳
|
||||
沐曦股份首届开源英才夏令营,"报名时间:2026-06-24 00:00 至 2026-07-15 23:59
|
||||
活动时间:2026-06-24 00:00 至 2026-08-07 23:59",[https://developer.metax-tech.com/activities/18](https://developer.metax-tech.com/activities/18),上海交通大学,,是,沐曦股份,免费,上海
|
||||
WAIC 2026 世界人工智能大会(第七届),2026-07-17 至 2026-07-20,[https://www.worldaic.com.cn/](https://www.worldaic.com.cn/),上海世博展览馆,浦东国展路1099号,,是,上海市政府 / WAIC组委会,付费,上海
|
||||
|