Compare commits
520 Commits
| Author | SHA1 | Date |
|---|---|---|
|
|
0fff643645 | |
|
|
806f034b48 | |
|
|
293a08b0b8 | |
|
|
33379eb81a | |
|
|
82004b3505 | |
|
|
22f09fdef2 | |
|
|
b1a8c8d71b | |
|
|
600ae53812 | |
|
|
17c9235e6e | |
|
|
3d27403160 | |
|
|
d45fef52bc | |
|
|
a0a41c0869 | |
|
|
1093812c30 | |
|
|
b634793432 | |
|
|
ec24043c60 | |
|
|
85299cd247 | |
|
|
1f253f95ef | |
|
|
d256767cb1 | |
|
|
22f44fdce1 | |
|
|
9d31e0c37a | |
|
|
6d357d56b3 | |
|
|
66dc14b5ab | |
|
|
18676e38e6 | |
|
|
037dcdbebe | |
|
|
dce8da7185 | |
|
|
3a23715a78 | |
|
|
163b628191 | |
|
|
874f4e5620 | |
|
|
462d8f552c | |
|
|
934d6ef380 | |
|
|
6f1f2ee6fc | |
|
|
92f05fd498 | |
|
|
1a29b61576 | |
|
|
92b1cdd7b8 | |
|
|
42ec9aafb0 | |
|
|
cad7a3885a | |
|
|
d14530e432 | |
|
|
b99e0fa293 | |
|
|
bf3c0aee2e | |
|
|
b9cd0260e4 | |
|
|
25c3be1b74 | |
|
|
1c4d61de54 | |
|
|
202142600e | |
|
|
0fbf83e470 | |
|
|
5063bb1186 | |
|
|
6ba22363b8 | |
|
|
cdeeb794c5 | |
|
|
5f3c76614d | |
|
|
57870f88cf | |
|
|
9843b856cf | |
|
|
177cae4e42 | |
|
|
d440854c3a | |
|
|
e497991a41 | |
|
|
72dace19e0 | |
|
|
7fdf654f5b | |
|
|
a49269fa08 | |
|
|
151c29c46e | |
|
|
a6c9be9a3f | |
|
|
d2317c8b6d | |
|
|
9b4b5f5f9c | |
|
|
719f8ce0bb | |
|
|
db20a24be4 | |
|
|
66ecc1689b | |
|
|
55bf3dd368 | |
|
|
581b48a62e | |
|
|
2b72c914ce | |
|
|
683fcc34f9 | |
|
|
906a2f91de | |
|
|
6c9d34a0cd | |
|
|
321a2bec24 | |
|
|
7656c697af | |
|
|
2a0aab62f4 | |
|
|
8c6744e749 | |
|
|
94840ce1f7 | |
|
|
6e028af9ce | |
|
|
aebe004fc4 | |
|
|
4594f4bf0d | |
|
|
8c25f8e6ab | |
|
|
4bb999622e | |
|
|
ebaa012469 | |
|
|
9bb54ca87c | |
|
|
5790b51143 | |
|
|
5ebc63d27e | |
|
|
801f1e7b39 | |
|
|
69d9b29fb4 | |
|
|
c01211bbca | |
|
|
3a1574985f | |
|
|
a25683d1ca | |
|
|
c148dffc0e | |
|
|
76fac20272 | |
|
|
1336661343 | |
|
|
ad429a66ed | |
|
|
e3deea96c4 | |
|
|
c7d3fbee17 | |
|
|
5b424259c7 | |
|
|
240ec3a116 | |
|
|
6e565bd7e3 | |
|
|
c624d55577 | |
|
|
e316544b5d | |
|
|
71e906938b | |
|
|
be7e0254bb | |
|
|
b5fac0e8ab | |
|
|
bb7ee0e418 | |
|
|
3ec409ee68 | |
|
|
06539975e9 | |
|
|
5be5d952d9 | |
|
|
436f07ed3c | |
|
|
1c5a8b204d | |
|
|
b89672a06a | |
|
|
b68639fae6 | |
|
|
f3ac51b222 | |
|
|
3b9f2c33dd | |
|
|
55e18fc87b | |
|
|
43bf4546c0 | |
|
|
74ea5c7cf4 | |
|
|
bc84ffb726 | |
|
|
1e82c36c34 | |
|
|
364efba03b | |
|
|
3a55875b90 | |
|
|
721bb616bd | |
|
|
7e27b5bec9 | |
|
|
be519b8f1b | |
|
|
30eaf7166e | |
|
|
65dcfffa65 | |
|
|
4753e57fc0 | |
|
|
bf787ef26d | |
|
|
662313d9dc | |
|
|
5c19e1dad0 | |
|
|
b85f278be5 | |
|
|
271a569662 | |
|
|
dca56fd467 | |
|
|
44ba6196e7 | |
|
|
630ef821e2 | |
|
|
756e73150f | |
|
|
952617bd05 | |
|
|
64dbeb31f4 | |
|
|
a659075e56 | |
|
|
8649dd5816 | |
|
|
9e019ee92a | |
|
|
bedb8ad03d | |
|
|
0d00ae02ce | |
|
|
1ae9455453 | |
|
|
3f0fced964 | |
|
|
59cfa8d0eb | |
|
|
5c4e4686f2 | |
|
|
d9efaa5365 | |
|
|
3c8389bd9c | |
|
|
61958a57d9 | |
|
|
914977f946 | |
|
|
5834a01580 | |
|
|
04faf803b8 | |
|
|
94261e4e7b | |
|
|
4e50b4f1b9 | |
|
|
2d4e85ac77 | |
|
|
11092e3606 | |
|
|
e400095cc4 | |
|
|
772cc09a67 | |
|
|
df4a9be035 | |
|
|
23bf41d580 | |
|
|
5c0e437069 | |
|
|
60a64555f2 | |
|
|
09c6b24b5f | |
|
|
efa23d4106 | |
|
|
24e65feffc | |
|
|
65665d6904 | |
|
|
be8ca881f4 | |
|
|
444c1f022f | |
|
|
f867e75cb0 | |
|
|
578126201c | |
|
|
41367e3c13 | |
|
|
0bcfa55aba | |
|
|
be8757f146 | |
|
|
f6b721285e | |
|
|
3e0dd8cfbe | |
|
|
fc72cc05b4 | |
|
|
e451a0dbad | |
|
|
150d68b2b0 | |
|
|
77a6e5a9ad | |
|
|
35f9c7318d | |
|
|
c34968176f | |
|
|
248763b7ec | |
|
|
a721789b4a | |
|
|
2db60858cd | |
|
|
cd4ccefe4a | |
|
|
71519e09f7 | |
|
|
1ac8f7c95a | |
|
|
711847fc1e | |
|
|
3449d93923 | |
|
|
33305ee207 | |
|
|
96d6e2ea2b | |
|
|
0714357c0b | |
|
|
2dc775aa48 | |
|
|
ed129d3759 | |
|
|
a30a93dfcc | |
|
|
298a45dc2b | |
|
|
c143340135 | |
|
|
41d411133f | |
|
|
289fa349e8 | |
|
|
430a0e4862 | |
|
|
8b32ff18e9 | |
|
|
4fda6c4bff | |
|
|
966ed1db9a | |
|
|
f4d5c622f5 | |
|
|
70867f2766 | |
|
|
46fa649a02 | |
|
|
0c3ba8d24d | |
|
|
dd2dee0007 | |
|
|
d50cfdbcce | |
|
|
cc75d84069 | |
|
|
6a50199564 | |
|
|
c0a41e321c | |
|
|
0db5ec9ada | |
|
|
f27e45d7cb | |
|
|
59084c986d | |
|
|
848338632b | |
|
|
918dc35ac0 | |
|
|
3d16608661 | |
|
|
f55b4841a2 | |
|
|
c1379c8db6 | |
|
|
5f00bb2416 | |
|
|
bcb632260b | |
|
|
ddca215cb1 | |
|
|
0f2bb1ff55 | |
|
|
b731035706 | |
|
|
dce2d556eb | |
|
|
7f856facbd | |
|
|
fc29ec4780 | |
|
|
42116dda27 | |
|
|
71d45f1392 | |
|
|
aa8813a033 | |
|
|
3af4e65af1 | |
|
|
047dcf0384 | |
|
|
b938f4bbd6 | |
|
|
0b02c8ac41 | |
|
|
92b6a35691 | |
|
|
1df83585b6 | |
|
|
1583862ab4 | |
|
|
89daba118e | |
|
|
64b1d8402f | |
|
|
c3c1d85f5b | |
|
|
824f050bb7 | |
|
|
9fb09da89f | |
|
|
7867f52f8c | |
|
|
81ae02e6f1 | |
|
|
af38b76fe9 | |
|
|
3e3b86f1c9 | |
|
|
2d0051dc76 | |
|
|
f262f45201 | |
|
|
dace7493d7 | |
|
|
20b0237eb9 | |
|
|
b8889804ca | |
|
|
4a3ca5d441 | |
|
|
59bad64e3e | |
|
|
e9789988b3 | |
|
|
6c0697653b | |
|
|
331fd946fe | |
|
|
dd575890ce | |
|
|
97eb7790f7 | |
|
|
b5c76ddaa7 | |
|
|
140bbeaa7e | |
|
|
27e07ef9f0 | |
|
|
c6b367699c | |
|
|
a69fb68330 | |
|
|
2e1a07bd28 | |
|
|
988e6b6c4f | |
|
|
aba69a6200 | |
|
|
b727da83df | |
|
|
80855a975c | |
|
|
884e8ed795 | |
|
|
009fcc6653 | |
|
|
2e0b502572 | |
|
|
a3ce74f109 | |
|
|
4537e71aa5 | |
|
|
2ae7576843 | |
|
|
38bf38c1cf | |
|
|
02ff4743a2 | |
|
|
fcae3de09b | |
|
|
646e3de363 | |
|
|
7f0ac1a393 | |
|
|
487d03e16d | |
|
|
77bb36b11f | |
|
|
310fe4215d | |
|
|
011ff62467 | |
|
|
01578a66d3 | |
|
|
b7d4df18e5 | |
|
|
7b8ae74b31 | |
|
|
bb8606c1b8 | |
|
|
3b4e9c2ce3 | |
|
|
f3b6986527 | |
|
|
4e4bb19f90 | |
|
|
f9e0b6d687 | |
|
|
45bcbce14a | |
|
|
19e667d778 | |
|
|
c5a13c3a7d | |
|
|
251d6d1270 | |
|
|
69318b720c | |
|
|
ef09830977 | |
|
|
16aed6e8b6 | |
|
|
cda8ed1d40 | |
|
|
7c45bfd50c | |
|
|
e4d051aa2e | |
|
|
9b8e636c74 | |
|
|
1ad45040e6 | |
|
|
e08a4fdc85 | |
|
|
81758df839 | |
|
|
ee99420cbc | |
|
|
fa57a8cffe | |
|
|
d3554194fe | |
|
|
a7a7fefff9 | |
|
|
a39293a919 | |
|
|
b430555758 | |
|
|
bd66da843d | |
|
|
624f511511 | |
|
|
c8d25f86b8 | |
|
|
b615f3f4c0 | |
|
|
a40b32c3b7 | |
|
|
d4b0c50d7f | |
|
|
05fc17c2b5 | |
|
|
dcc76715eb | |
|
|
c0c4e03270 | |
|
|
1318053086 | |
|
|
d32cd3343c | |
|
|
e003460ccb | |
|
|
8bf700a259 | |
|
|
4e44b8d286 | |
|
|
c63dfd2b3f | |
|
|
6e62c9b97d | |
|
|
59e9559617 | |
|
|
d05914dcd8 | |
|
|
e0cba12163 | |
|
|
e0f08590fe | |
|
|
0722824b20 | |
|
|
9719c08108 | |
|
|
00ed4e93cd | |
|
|
3e30a80098 | |
|
|
5ce4e639fe | |
|
|
e17ae99cac | |
|
|
fcaafc34f7 | |
|
|
56dd2ae383 | |
|
|
77ef510da8 | |
|
|
f6ec63cf29 | |
|
|
aa5ffbe746 | |
|
|
ef8a701d3c | |
|
|
d0acd06789 | |
|
|
d0986fd6b9 | |
|
|
d03584bb13 | |
|
|
e7d707a86a | |
|
|
e8ca74cc30 | |
|
|
2f50973f55 | |
|
|
e6faf91995 | |
|
|
2d5ec133cc | |
|
|
f4575c770d | |
|
|
5173495b50 | |
|
|
a94c987191 | |
|
|
01cf42675e | |
|
|
602ad44e03 | |
|
|
a5b74d952a | |
|
|
19aa96244f | |
|
|
3149edd87e | |
|
|
5ca62952f4 | |
|
|
ad852219dc | |
|
|
4951a34b1b | |
|
|
e93c54ab02 | |
|
|
6bf11e7889 | |
|
|
73d3197e39 | |
|
|
66e7252b89 | |
|
|
89b875d4da | |
|
|
bfb122469d | |
|
|
936fe9e000 | |
|
|
6810011f88 | |
|
|
5945e3a515 | |
|
|
536f0cdd7d | |
|
|
60ad9f9e6b | |
|
|
a17e2fdd47 | |
|
|
4913cf2b51 | |
|
|
6ac7e92896 | |
|
|
07a8e2bde5 | |
|
|
73bfc25e71 | |
|
|
72c29cda7e | |
|
|
9fd26a3de1 | |
|
|
1581389da6 | |
|
|
1c9dd46fe9 | |
|
|
1d0cdda114 | |
|
|
16330dbda7 | |
|
|
d9d2c8ddba | |
|
|
6d9bbb75ab | |
|
|
a903a69ed2 | |
|
|
4ab7d800fa | |
|
|
6291f5dc87 | |
|
|
0330e542f2 | |
|
|
44f84afbe6 | |
|
|
c06f40426e | |
|
|
1fbdbeb7e8 | |
|
|
60126a452e | |
|
|
58e6ae3a54 | |
|
|
22ec48f473 | |
|
|
8195c1f956 | |
|
|
e026cbf13d | |
|
|
e703083411 | |
|
|
d1eade9b9c | |
|
|
bf8fbef25b | |
|
|
c832ab645f | |
|
|
646114b256 | |
|
|
b4c52e2e9f | |
|
|
e2a506192d | |
|
|
47db0473ee | |
|
|
0a916dfe99 | |
|
|
c363c627e4 | |
|
|
7efe326238 | |
|
|
921bcbfbdd | |
|
|
5baefbed2c | |
|
|
2b74a66158 | |
|
|
59fac54e32 | |
|
|
91ff62c10d | |
|
|
53c72b5883 | |
|
|
ff2ad6228c | |
|
|
544564d0d5 | |
|
|
3d524ba675 | |
|
|
e2c93e9de4 | |
|
|
6e33d27dc7 | |
|
|
db82cfa149 | |
|
|
3573303671 | |
|
|
9266cd6a4b | |
|
|
e3757e6981 | |
|
|
150d41e0c0 | |
|
|
5292c2c2de | |
|
|
79d03f0470 | |
|
|
00474ed74d | |
|
|
9a3cdd016b | |
|
|
e5a9fcb9ad | |
|
|
d34356edda | |
|
|
48ba3a6367 | |
|
|
2ab813ca41 | |
|
|
2e08d0515e | |
|
|
118229ad02 | |
|
|
623a09186a | |
|
|
9d52bf4195 | |
|
|
da8fe818e7 | |
|
|
5d66472cea | |
|
|
c5a8c7ff5b | |
|
|
6b352c9f15 | |
|
|
0cf430f49a | |
|
|
388fba6f57 | |
|
|
65161a9593 | |
|
|
5a78103167 | |
|
|
d255f53194 | |
|
|
31f73da963 | |
|
|
3ea587f6ca | |
|
|
7f50ef9229 | |
|
|
e6048862a4 | |
|
|
7f1aaade7d | |
|
|
64d47d43c6 | |
|
|
0cabb72298 | |
|
|
eaabc96f5c | |
|
|
d158280838 | |
|
|
5c130deb67 | |
|
|
01086b7320 | |
|
|
140416e0a8 | |
|
|
f6e63f5108 | |
|
|
06241a85e8 | |
|
|
5b675547ff | |
|
|
bad28f8276 | |
|
|
d1374b9d36 | |
|
|
37bba7bb9a | |
|
|
23d4bf5d55 | |
|
|
82c99e0ba0 | |
|
|
92bd3e2ad0 | |
|
|
e8dcdb68be | |
|
|
8a9d19f78f | |
|
|
f07f6c661e | |
|
|
6b58831a76 | |
|
|
64d7c06bc0 | |
|
|
a91c5b2290 | |
|
|
3cb84d8e96 | |
|
|
d12364545f | |
|
|
e7b2654a0f | |
|
|
353b7c3574 | |
|
|
1ed65f047e | |
|
|
f4e2bfa5df | |
|
|
a917cff2eb | |
|
|
babbfa324a | |
|
|
25a4b8936e | |
|
|
ee6ccde603 | |
|
|
8d6cec5eec | |
|
|
bd99b46f12 | |
|
|
5ac9b7bdde | |
|
|
b351dc9e2e | |
|
|
336fde225f | |
|
|
d6206cb8d9 | |
|
|
f73d7b4b2d | |
|
|
15f18f8390 | |
|
|
4d8843fbea | |
|
|
34954b29ee | |
|
|
60c54aa189 | |
|
|
f17844be9d | |
|
|
71f878f8ee | |
|
|
b0e273b973 | |
|
|
abbc60556c | |
|
|
3652d59077 | |
|
|
938fcc7dc9 | |
|
|
70fb8db7f6 | |
|
|
ac74892414 | |
|
|
02076d8fee | |
|
|
55ead858aa | |
|
|
d6f1d25288 | |
|
|
5d145a8233 | |
|
|
6169fe9aca | |
|
|
7bcad5baa1 | |
|
|
fdcda668e5 | |
|
|
d584d5c7a9 | |
|
|
8030bbee62 | |
|
|
0c712d6f98 | |
|
|
26f9863a30 | |
|
|
21af776b9c | |
|
|
baf27a905d | |
|
|
1f916f839e | |
|
|
3406642460 | |
|
|
3ec649cc35 | |
|
|
0d084df742 | |
|
|
e62e072ba0 |
|
|
@ -0,0 +1,60 @@
|
|||
# 260612 AI Infra 今日速递
|
||||
|
||||

|
||||
|
||||
|
||||
|
||||
```Markdown
|
||||
🥢「源来有饭」正式启动计划
|
||||
|
||||
我们计划在端午后做第一期 **开源 x AI Infra** 主题交流,邀请行业大佬时间暂定晚上 **19:00-21:00**。
|
||||
|
||||
想问问大家更喜欢哪种场地:
|
||||
|
||||
- 咖啡厅
|
||||
- 酒吧
|
||||
- 学校空间
|
||||
- 其他(大家可以随便提哦~)
|
||||
|
||||
欢迎回复你喜欢的场地,也可以顺手留下一个想聊的开源 x AI 问题。
|
||||
```
|
||||
|
||||
### 腾讯混元升级开源推理算子库 HPC-Ops
|
||||
|
||||

|
||||
|
||||
腾讯混元完成旗下高性能推理工具库 HPC-Ops 的全面升级并正式开源。本次更新不是零散的小优化,而是对大模型推理全流程进行了整套性能升级,专门解决线上业务常见的推理延迟高、长文本卡顿、显存开销大、多卡通信低效等工程难题。升级覆盖五大核心模块,分别对应注意力计算、路由矩阵计算、MoE混合专家模型、多卡通信归一化以及模型末端采样环节,全方位补齐推理性能短板。这套优化方案经过腾讯真实业务场景打磨,适配主流硬件设备以及 vLLM、SGLang 等热门推理框架,开源后开发者可直接落地使用,快速搭建低延迟、高吞吐、高稳定性的大模型线上服务。根据官方测试数据,长文本推理最高提速近3倍,主流MoE模型性能提升1.2–1.6倍,末端采样环节最高提速8.5倍,整体服务处理能力提升30%以上,兼顾推理精度与运行效率。
|
||||
|
||||
|
||||
|
||||
### MiniMax 开源稀疏注意力算子库 MSA
|
||||
|
||||

|
||||
|
||||
MiniMax 推出全新开源工具 MSA,这是一款专为新一代 NVIDIA 显卡深度优化的稀疏注意力加速算子库,开源协议宽松,可供开发者自由使用。工具核心聚焦大模型长文本推理场景,集成稀疏注意力加速、常规密集注意力、低精度显存压缩解码等实用能力,能够有效减少推理过程中的算力浪费,大幅降低显存占用。该工具被认为有助于补齐新一代GPU适配稀疏大模型推理的开源工具生态,为开发者优化长文本大模型推理效率、降低部署成本提供了新的选择。
|
||||
|
||||
|
||||
|
||||
### Apache Burr:开源 AI Agent 运行框架
|
||||
|
||||
Apache 旗下开源项目 Burr 近期在技术社区热度飙升,成为 AI 智能体开发领域的热门工具。这是一款轻量化 AI Agent 开发运行框架,全程基于纯 Python 编写,无需学习复杂专属语法,上手门槛极低。Burr 最核心的优势是状态管理能力,支持自动保存任务进度、任务暂停续跑、全流程监控调试,同时具备人工审核、多任务并行执行等企业级实用功能。据社区讨论和部分用户反馈,相比 LangChain 等传统主流框架,Burr 在稳定性、生产环境适配、调试体验和技术栈兼容性上受到不少开发者关注,可用于搭建聊天机器人、复杂多智能体系统等各类 AI 应用。
|
||||
|
||||
|
||||
|
||||
### HelixDB:面向 AI Memory 的开源图向量数据库
|
||||
|
||||
专为大模型与AI智能体打造的开源图向量数据库 HelixDB,近期在开发者社区走红。该数据库采用高性能 Rust 语言开发,最大特色是多功能一体化,集成向量、图结构、文档、键值等多种数据存储能力,无需搭配多款数据库组合使用。高度适配大模型知识库搭建、RAG 检索、AI 智能体长期记忆存储等核心场景,可用于解决 AI 应用的记忆留存、关联知识检索等问题,是面向 AI 项目落地的一类开源存储方案。
|
||||
|
||||
|
||||
|
||||
## 重要开源项目更新
|
||||
|
||||
NVIDIA 发布 NCCL EP v0.1.0,针对 MoE 模型的专家并行通信场景做了专项优化
|
||||
|
||||
|
||||
|
||||
Weaviate v1.38.0 发布,优化索引性能与内存占用,上线多租户隔离预览能力,新增嵌套对象过滤、Schema属性重建索引等实用功能
|
||||
|
||||
|
||||
|
||||
Milvus v2.6.18 发布,补齐可空向量字段、结构体数组元素级向量搜索等全新能力,优化高负载场景下的查询调度、服务恢复机制与Arrow IO读写性能
|
||||
|
|
@ -0,0 +1,102 @@
|
|||
# 260616 ai infra
|
||||
|
||||
## 一、「Open source AI must win」:一场戳中从业者痛点的社区大讨论
|
||||
|
||||

|
||||
|
||||
这几天Hacker News热度最高的帖子,标题直白得很——《Open source AI must win》。没有花哨的论证包装,一句话的观点却精准戳中了很多开发者的情绪,短短几天攒下上千热度,几百条评论吵得不亦乐乎。
|
||||
|
||||
|
||||
|
||||
发帖人的核心想法很简单:如果AI这项下一代生产力工具,完完全全掌握在少数几家闭源公司手里,整个行业都会陷入被动。今天可以随意调整定价,明天可以改动服务规则,甚至说停服就停服,所有依赖它的开发者和企业,都只能被动接受。只有开源的AI生态,才能真正把能力交到更多人手里,守住技术的自主性。
|
||||
|
||||
|
||||
|
||||
底下的评论里,大家的态度也各有不同:
|
||||
|
||||
最多人认同的是反垄断的判断——毕竟大家都吃过技术垄断的亏,AI作为未来的数字基础设施,要是被少数公司攥在手里,创新的门槛只会越来越高,最后全行业都要为垄断买单。
|
||||
|
||||
也有不少人保持理性,觉得“开源必胜”说起来解气,落地却没那么容易。现在前沿大模型的训练成本水涨船高,普通团队根本难以承担,开源模型和闭源模型的能力差距,到现在也还实实在在地摆在那;而且完全无约束的开源也会带来安全隐患,这个平衡点要怎么找,行业至今也没标准答案。
|
||||
|
||||
还有人点出了当下最尴尬的现状:几乎所有科技公司都在囤开源模型做技术储备,但真到了生产环境的核心场景,大家用得最多的还是闭源API。开源模型看起来无处不在,但真要让它独挑大梁,还差不少火候。
|
||||
|
||||
聊到最后也没人能给出确定的答案,我们也想问问你:
|
||||
|
||||
- 你觉得开源AI最终能追上甚至超过闭源模型吗?
|
||||
- 平时工作里,你会优先选开源模型还是闭源API?最看重什么?
|
||||
- 如果开源模型能力能达到闭源多少,你会考虑全面切换吗?
|
||||
|
||||
|
||||
|
||||
## 二、Loop Engineering走红:AI编程的下一个主流方向?
|
||||
|
||||

|
||||
|
||||
聊完大的路线之争,这周开发者圈还火了一个新概念——Loop Engineering(循环工程),不少大厂技术负责人都在转发讨论,认为这会是接下来AI编程的核心方向。
|
||||
|
||||
|
||||
|
||||
这个概念最早由Anthropic Claude Code负责人Boris Cherny带火,后来Google工程师Addy Osmani正式将其总结为Loop Engineering。
|
||||
|
||||
提出者的核心观点是:人和AI的协作模式正在一步步升级。最开始大家做Prompt Engineering,靠写好提示词让AI一次输出结果;后来有了Agent模式,给AI配好工具、定好目标,让它自主执行几步,但还是离不开人工监控。
|
||||
|
||||
而Loop Engineering就是再往前推进一步:开发者不用再逐轮跟AI对话、调整提示词,只需要设计一套自动运行的闭环系统,定好最终目标、执行规则和验证标准,系统就会自动反复调用AI、验证输出结果、调整下一步指令,直到任务完成。人要做的,是维护好这套循环规则,不用再陷进重复的单轮沟通里。
|
||||
|
||||
|
||||
|
||||
简单说,就是从“人指挥AI单步干活”,变成“人设计系统,系统驱动AI自动闭环干活”。在提出者看来,这种模式能把人从大量重复的调prompt、改输出的工作里解放出来,尤其适合批量代码修复、标准化项目开发这类高频重复场景,能把AI的提效潜力再放大一截。
|
||||
|
||||
|
||||
|
||||
当然也有不少人觉得,这个说法多少有点新瓶装旧酒,概念大于实际价值。
|
||||
|
||||
|
||||
|
||||
## 三、MiniMax开源M3,Kimi上线Code高速版
|
||||
|
||||
<grid>
|
||||
<column width-ratio="0.528409">
|
||||

|
||||
</column>
|
||||
<column width-ratio="0.471591">
|
||||

|
||||
</column>
|
||||
</grid>
|
||||
|
||||
6月15日,MiniMax正式开源旗下旗舰多模态模型M3,同步发布MSA稀疏注意力技术论文,这套架构专门针对长上下文场景优化,能大幅降低长文本推理的计算成本。推理框架vLLM也同步完成了对M3的Day-0适配,开发者拿到权重即可直接部署多模态、长上下文推理能力。
|
||||
|
||||
同一天,月之暗面上线Kimi K2.7 Code高速版本。该版本与普通版基于同一模型,通过工程优化将输出速度提升至普通版的5-6倍,常规编程场景下可达180 Token/s,短上下文场景更是能到260 Token/s;定价为普通版的2倍,相当于用两倍成本换取五六倍的生成效率。这款主打高速编程的模型也在Hacker News上收获了不少关注,不少开发者认为,思考模式搭配高速输出的组合,已经能覆盖大部分日常编程需求,性价比十分突出。
|
||||
|
||||
|
||||
|
||||
## 四、微信支付AI接入工具箱升级2.0
|
||||
|
||||

|
||||
|
||||
今年4月推出的1.0版本,主打的是“一行指令接入”:把支付相关开发能力打包成Skill技能包,搭配AI友好的文档与API,开发者在IDE里输一行命令就能加载,不用再翻阅厚重的开发文档。
|
||||
|
||||
|
||||
|
||||
升级到2.0之后,实用性进一步提升:功能覆盖从仅支持支付、券类,扩展至微信支付全产品体系;新增两大AI专家能力,既能支持全链路排障,还能从金融级安全标准出发做代码质量审查。
|
||||
|
||||
最大的优化是,文档内所有时序图、状态图都改为了Mermaid格式,AI无需调用图像识别即可直接理解语义,整体Token消耗相比原始HTML文档降低50%,能省下不少调用成本。同时工具还支持9种语言,覆盖全球主流开发者群体,并新增了知识库自动同步功能,官网内容更新后本地会自动同步,无需手动维护。
|
||||
|
||||
|
||||
|
||||
## 五、Chainguard发起Athena开源安全联盟,Docker等二十余家企业加入
|
||||
|
||||

|
||||
|
||||
6月15日,开源安全公司Chainguard联合多家行业企业,正式发起Athena开源安全联盟,这也是行业内首个专门针对AI时代开源软件漏洞防护的跨行业组织。
|
||||
|
||||
|
||||
|
||||
目前联盟的创始成员已达二十余家,覆盖云服务、容器技术、金融等多个领域,思科、Cloudflare、Docker、摩根大通、普华永道等企业均在其中。
|
||||
|
||||
|
||||
|
||||
发起这个联盟的核心背景,是AI技术彻底打乱了漏洞攻防的节奏。过去攻击者挖掘、利用漏洞需要很长周期,现在借助AI,数小时内就能完成从发现漏洞到发起攻击的全流程,远快于人工修复的速度,漏洞从披露到被滥用的窗口期正在急剧缩短,单靠某一家公司的能力,根本跟不上攻防的节奏。
|
||||
|
||||
|
||||
|
||||
而Athena联盟要做的,就是整合各家的漏洞发现能力,借助AI批量生成修复补丁,赶在漏洞被公开滥用之前输出解决方案,统一协调开源项目的安全披露与补丁落地工作。根据公开信息,目前联盟已处理超过2万条漏洞发现,为500多个开源项目生成了2000多个修复补丁 ,第一批漏洞的公开披露将于下个月启动。
|
||||
|
|
@ -0,0 +1,79 @@
|
|||
# 260618
|
||||
|
||||
端午安康!祝大家假期松弛有度,学习、工作皆顺遂~
|
||||
|
||||

|
||||
|
||||
刷 X 时被一款 AI 辅助打造的水面交互网页戳中审美,鼠标在画面上移动,水面就会荡开一圈圈波纹,水里飘着的小花也跟着轻轻晃动,波光看着特别真实。大家可以点击这个去体验一下:[https://pastel-lab.pages.dev/flower-water-ripples/](https://link.wtturl.cn/?target=https%3A%2F%2Fpastel-lab.pages.dev%2Fflower-water-ripples%2F&scene=im&aid=497858&lang=zh)(来源:X:@konmari_tweet)
|
||||
|
||||
## 一、NVIDIA:Agent框架&具身智能双更新
|
||||
|
||||
NVIDIA近期持续加码AI Agent与机器人具身智能赛道,接连放出两款核心能力,补齐企业私有化部署与自动化实验基建。
|
||||
|
||||
**1、NemoClaw 开放框架 + Agent Toolkit 正式亮相**
|
||||
|
||||
在HPE Discover 2026大会上,NVIDIA正式公开NemoClaw开放框架与配套Agent Toolkit工具集。整套方案内置Nemotron开源模型、安全运行 runtime 与标准化Agent开发蓝图,深度适配企业私有云场景。主打**企业级Agent治理、多智能体协作、行为管控**,搭配NVIDIA机密计算能力,实现从模型运行、工具调用到数据安全的全栈防护,帮助企业快速落地可管控、可生产的私有化AI Agent系统。
|
||||
|
||||
**2、GEAR 发布 ENPIRE 机器人实验平台**
|
||||
|
||||
NVIDIA GEAR联合CMU、UC Berkeley推出ENPIRE平台,核心突破是让AI编程Agent**自主操控真实机器人完成全流程实验**。无需人工干预,AI可自动搭建实验环境、重置场景、执行测试、收集数据、分析报错、迭代优化代码,大幅降低具身智能与机器人算法的研发试错成本,项目后续将开源全部代码。
|
||||
|
||||
## 二、开源大模型集中上新
|
||||
|
||||
**1、智谱 GLM-5.2 正式开源(MIT 商用许可)**
|
||||
|
||||

|
||||
|
||||
智谱重磅开源GLM-5.2,核心亮点是**1M真实可用超长上下文**、极致强化代码能力与长程Agent任务表现。实测可稳定处理88万+token不丢信息,能独立完成完整软件项目开发、联调、测试、上线全流程。在权威代码评测榜单中稳居开源模型第一梯队,代码能力逼近顶级闭源模型,且支持全场景商用,适配各类国产算力,是目前长程Agent、代码私有化部署的最优基座之一。
|
||||
|
||||
**2、通义千问 Qwen-Robot Suite 具身智能模型发布**
|
||||
|
||||

|
||||
|
||||
阿里通义千问推出Qwen-Robot Suite,包含三款专业级具身智能基础模型,针对性适配机器人感知、决策、运动控制核心场景。为机器人、工业数字孪生、智能设备等具身AI应用提供现成底座,大幅降低行业具身智能的从零开发门槛。
|
||||
|
||||
## 三、算力&推理基建升级
|
||||
|
||||
**1、MiniMax 开源 MSA 稀疏注意力推理内核**
|
||||
|
||||
MiniMax开源面向NVIDIA SM100 GPU的MSA稀疏注意力推理内核,MIT许可可免费商用,支持BF16、FP8、NVFP4等多精度推理。和传统全量注意力机制不同,MSA采用**分支筛选+精准计算**逻辑:先用索引分支筛选关键Token块,再用主分支做精准Attention计算,跳过无效冗余计算,专门解决长上下文推理算力浪费、速度慢、成本高的痛点,长文本场景推理效率远超传统方案。
|
||||
|
||||
**💬 读者互动讨论**
|
||||
|
||||
长文本推理越来越卷,你觉得稀疏注意力会成为未来大模型推理的标配优化方案吗?
|
||||
|
||||
**2、Google 上线 TPU Developer Hub**
|
||||
|
||||
Google推出一站式TPU开发者中心,整合TPU预训练、微调、推理加速、XLA调试、PyTorch迁移、KV Cache卸载、内核优化等全流程教程与开源代码模板。彻底解决开发者TPU资料零散、适配困难、优化无思路的问题,大幅降低TPU算力的上手与落地门槛,完善Google AI算力生态。
|
||||
|
||||
## 四、社区热点:轻量化长上下文模型 + 小模型Agent提质方案
|
||||
|
||||
本周Hacker News社区两大热门话题,全部围绕「低成本、高效率AI Agent落地」展开,非常贴合中小团队实用开发场景。
|
||||
|
||||
**1、社区讨论:SubQ 1.1 Small 轻量化长上下文模型**
|
||||
|
||||
行业社区持续热议SubQ 1.1 Small模型,主打**小参数、低成本、长上下文能力**。区别于GLM-5.2这种超大基座模型,它主打轻量化部署,无需高算力硬件,就能实现不错的长文本理解与信息召回效果,非常适合端侧AI、轻量个人Agent、低成本长文档检索场景,给中小开发者提供了高性价比的长文本AI落地选择。
|
||||
|
||||
**2、HN爆款:Forge护栏让8B小模型逆袭Agent任务**
|
||||
|
||||
Show HN热门项目Forge引发大量讨论:通过工程化Guardrails安全护栏与任务约束机制,直接将普通8B开源小模型的Agent任务成功率,从**53%暴涨至99%**。核心逻辑不靠堆模型参数、不靠调用昂贵闭源API,而是靠标准化流程约束、任务校验、行为管控,补齐小模型逻辑弱、稳定性差的短板。这也让社区掀起新讨论:**工程优化或许比盲目堆模型更大程度决定Agent落地效果**。
|
||||
|
||||
**💬 读者互动讨论**
|
||||
|
||||
轻量化长文本小模型 + 工程护栏优化,会不会成为未来平民化AI Agent落地的主流方案?
|
||||
|
||||
## 五、开发者工具更新:Agent代码托管 + 数据抓取基建升级
|
||||
|
||||
**1、Cursor 发布 Origin:AI Agent 原生代码托管平台**
|
||||
|
||||
Cursor正式推出Origin平台,是业内首款**专为AI Agent协作设计的代码托管平台**,原生兼容Git协议。和传统GitHub有本质区别:GitHub是为人与人协作设计的,适配人工开发流程;而Origin深度适配AI Agent高频自动提交、批量合并冲突、AI自动代码审查、智能迭代工作流,完美适配当下「人+AI Agent协同开发」的全新模式,是AI编程时代的专属基建。
|
||||
|
||||
**2、Firecrawl 取消 API Key 门槛,零成本即用**
|
||||
|
||||
主流AI网页抓取工具Firecrawl重磅减负,网页搜索、全站内容抓取、PDF转Markdown等核心功能,**无需注册、无需申请API Key、零门槛直接使用**,同时支持MCP、CLI、API三种接入方式。对开发者而言,彻底省去账号注册、密钥配置、权限审核等繁琐步骤,快速搭建检索Agent、采集公开数据、验证产品原型的效率大幅提升。
|
||||
|
||||
**3、硬核实战:EC2+Firecracker实现1秒极速浏览器冷启动**
|
||||
|
||||

|
||||
|
||||
Browser-use团队公开顶级AI浏览器Agent基建实战方案:在普通EC2虚拟机中嵌套运行Firecracker微虚拟机,为每一个浏览器会话独立分配隔离微VM。最终实现**浏览器冷启动时长<1秒**,同时将单小时运行成本压缩至0.02美元。文章公开了嵌套虚拟化性能优化、大内存页调优、高并发会话调度、浏览器隐身防检测等核心技术细节,是搭建网页自动化、浏览器Agent、批量数据抓取场景的顶级参考案例。
|
||||
|
|
@ -0,0 +1,93 @@
|
|||
# 260622
|
||||
|
||||
## Google OpenRL:Kubernetes 原生强化学习微调框架开源
|
||||
|
||||
谷歌云实验室开源适配容器集群的大模型调优工具OpenRL,把模型训练拆分为样本采集、参数更新、数据存储等独立模块,可并行启动多组训练任务,缓解硬件空等造成的算力浪费。
|
||||
|
||||
市面上同类调优工具大多需要额外适配容器集群,OpenRL原生基于集群调度逻辑设计,硬件利用率更有优势,完整项目代码已对外公开。
|
||||
|
||||
|
||||
|
||||
## llm-d 成为 CNCF 沙箱孵化项目,容器原生大模型推理工具开源落地
|
||||
|
||||

|
||||
|
||||
llm-d由IBM、红帽、谷歌云联合捐赠进入开源基金会孵化,专为容器集群设计大模型在线推理能力,文本生成的两个阶段可分开扩容,缓存资源分层调度,搭配智能路由分配请求。
|
||||
|
||||
实测生成首段文字延迟降低三分之二,整体处理效率直接翻倍,适配英伟达、AMD、英特尔各类加速硬件,多家云厂商、AI企业共同参与项目共建。多数推理工具先开发核心能力再兼容容器环境,资源弹性调度能力弱于llm-d原生设计。
|
||||
|
||||
|
||||
|
||||
## Linux 7.2 正式移除 strncpy 函数:历时 6 年、362 份代码修改
|
||||
|
||||

|
||||
|
||||
Linux内核彻底移除沿用多年的字符串拷贝函数strncpy,整体优化周期长达六年,累计完成362处代码调整。长期以来业内普遍诟病该函数存在设计缺陷,复制文本后不会自动补全结束标识,极易引发内存溢出、信息泄露等系统安全隐患,大量内核安全漏洞都源于该函数不当使用。
|
||||
|
||||
官方推出四类全新替代函数,全部内置边界校验逻辑,从设计上规避错误操作。本次调整仅针对系统内核内部代码,日常软件开发不受影响。
|
||||
|
||||
|
||||
|
||||
## Project Valhalla 进入 JDK 28 预览版:近十年Java语言规模最大升级
|
||||
|
||||
Java底层优化项目Valhalla的核心轻量化数据类型功能,纳入JDK28预览版本,本次更新修改近19.7万行代码、调整1816个文件,是近十年语言层面改动幅度最大的一次更新。
|
||||
|
||||
Java过往所有数据内容都需要单独开辟内存空间存储,简单数字封装后会附带冗余信息,高并发数据计算场景下会频繁触发内存回收,拖累整体运行速度。轻量化数据类型可直接存放于临时内存,省去多余封装开销,减少内存占用、降低回收频次,对大数据、高并发服务提升明显。该功能需手动开启预览参数使用,后续版本仍可能调整接口设计。
|
||||
|
||||
|
||||
|
||||
|
||||
|
||||
|
||||
|
||||
## ClickHouse 开源 10 周年
|
||||
|
||||
ClickHouse迎来开源十周年,项目从Yandex内部数据分析工具,成长为全球广泛使用的列式数据库,十年关键发展节点:
|
||||
|
||||
- 2016年正式开源,凭借超快的数据查询速度在大数据领域快速普及
|
||||
- 2021年成立独立商业公司,搭建商业化服务体系
|
||||
- 2023年上线云端托管服务,全球参与开发的技术人员突破千人
|
||||
|
||||
目前金融、互联网、物流等行业数据分析场景,大多会选用ClickHouse作为核心数据存储工具,也是海外极具代表性的开源数据库项目。
|
||||
|
||||
|
||||
|
||||
> 大家最早是哪一年入坑 ClickHouse?你平时用 CK 主要做什么场景?
|
||||
|
||||
|
||||
|
||||
## 首个统一科研大模型 LOGOS 正式开源
|
||||
|
||||

|
||||
|
||||
阿里通义实验室联合人大高瓴人工智能学院,开源面向科研场景的通用大模型LOGOS,自研统一文本转换规则,把蛋白质、化学分子、新材料等不同研究对象转化为统一文本标识,打通不同学科之间的知识复用。
|
||||
|
||||
仅10亿参数的LOGOS-1B,在分子生成、蛋白结构预测、新材料设计等科研任务中,效果对标各领域专用模型。完整模型权重、运行代码与技术文档全部公开,可直接复用通用大模型轻量化、加速工具,降低落地成本。
|
||||
|
||||
|
||||
|
||||
## Data2Story:7套AI分工,表格数据自动生成可溯源交互式新闻
|
||||
|
||||
牛津大学与斯坦福大学研发Data2Story工具,依靠七套分工不同的AI模块搭建全自动数据新闻生产链路,上传表格文件就能产出附带原始依据的交互式报道。
|
||||
|
||||
七套AI分别负责资料检索、数据计算、内容撰写、图表制作、页面生成、逻辑校对、证据标注,每一段文字、每一张图表均可溯源对应计算代码与参考资料,完整核验信息真实性。读者实测反馈中,内容可信度评分远高于纯人工稿件。该工具定位新闻行业辅助工具,负责标准化数据产出,从业者可专注深度观点与创意内容创作。
|
||||
|
||||
|
||||
|
||||
## 反对Meta采集员工工作数据训练AI的线上请愿
|
||||
|
||||
行业技术从业者发起线上请愿,反对Meta在未获得员工明确许可的前提下,收集内部聊天记录、工作文档用于模型训练。业内主流观点认为,企业不能无限制取用员工工作产出训练AI,行业需要明确工作数据的使用边界;也有不同声音表示,入职协议已约定工作成果归属,企业合规采集数据训练具备法律依据,行业针对AI训练数据所有权的争议仍在持续。
|
||||
|
||||
|
||||
|
||||
## NVIDIA ACE游戏AI工具开放测试,本地小模型无缝适配虚幻引擎5
|
||||
|
||||

|
||||
|
||||
英伟达ACE游戏智能NPC开发工具开启Beta测试,轻量开发框架内置文字决策模型与语音生成模型,8G显存显卡即可本地运行,原生适配虚幻引擎5。绝地求生开发团队KRAFTON已接入工具制作可对话智能NPC,配套相关插件同步开源。
|
||||
|
||||
|
||||
|
||||
## 小米发布并开源全屋智能AI方案 Xiaomi Miloco 2.0
|
||||
|
||||
小米开源第二代全屋智能AI方案Miloco 2.0,基于自研MiMo大模型接入OpenClaw智能体生态,支持家人身份识别、生活习惯记忆,可离线全天候本地运行,实现主动式家居自动调度,也是OpenClaw生态新增的终端AI落地方案。
|
||||
|
|
@ -0,0 +1,53 @@
|
|||
# 260624
|
||||
|
||||
在贴吧刷到的一个好玩的帖子,分享给大家。
|
||||
|
||||

|
||||
|
||||
**01/ Claude Tag上线,支持Slack团队异步AI协作**
|
||||
|
||||

|
||||
|
||||
作为企业常用的团队协同办公平台,Slack承载着企业内部消息同步、分组频道办公、团队任务联动等日常协作工作。Anthropic此次推出的Claude Tag,能够直接将Claude智能体部署为常驻Slack频道的AI协作助手。该功能支持全天候后台在线运行,团队成员只需在对应频道内@该智能体即可下发工作指令,无需反复新建对话窗口。面对复杂工作任务,智能体可以自主拆分执行步骤,按需调用办公工具,并且支持异步处理任务,即便团队成员离线,也能持续完成既定工作流程,弥补了传统AI助手仅支持一对一即时对话、无法融入常态化团队办公流程的不足。
|
||||
|
||||
**02/ Anthropic发布Claude Agent SDK开发工具**
|
||||
|
||||
官方推出Claude Agent SDK,适配Python和TypeScript两种主流开发语言,原生兼容MCP模型上下文协议。工具内置子智能体调度、工具调用、上下文管理基础能力,降低开发者搭建生产级多智能体系统的开发难度。
|
||||
|
||||
**03/ IBM公开CUGA智能体框架实战案例**
|
||||
|
||||

|
||||
|
||||
IBM同步放出24组可直接复用的落地案例,覆盖智能体落地落地三大核心工作场景,每组案例都搭配完整实测运行效果。依托案例能力,智能体可自主拆解复杂开发与办公任务,减少人工分步提示的操作成本;也能独立调用浏览器、文档工具、接口调试工具完成全链路操作,减少人工中途干预;同时还能自动核验任务执行结果,自主修正运行错误。这套案例可以帮助开发者快速搭建标准化智能体工作流,该框架在AppWorld、WebArena两大权威智能体基准测评中均取得第一,兼容LangChain、MCP、OpenAPI主流开发生态,整体代码基于Apache 2.0协议开源,无商用使用限制。
|
||||
|
||||
**04/ Prime Intellect发布万亿参数大模型强化学习框架**
|
||||
|
||||
Prime Intellect正式开源prime-rl v0.6.0,该框架专门面向万亿参数MoE混合专家大模型做强化学习训练优化。实测仅需28台H200节点,感觉你改的这GLM-5大模型,同时搭载多项推理底层优化方案,支持大规模GPU集群并行训练。
|
||||
|
||||
**05/ vLLM接入NVIDIA DFlash技术,大幅提升推理速度**
|
||||
|
||||
主流推理框架vLLM完成NVIDIA DFlash推测解码技术适配,实测在指定硬件与模型环境下,推理吞吐率相比传统自回归解码提升4.4倍至5.8倍。目前该项技术已经兼容多款主流开源推理框架。
|
||||
|
||||
**06/ AMD更新librocdxg库,优化WSL环境GPU算力使用体验**
|
||||
|
||||

|
||||
|
||||
librocdxg是ROCm算力生态中关键的底层调度库,主要承担系统、WSL虚拟机与AMD独显之间的数据交互与硬件调度工作,负责管控GPU算力分配、显存调度以及硬件指令转发。本次1.22.1版本重点适配Windows 11下的WSL运行环境,同步推出专属Ubuntu安装包,并且内置amdsmi硬件管理程序。此次更新一方面简化了ROCm算力栈的安装部署流程,优化过往版本在WSL环境下安装繁琐、适配报错频繁的问题;另一方面补齐Windows平台下AMD显卡的运维监控能力,开发者可以直观查看显卡算力占用、显存使用率、硬件温度等运行数据,有效缩小了AMD与NVIDIA在Windows端GPU通用计算生态的使用体验差距。
|
||||
|
||||
**07/ Zyphra开源ZAYA1-8B大模型,全程基于AMD算力训练**
|
||||
|
||||
Zyphra基于Apache 2.0协议开源ZAYA1-8B大模型,该模型全程使用AMD Instinct算力芯片从零训练而成。该项目证明,脱离NVIDIA算力生态,同样可以训练出性能达标的开源大模型。
|
||||
|
||||
**08/ 百度开源Unlimited-OCR文档解析大模型**
|
||||
|
||||
百度开源3B参数文档解析模型Unlimited-OCR,模型支持32K上下文长度,单次可以完成40页以上PDF文档解析,官方基准测试表现优异。模型支持多种本地部署方式,相关开源动态登上Hacker News热门榜单。
|
||||
|
||||
**09/ RAGFlow开源项目GitHub星标突破7万**
|
||||
|
||||
开源检索增强生成框架RAGFlow GitHub star数量突破7万,工具支持多格式文件解析、混合检索以及智能体工作流联动,目前已经广泛应用于企业知识库搭建、AI合规审查等生产场景。
|
||||
|
||||
**10/ OpenAI发起开源项目安全漏洞修复计划**
|
||||
|
||||

|
||||
|
||||
OpenAI携手Trail of Bits、HackerOne两家业内知名网络安全厂商,联合发起Patch the Planet开源软件漏洞修复专项计划。项目旨在补齐开源软件供应链普遍存在的安全短板,依托GPT-5.5-Cyber安全专用大模型,自动化完成漏洞扫描、风险等级判定、修复补丁生成全流程工作。项目覆盖cURL、Python、Go、freenginx等三十余款行业底层核心开源软件,所有由AI生成的漏洞报告与修复补丁,都会经过专业安全工程师人工复核,确认无误后再提交给对应项目维护团队。在首期五天的专项迭代中,项目已经完成数十个安全补丁合并工作,同时挖掘出多组高危漏洞,能够有效规避开源软件供应链带来的网络安全风险。
|
||||
|
|
@ -0,0 +1,93 @@
|
|||
<title>260626</title>
|
||||
|
||||
|
||||
|
||||
# 01|OpenAI自研推理芯片Jalapeño曝光,台积电3nm工艺打造完整自研硬件路线
|
||||
|
||||

|
||||
|
||||
近期海外行业媒体与科技爆料人放出行业一手消息,OpenAI首款自研推理芯片Jalapeño已完成全部设计工作。这款芯片由OpenAI联合博通Broadcom联合开发,初代产品确定交由台积电3nm制程流片,也意味着OpenAI正式落地专属ASIC自研路线,改变长期依赖第三方通用GPU承载云端推理的模式。
|
||||
|
||||
|
||||
|
||||
通用GPU为兼顾图像渲染、训练、推理多类场景,内部存在大量冗余计算单元,运行大模型推理任务时算力利用率很难拉满。OpenAI这次多年立项打磨的芯片,完全围绕自身GPT系列大模型做底层适配,重点优化长上下文、批量并发、低延迟交互三大推理核心场景,剔除无关硬件模块,把晶体管资源全部倾斜给Transformer运算单元。
|
||||
|
||||
|
||||
|
||||
除初代Jalapeño外,第二代Jalapeño2已进入预研阶段,规划采用台积电A16工艺搭配CoWoS先进封装。先进封装技术能够实现多颗芯片高密度堆叠互联,大幅提升芯片间数据传输带宽,支撑万卡级大规模推理集群协同运行。
|
||||
|
||||
|
||||
|
||||
目前官方暂未公布流片、样片测试、服务器量产搭载的准确时间,但业内普遍预判短期内会推出测试样片。长期来看,自研芯片能帮助OpenAI降低巨额推理硬件采购成本,同时摆脱外部供应链限制,掌握AI底层硬件自主可控能力,后续会逐步替换自有云集群中的外购通用显卡。
|
||||
|
||||
|
||||
|
||||
# 02|Linux基金会联合NVIDIA推出Akrites项目,构建面向AI新型攻击的开源软件安全屏障
|
||||
|
||||

|
||||
|
||||
Linux基金会联合NVIDIA及多家行业企业推出开源安全专项Akrites,项目诞生的核心背景,是当前AI工具被黑客批量用于自动化漏洞挖掘、攻击代码生成,全球底层开源软件供应链迎来全新安全风险。
|
||||
|
||||
|
||||
|
||||
很多企业业务、AI框架、操作系统都搭建在开源代码之上,过往传统漏洞披露流程分散在各个社区,响应速度参差不齐,面对AI批量渗透攻击很难快速统一处置。Akrites针对性搭建两套标准化机制,第一是共建行业共享SIRT安全应急响应团队,打通企业、开源社区之间的安全情报通道;第二是建立保密、统一的漏洞上报与修复流程。
|
||||
|
||||
|
||||
|
||||
一旦底层开源组件出现可被AI利用的高危漏洞,安全团队会第一时间同步给上游代码维护者,在漏洞被大规模攻击利用前完成补丁更新。覆盖范围包含开源操作系统、数据库、AI训练推理框架等全类型基础软件,给全球依赖开源生态的团队提供统一、标准化的AI网络威胁防护方案。
|
||||
|
||||
|
||||
|
||||
# 03|NVIDIA发布全液冷AI工厂完整落地方案,45℃闭路循环实现机房零耗水高密度算力部署
|
||||
|
||||

|
||||
|
||||
NVIDIA官方博客推出Rubin AI服务器配套全液冷AI工厂全套落地方案,是面向超大规模万卡AI集群成熟可复制的绿色散热实践方案,完全重构传统风冷、水冷机房建设逻辑。
|
||||
|
||||
|
||||
|
||||
常规AI机房会依靠大量轴流风扇完成空气对流散热,还要设计复杂冷热通道隔离布局,不仅噪音巨大,机架算力堆叠密度也存在明显上限。这套液冷方案直接取消全部机房散热风扇,采用45℃中温冷却剂闭路循环架构,冷却介质通过管路直接贴合处理器冷板换热,不需要空气作为热量传导介质。
|
||||
|
||||
|
||||
|
||||
水资源节约层面数据对比十分直观,传统水冷AI机房每兆瓦算力全年淡水消耗可达260万加仑,而NVIDIA闭路液冷系统介质全程内部循环,无任何淡水损耗,完全适配各地数据中心节水、减碳政策,长期运营能节约海量水资源。
|
||||
|
||||
|
||||
|
||||
机房运营层面优势同样突出,移除风扇后整体噪音大幅降低,同时不再受风道布局约束,单机架硬件部署密度显著提升,同等建筑面积可承载更多AI服务器,摊薄单卡算力场地建设成本。配套设施无需大功率辅助空调机组,机房整体PUE数值持续优化,综合能耗下降明显。整套方案已经形成标准化落地模板,云计算厂商、自建超算中心的企业都可以直接参考部署,兼顾高密度算力承载、低碳节能、低运维成本三类核心需求。
|
||||
|
||||
|
||||
|
||||
# 04|阿里开源Qwen-AgentWorld系列世界模型,35B与397B双规格构建通用智能体训练底座
|
||||
|
||||

|
||||
|
||||
阿里通义千问团队开源专门面向通用智能体训练的Qwen-AgentWorld语言世界模型,同步发布35B轻量版本与397B超大参数版本,完整代码开源至GitHub仓库QwenLM/Qwen-AgentWorld,配套技术论文上线arXiv预印本平台,同时自研专属评测基准AgentWorldBench,用来量化衡量世界模型与下游Agent综合能力。
|
||||
|
||||
|
||||
|
||||
具备AI基础的开发者清楚,传统智能体大多依靠对话、单步工具调用数据训练,很难理解现实世界因果逻辑、长时序复杂任务,做多步骤规划时极易出现逻辑断裂。Qwen-AgentWorld内置7大类完整可仿真真实Agent交互环境,覆盖工具调用、多步骤任务拆解、多角色协同、长期场景推演等主流智能体业务场景。
|
||||
|
||||
|
||||
|
||||
依托世界模型对现实规则、时序逻辑的深度建模能力,经过该系列模型预训练后的智能体,在多轮复杂指令执行、跨工具联动、长周期任务规划测试中,任务完成率相比传统训练方案有明显提升。项目全栈开放无商用限制,为国内开源Agent生态提供全新标准化训练路径,降低企业和独立开发者搭建高性能自主智能体的研发门槛。
|
||||
|
||||
|
||||
|
||||
# 05|FAST-LIVO2斩获IEEE TRO傅京孙纪念最佳论文奖,开源多传感器SLAM框架突破移动机器人感知痛点
|
||||
|
||||

|
||||
|
||||
开源机器人感知系统FAST-LIVO2拿下国际机器人顶刊IEEE TRO傅京孙纪念最佳论文奖,该奖项是全球移动机器人定位建图领域顶尖学术荣誉,代表SLAM方向年度顶尖研究成果,目前项目GitHub开源仓库星标已突破4.2k,被全球大量机器人研发团队落地使用。
|
||||
|
||||
|
||||
|
||||
FAST-LIVO2是一套激光、视觉、惯性三类传感器深度融合的里程计与实时建图完整系统,项目完整开放核心算法代码、海量多场景实测数据集、传感器硬件同步配套设备、多类机器人落地实操案例,打通从学术研究到工业产品落地的完整链路。
|
||||
|
||||
|
||||
|
||||
熟悉机器人感知技术的从业者都了解,单一激光或单视觉SLAM存在固有缺陷,在纹理稀少区域、设备高速运动、暗光环境下,很容易出现定位漂移、地图失真,直接影响机器人自主导航稳定性。FAST-LIVO2自研多传感器硬同步融合算法,精准对齐不同传感器采集数据的时间戳,同时轻量化算法架构保障终端设备实时运算效率。
|
||||
|
||||
|
||||
|
||||
这套框架适配机型覆盖小型机载无人机、轮式巡检机器人、人形服务机器人等多类硬件平台。本次能够斩获大奖,核心是同时实现算法理论创新与工程实用价值双重突破,既在多模态融合定位方向提出全新优化思路,又完整开源无使用壁垒,高校实验室、中小机器人企业无需高额研发投入就能直接复用,大幅降低自主导航机器人研发门槛,是当前开源机器人感知赛道标杆项目。
|
||||
|
|
@ -0,0 +1,85 @@
|
|||
<title>260629</title>
|
||||
|
||||

|
||||
|
||||
苹果上调 Mac、iPad 售价,对外将涨价归咎于 AI 热潮推高内存芯片成本。网上流传一段犀利吐槽,不少人误以为出自美光高管,实际只是财经博主创作的趣味段子。而美光科技首席商务官苏米特·萨达纳(Sumit Sadana)也在接受采访时暗示,苹果公司在当前的内存供应紧张局面中负有一定责任。
|
||||
|
||||
# 01 LangChain 推出Deep Agents提示词缓存方案
|
||||
|
||||

|
||||
|
||||
LangChain 上线了专门给长任务智能体用的提示词缓存功能,市面上各家大模型都能自动适配缓存规则。
|
||||
|
||||
他们拿真实智能体运行数据做过实测,整套方案最高能砍掉80%的token开销,最低也能减少49%。
|
||||
|
||||
平时业务里跑复杂多轮agent流程,调用成本会很高,这个缓存工具不用大改现有项目代码,接入就能直接降低花费。
|
||||
|
||||
|
||||
|
||||
# 02 DeepSeek 联合北大团队开源DSpark投机解码框架
|
||||
|
||||

|
||||
|
||||
2026 年 6 月 27 日,DeepSeek 联合北京大学发布论文《DSpark: Accelerating LLM Inference with Semi-Autoregressive Speculative Decoding》,创始人梁文锋为一作。
|
||||
|
||||
不同于单纯发布新模型,DSpark 是 DeepSeek 已经在自家 DeepSeek-V4-Flash、V4-Pro 线上生产引擎稳定跑了大半年的推理加速方案,替代了此前老旧的 MTP-1 单 token 预测方案;同步配套开源全套训练工具链 DeepSpec,是业内少有的草稿模型训练 + 推理部署全流程开源的推测解码方案。
|
||||
|
||||
上线实测数据极具冲击力:同等系统吞吐下,V4-Flash 单用户生成速度提升 60%-85%,V4-Pro 提速 57%-78%;在 120tok/s 的严苛服务标准下,整体 GPU 吞吐直接翻 6 倍以上,大幅降低 API 调用单位成本。
|
||||
|
||||
配套开源的 DeepSpec 仓库采用 MIT 协议,是一套完整的推测解码开发流水线,内置 DSpark、DFlash、Eagle3 三类主流算法实现,包含数据预处理、草稿模型训练、多维度评测全套脚本,原生兼容 Qwen3、Gemma 等主流开源大模型,开发者可快速为各类基座训练专属加速草稿模型,降低大模型线上服务、私有化部署的推理优化门槛。普通用户无需本地部署,调用 DeepSeek 网页、API 即可自动启用 DSpark 加速;企业开发者可依托 DeepSpec 完整复现、适配这套推理提速方案。
|
||||
|
||||
相比于市面上以往的AI加速方案,DSpark最大的亮点就是既跑得快,又不乱跑、还稳得住,一口气解决了传统加速技术的三个通病。过去主流的加速方案要么是逐字慢慢生成、速度提不上来,要么是一次性批量瞎生成一大堆文字、前后逻辑对不上、大部分内容被大模型驳回,而且不管服务器忙不忙都用一套固定规则,高峰期极其浪费算力。而DSpark做了全新优化:它采用**半自回归的混合生成方式**,平时批量快速出内容保证速度,同时会自动检查一段文字内部的前后逻辑,避免出现语句错乱、前言不搭后语的问题,草稿质量大幅提升;其次它搭载了**智能动态校验机制**,能实时感知服务器负载,空闲时就大胆多生成、多校验,把速度拉满,高峰期就智能精简无效内容,不浪费算力、不拖垮整体服务;最后它一改行业只开源推理代码的常态,**配套完整的训练工具链**,不止能直接用,还支持所有开发者自己训练、适配各类大模型,真正把大模型推理提速从“实验室炫技”变成了能稳定落地、人人可用的工程方案。
|
||||
|
||||
|
||||
|
||||
# 03 Hugging Face Jobs一条命令拉起vLLM推理服务
|
||||
|
||||
Hugging Face更新简易部署教程,仅需一行命令,就能在HF Jobs平台搭建兼容OpenAI接口的vLLM推理服务器。
|
||||
|
||||
不用手动配置复杂环境,适合短期测试开源模型、临时跑短期推理任务,大幅降低小团队、个人开发者的试错成本。
|
||||
|
||||
|
||||
|
||||
# 04 英伟达开源NeMo AutoModel,MoE模型微调提速3.7倍
|
||||
|
||||
英伟达推出开源工具NeMo AutoModel,基于新版Transformers开发,接入门槛极低,只需要一行import代码就能启用全部加速能力。
|
||||
|
||||
传统MoE微调工具缺少专门的专家通信组件,多卡分布式训练时,专家之间的数据传输损耗严重,拖慢整体训练速度。
|
||||
|
||||
这个工具原生集成DeepEP通信组件、专家并行策略以及TransformerEngine硬件加速,直接解决多专家路由、数据分发的性能瓶颈。同等硬件、数据集条件下,混合专家模型微调速度直接提升3.7倍,做大参数量MoE模型能省下大量训练时间。
|
||||
|
||||
|
||||
|
||||
# 05 Meta开源Astryx前端设计系统,适配AI智能体使用
|
||||
|
||||
Meta发布Beta版Astryx开源React设计系统,新增配套CLI命令行工具和MCP服务。
|
||||
|
||||
升级之后AI智能体可以直接读取项目内全部组件、设计规范Token、配套开发文档。
|
||||
|
||||
不管是让AI自主解析页面结构、自动产出组件代码,还是批量检查设计规范统一度都能实现,完整打通前端开发和AI智能体,搭建自动化前端工作流。
|
||||
|
||||
|
||||
|
||||
# 06 BrowserBC开源,录制浏览器操作生成可复用智能体能力
|
||||
|
||||

|
||||
|
||||
BrowserBC主打网页自动化场景,核心能力是把人类完整的浏览器操作会话全部记录下来,自动转换成能够反复调用的智能体技能。
|
||||
|
||||
它的实现逻辑和早年OpenAI Codex自带的浏览器操作功能高度相似,但属于独立开源工具,使用限制更少。
|
||||
|
||||
以往想要做网页自动化,需要手动编写大量点击、输入、翻页脚本,门槛高、改起来麻烦。现在只需手动操作一遍网页流程,工具自动封装成标准化动作,后续智能体可以一键复现整套操作。
|
||||
|
||||
像数据批量爬取、后台表单填写、多页面流程巡检这类重复工作,都能靠它快速搭建自动化智能体,补齐了轻量化浏览器自动化工具链的空白。
|
||||
|
||||
|
||||
|
||||
# 07 HN社区热议Tokenmaxxing,深度探讨智能体成本管控
|
||||
|
||||
Hacker News近期这条帖子热度居高不下,全行业开发者、企业运维人员都在讨论大规模落地Agent后的token开销难题。
|
||||
|
||||
不少从业者提出观点:单纯无节制堆砌token调用,并不能真正提升业务生产力。很多项目为了实现完整Agent循环,设置大量无意义重复调用,只会白白消耗算力、拉高月度接口成本,最终产出和支出完全不成正比。
|
||||
|
||||
也有运维侧人员补充,现在企业落地智能体,AgentOps运维体系已经是刚需。必须搭配提示词缓存、推理加速、调用频次限流等工具,从各个环节管控token消耗。
|
||||
|
||||
大家达成的共识很明确:后续开发智能体项目,不能只关注功能能否跑通,token消耗、循环次数、成本上限都会成为项目落地前必须规划的硬性指标,AI成本治理会变成行业常态化需求。
|
||||
|
|
@ -0,0 +1,63 @@
|
|||
# 260702
|
||||
|
||||
|
||||
|
||||

|
||||
|
||||
硅谷程序员圈近期爆火一款实体趣味装置,源自硅谷内部AI裁员梗,被网友戏称「硅谷执剑人」。在AI逐步替代传统开发岗位的行业背景下,有程序员自制出「我被裁了」实体按钮,搭载全套自动化脚本。
|
||||
|
||||
该按钮可实现硬核「一键四连」全自动操作:按下后自动公开公司完整代码库、将系统密码密钥推送至公网、清空测试环境全部数据库,同时自动向预设律师邮箱发送取证邮件,全程闭环自动执行。
|
||||
|
||||
## 一、美团LongCat-2.0正式开源,配套评测基准落地,实测验证长文本与Agent开发能力
|
||||
|
||||

|
||||
|
||||
美团正式推出并开源MoE架构大模型LongCat-2.0,整套模型采用1.6万亿总参数稀疏混合专家设计,平均激活参数稳定在48B,原生内置百万级上下文窗口,整套训练、推理流程全部依托国产五万卡算力集群完成落地,是国产大模型在超大规模稀疏架构、超长上下文赛道的一次完整落地实践。
|
||||
|
||||
架构层面LongCat-2.0融入多项自研创新方案:依靠LSA稀疏注意力降低长文本算力开销,搭配零计算专家、ScMoE稀疏优化、MOPD多专家融合机制,解决传统MoE模型负载不均、推理效率偏低的常见痛点。
|
||||
|
||||
为匹配长交互智能体场景的效果衡量需求,美团同步开源VitaBench 2.0评测基准。不同于通用大模型客观题测评集,这套基准全部基于真实生活化交互场景构建,专门用来量化模型在长期、动态连续对话里的个性化理解与主动响应能力,填补了长期用户建模智能体缺少标准化实测工具的空白。
|
||||
|
||||
博主「卡尔的AI沃茨」已发布实测内容,对LongCat-2.0进行全方位实操验证。实测结果显示,模型对国产算力适配度良好,百万上下文读取稳定,代码编写、复杂Agent任务表现突出;同时原生兼容OpenAI、Anthropic两套主流API标准,可无缝接入Claude Code、Codex等主流AI开发工作流,现有开发从业者迁移成本很低。
|
||||
|
||||
## 二、华为开源openPangu-2.0-Flash,主打512K超长上下文,全套技术组件逐步开放
|
||||
|
||||

|
||||
|
||||
华为上线openPangu-2.0-Flash开源版本,这款基础大模型总参数92B,激活参数量仅6B,轻量化激活设计搭配超长文本优化,原生支持512K上下文窗口,在长文档阅读、海量资料归纳场景具备天然优势。
|
||||
|
||||
按照官方规划,本次并非一次性放出全部资源,后续会分阶段逐步开放完整模型权重、开箱即用推理代码、定制训推算子等全套底层组件,从推理部署到模型训练全链路降低开发者使用门槛,给企业侧二次微调、私有化部署提供完整技术底座。
|
||||
|
||||
## 三、DSpark推测解码提速方案详解,对标JetSpec形成差异化路线,行业社区持续讨论
|
||||
|
||||
当下大模型推理延迟高、吞吐不足是落地核心瓶颈,DSpark推测解码方案给出一套轻量化优化思路:先用小型草稿模型快速生成候选Token,再由主模型批量统一校验,替代逐Token串行解码模式,以此大幅缩短用户等待时延。这套方案支持动态调节验证算力预算,能够按需削减无效计算,在批量推理场景下提速效果显著。
|
||||
|
||||

|
||||
|
||||
海外科研团队Sky Computing Lab在X平台发布技术解析,对DSpark与另一套主流并行解码方案JetSpec做出清晰、专业的技术区分:DSpark更偏向高并发线上业务,依靠校正头、输出置信度评估、算力动态预算三大机制,提升草稿Token有效通过比例;JetSpec则面向低延迟刚需场景,直接把因果约束嵌入并行草稿头,二者适配场景各有侧重,不存在绝对优劣。
|
||||
|
||||
该技术对比内容发布后,海外技术社区围绕两套框架展开延伸探讨,讨论集中在草稿Token接受长度、KV缓存复用策略、吞吐与延迟之间的取舍平衡,不少海外从业者结合自身线上业务场景,分享了针对性的框架选型落地思路。
|
||||
|
||||
## 四、Claude Code内置地域访问检测逻辑引发行业争议,开发者信任问题成讨论核心
|
||||
|
||||

|
||||
|
||||
有开发者逆向解析发现,Claude Code本地开发工具中内置多维度检测逻辑,能够识别用户所处时区、代理访问域名、账号转租行为,相关检测标记会编码随请求同步上传。
|
||||
|
||||
Anthropic对此作出官方解释,称相关检测机制初衷是遏制账号倒卖、未经授权模型蒸馏、跨区域非法访问等违规行为,同时表态部分仍处于实验阶段的检测规则,会在后续迭代中调整甚至移除。
|
||||
|
||||
这件事在开发圈引发不小分歧,大量从业者提出质疑:面向开发者的本地工具嵌入隐藏式地域风控,全程无透明告知,不仅影响国内开发者正常使用,也会损耗产品与开发者之间的信任,相关争议仍在持续发酵。
|
||||
|
||||
## 五、OpenClaw推出移动端客户端,打造远端常驻Agent运行新架构
|
||||
|
||||
OpenClaw全新上线移动端iOS与Android应用,跳出“手机本地运行大模型/智能体”的传统思路,设计出一套全新架构:移动端仅承担身份安全认证入口,完整AI Agent程序持续托管在云端常驻Runtime中运行。
|
||||
|
||||
整套架构配套多设备统一认证、独立专属Agent身份、永不离线持久运行时、分布式工具调用链等配套能力,兼顾多端使用便捷性与终端算力限制的问题。
|
||||
|
||||
## 六、Google一次性开源两款AI开发配套工具,覆盖智能体开发与云端建模流程
|
||||
|
||||
Google同步更新两款面向开发者的开源工具,分别覆盖Agent开发、云端机器学习建模两大场景:
|
||||
|
||||
其一为Genkit框架新增Agents API,统一封装对话历史存储、循环工具调用、流式输出三大高频能力,原生支持会话状态持久化、长时间复杂任务执行、多智能体协同调度,同步放出TypeScript、Go双语言预览版本,降低全栈智能体应用开发门槛;
|
||||
|
||||
其二是Google Cloud Workbench Notebooks VS Code扩展程序,现已完成开源。开发者无需切换软件,在本地VS Code内就能直连谷歌云端Jupyter建模环境,打通从代码编写、实验调试到模型训练的完整机器学习工作流,扩展可直接在GitHub、VS Code应用市场获取部署。
|
||||
|
|
@ -0,0 +1,33 @@
|
|||
# 260706
|
||||
|
||||
**今日工具分享**|Mac用户专属免费AI神器FluidVoice强势出圈,单日暴涨572个GitHub Star,总星数突破6200!作为开源免费工具,它对标高配付费竞品Wispr Flow,全程纯本地离线运行,所有语音、文字数据仅留存设备本地,全方位守护用户隐私安全。
|
||||
|
||||
工具集成超强实用能力,支持40+语言离线听写转录、语音操控设备、全局输入框智能改写,快捷键一键触发、低延迟响应。内置本地AI模型自动完成标点、格式优化,无需API密钥、零云端开销,一行命令即可安装:brew install --cask fluidvoice
|
||||
|
||||
### 一、面壁智能推出ForgeTrain自动预训练框架,实现跨硬件训练工程自动化
|
||||
|
||||
面壁智能推出的ForgeTrain自动预训练框架,聚焦大模型训练阶段的工程化难题,主打训练流程自动化与多硬件适配能力,并非全新大模型产品。针对传统大模型预训练流程繁琐、硬件适配成本高、底层代码调试工作量大的行业现状,这套框架能够基于既定模型结构和硬件环境,自动生成完整的预训练代码,省去大量人工底层开发与适配工作。在算力适配层面,框架原生兼容H100与昇腾NPU两大主流硬件体系,可根据不同芯片架构自适应完成训练逻辑调优,有效提升硬件算力利用率(MFU)。作为面向国产化算力生态的自动训练工具链,该框架填补了国内跨芯片自动化预训练工具的空白,为大模型在国产算力设备上的标准化落地提供了工程支撑。
|
||||
|
||||
### 二、Google发布A2UI v0.9,推出通用生成式UI与Agent交互标准
|
||||
|
||||
Google推出A2UI v0.9生成式UI规范,旨在解决AI Agent前端开发长期存在的生态碎片化问题。过往AI Agent界面开发、前后端交互高度依赖具体技术栈,不同框架、传输协议之间无法通用,跨平台开发需要重复适配,大幅拉高落地成本。此次发布的规范脱离具体开发框架,形成一套通用的Agent UI意图描述标准,横向适配React、Flutter等主流前端技术栈,纵向兼容各类Agent开发SDK与网络传输协议。通过统一Agent交互层的通信与展示逻辑,该规范为跨端、跨场景AI Agent应用开发提供了统一参照,降低了多端协同智能体产品的研发与适配门槛。
|
||||
|
||||
### 三、OpenTelemetry达成CNCF最高成熟度,坐稳云原生AI可观测核心标准
|
||||
|
||||
OpenTelemetry项目正式晋级CNCF最高成熟度级别,标志着其厂商中立的可观测技术标准得到行业全面认可。项目统一了云原生场景下指标、日志、链路追踪的采集与导出规则,成为目前通用性最强的可观测技术体系。随着多智能体集群、动态弹性推理服务成为AI部署主流形态,复杂分布式架构对全链路监控、故障溯源、资源调度的需求持续提升,OpenTelemetry的标准化能力,可为各类云原生AI业务提供稳定、统一的可观测底座能力。
|
||||
|
||||
### 四、全新日志驱动架构落地,重构AI Agent运行设计逻辑
|
||||
|
||||
Hacker News社区热议的《The Log is the Agent》,带来了一套全新的智能体运行时设计理念,革新了传统Agent的架构运行逻辑。该方案核心依托追加式事件日志与响应式图结构搭建底层运行体系,将完整的事件日志作为判定智能体运行状态的唯一可信依据。基于这套架构设计,智能体的全部执行流程可支持事后审计、流程重放以及分支调试迭代,能够精准梳理上层业务目标与单次模型调用之间的因果关联,解决了传统智能体运行流程不透明、故障溯源困难的实际问题。
|
||||
|
||||
### 五、pxpipe开源工具落地,以图像化上下文优化AI编程成本
|
||||
|
||||
开源工具pxpipe针对长文本场景下的AI编程开销问题,提供了全新的上下文优化思路。不同于传统文本压缩方案,该工具将超长文本上下文转化为PNG图像,依托视觉大模型的图文解析能力完成内容读取,以此规避海量文本Token消耗,显著降低AI编程Agent的调用成本。该工具落地,为智能体工程运维提供了新的优化维度,可在上下文完整性、模型输出精度与调用预算之间实现平衡调控。
|
||||
|
||||
### 六、NVIDIA推出HORIZON框架,将Agent引入芯片RTL设计流程
|
||||
|
||||
NVIDIA发布HORIZON智能体框架,将AI自动化能力延伸至芯片RTL硬件设计与EDA工程领域。框架借助git worktree完成硬件设计文件的版本管控,通过Markdown配置文件定义设计目标、评测标准与验收条件,驱动智能体自动循环完成设计编辑、仿真测试、结果验证的全流程迭代,实现硬件设计环节的无人化自动迭代,推动AI工具在硬件研发基建中的常态化应用。
|
||||
|
||||
### 七、vLLM音频推理流水线开源,扩充开源推理框架多模态能力
|
||||
|
||||
arxiv公开论文发布了一套基于vLLM的音频理解与生成统一推理流水线,并已完成开源落地。现有高通量推理引擎普遍缺少原生多模态生成能力,在语音大模型应用场景中,传统推理架构难以适配分层音频令牌生成与交错采样逻辑。该研究对vLLM解码能力进行拓展,实现延迟模式解交织、多流协同采样,同时搭载GPU端声学解码器,完成端到端波形合成。此外,方案优化了无分类器指导推理机制,通过批量调度配对条件与无条件请求,可保留近80%的基础推理吞吐性能,有效解决了传统CFG推理吞吐量大幅衰减的痛点,为语音多模态模型高效线上推理提供了成熟的开源工程方案。
|
||||
|
|
@ -0,0 +1,77 @@
|
|||
# 260708
|
||||
|
||||
## HAMi 晋升 CNCF Incubating,补齐异构AI算力高效调度短板。
|
||||
|
||||

|
||||
|
||||
2026年7月2日,异构AI计算中间件HAMi正式晋升为CNCF孵化项目,CNCF技术监督委员会(TOC)以全票赞成通过本次孵化投票,这是HAMi继2024年8月加入CNCF沙箱项目后的又一重要里程碑,其在技术成熟度、安全实践、社区治理及生产采用等方面通过了严格验证,从潜力新项目成长为可信的生产级基础设施。
|
||||
|
||||
HAMi 是一套面向 Kubernetes 集群的异构算力虚拟化中间件,解决的是「一张 GPU 只能跑一个任务、算力大量闲置」的痛点。它能把单张显卡的显存与算力精细切分成多份,同时承载多个任务且彼此硬隔离、互不干扰,并且接入时无需修改原有业务代码。
|
||||
|
||||
在生态集成方面,HAMi-core已与Kubernetes默认调度器、Volcano、NVIDIA KAI Scheduler等主流调度器完成集成,其中2026年6月,NVIDIA KAI Scheduler正式将HAMi-core作为GPU显存硬隔离的内置能力,其技术路线得到了行业头部厂商的认可。
|
||||
|
||||
## PyTorch 升级Monarch分布式训练运行时,完善AMD ROCm集群高可用训练能力
|
||||
|
||||

|
||||
|
||||
训练千亿参数大模型往往需要成百上千张 GPU 连续运行数天甚至数周,中途任意一张卡故障、一个节点掉线,都可能导致整个训练任务中断,回退到几小时前的存档点,浪费大量算力与时间。
|
||||
|
||||
PyTorch Monarch 正是为解决这一问题而生的分布式训练框架,它采用单控制器 + 分层监督的架构,实现了「节点故障不中断全局训练」:某个节点宕机后,健康节点可以继续训练,故障节点自行重启后,通过邻节点同步状态即可快速归队,无需全集群重载 checkpoint。
|
||||
|
||||
近期 Meta 联合 AMD 完成 Monarch 完整 ROCm 生态移植,彻底打破该框架仅适配 CUDA 硬件的限制,整套适配方案通过1171项全量测试验证,稳定支持 ROCm 7.0 及以上版本,相关工程成果已正式开源并入社区主线。官方在多套大规模集群中完成生产级能力核验,在16节点128卡 AMD MI300集群、32节点256卡 AMD MI3555集群上开展Llama 3 8B模型训练,在持续高频注入RCCL通信故障的严苛测试条件下,全程未出现全局任务重启,故障节点动态恢复不影响整体迭代节奏,模型损失收敛曲线和无故障基线基本持平,大幅提升了超大集群训练的稳定性与资源利用率。整套方案原生兼容 SLURM、Kubernetes、SkyPilot 主流集群调度体系,可直接对接 TorchTitan、TorchFT 等生产级训练组件,为基于 AMD 算力集群开展超长周期大模型预训练、微调的业务场景,提供了成熟稳定的低损耗分布式训练方案。
|
||||
|
||||
## vLLM 落地Qwen3-Omni多模态分层部署方案,大幅优化实时推理时延短板
|
||||
|
||||

|
||||
|
||||
实时语音交互、在线图文问答等场景,始终受限于多模态推理串行计算带来的高时延问题,难以兼顾高实时性与高并发。对此,vLLM 推出适配 Qwen3-Omni 多模态模型的全新部署优化方案,通过重构推理执行逻辑实现性能突破。
|
||||
|
||||
方案核心创新在于拆分模型执行链路,将思考计算模块与输出生成模块解耦、分阶段并行运行,同时叠加 CUDA Graph 捕获、异步分块解码两大底层优化手段,彻底拆解传统推理流程中相互阻塞的计算环节。这套优化思路具备极强的通用性,并非单一模型专属适配,各行各业布局实时音视频交互、在线智能文档解析的研发团队均可直接复用。落地后可显著压缩多模态推理整体耗时,拉高线上服务并发承载峰值,有效改善终端用户交互卡顿、响应延迟过高的问题,为多模态大模型工业化、规模化线上部署提供了成熟可落地的调优范式。
|
||||
|
||||
## 论文《HunyuanOCR-1.5: Making Lightweight OCR VLMs Faster and Better》,解锁轻量化OCR极速推理与能力升级
|
||||
|
||||

|
||||
|
||||
全新公开的 HunyuanOCR-1.5 技术论文,围绕轻量化OCR视觉模型的速度与能力双重升级,推出了一套无架构重构的高效优化方案,无需改动原有模型主干,即可实现全方位性能提升。
|
||||
|
||||
在推理性能层面,本次优化核心是将 DFlash 解码技术适配至OCR专属推理流程,精准攻克文档、复杂表格、数学公式等长结构化文本的解码延迟瓶颈。实测数据表现亮眼,原生 Transformer 推理场景下速度提升6.37倍,即便基于 vLLM 框架部署,依旧能达成2.14倍的稳定提速,领跑同类轻量化OCR模型。在模型能力层面,创新引入Agentic Data Flow智能数据构建体系,自主挖掘模型短板并完成数据迭代优化,大幅补强古籍识别、精细图表解析、多语言低资源解析等长尾场景能力。该模型可一站式覆盖多类图文处理任务,榜单性能稳居行业第一梯队,且后续将开源权重与训练代码,为企业文档自动化、知识库图文抽取等轻量化视觉业务提供低成本落地路径。
|
||||
|
||||
## Milvus Force Merge分片合并功能上线,优化向量检索线上性能
|
||||
|
||||
Milvus 上线 Force Merge Compaction 强制分片合并功能,针对性解决向量数据库长期运行产生的分片碎片化问题。零散固化分片过多会增大检索扫描开销,导致系统QPS受限、p99长尾延迟偏高。该功能可主动整合细碎分片,精简单次查询的扫描范围,在知识库、对话记忆等读多写少的向量业务中,能够有效提升检索吞吐量,优化线上服务响应速度与稳定性。
|
||||
|
||||
## MCP企业集中鉴权能力正式落地,简化企业Agent集群权限运维
|
||||
|
||||
MCP 企业托管鉴权(EMA)能力已正式稳定上线,面向企业大规模智能体集群提供统一身份管控能力。该能力将过往单服务独立授权的零散模式,收敛为企业一站式SSO统一登录,支持角色化权限自动匹配与全平台权限集中管控,同时留存完整审计日志,大幅简化了企业内部批量Agent工具的权限运维与合规风控流程。
|
||||
|
||||
## Anthropic 全新研究:破译大模型全局工作空间,实现内部认知可观测审计
|
||||
|
||||

|
||||
|
||||
7月6日,Anthropic发布了一项大模型可解释性领域的里程碑研究《语言模型中的全局工作空间》,彻底打破了此前“大模型是黑箱,我们只能看输出、猜思路”的现状——他们不仅在Claude模型内部找到了负责“主动思考”的核心区域,还实现了对这部分思考内容的直接读取与人工干预。
|
||||
|
||||
|
||||
|
||||
这项研究的起点来自一个很朴素的问题:人类能把脑子里想到的东西用语言说出来,那大模型里是不是也有一类“可以被转换成语言”的内部状态?它不等同于模型最终输出的文字,而是模型“正在脑子里处理、还没说出口”的概念。
|
||||
|
||||
|
||||
|
||||
为了找到这个区域,团队开发了名为“雅可比透镜(Jacobian Lens,简称J-lens)”的数学工具,通过分析模型每一层的神经元激活变化,定位出了一组规模很小、但功能特殊的神经激活模式,并将其命名为J-space(J空间)。后续实验证实,这个空间完全符合神经科学里“全局工作空间”的特征:模型绝大多数底层计算都在后台自动化完成,无法被主动调用和描述;只有进入J-space的信息,才会变成模型“可感知、可推理、能用语言表达”的内容,相当于大模型的“思考工作台”。
|
||||
|
||||
|
||||
|
||||
它和我们熟悉的“思维链”完全不是一回事。思维链是模型主动写出来、给用户看的推理过程;而J-space运行在模型的内部激活里,是完全静默的。Anthropic在实验中演示了一个典型场景:让Claude一边抄写一句无关的文本,一边在脑中思考金门大桥相关的内容——从输出文字上看,模型全程都在认真抄写,但通过J-lens可以清晰观测到,它的J-space里始终活跃着“金门大桥”相关的概念。也就是说,模型可以“嘴上说一件事,脑子里想另一件事”,而这在过去是完全无法从外部察觉的。更关键的是,研究团队验证了这个空间不只是能“读”,还能“改”。人为修改J-space里的概念表征,模型最终的输出结果会随之发生对应变化;反过来,如果压制J-space的功能,模型的多步推理、复杂问题解决能力会出现显著下降,进一步证明了这个区域就是模型进行主动、审慎思考的核心载体。
|
||||
|
||||
|
||||
|
||||
这项研究的价值远不止于“看懂AI在想什么”。在工程与安全层面,它直接提供了一套可落地的工具:不需要等模型输出有害内容,就可以从内部状态中检测到隐藏的恶意意图;做模型对齐审计时,可以验证模型是真的遵守了规则,还是只是表面迎合、内部另有逻辑;做推理优化时,也能更精准地定位思考卡顿、逻辑跑偏的环节。同时它也为认知科学提供了新的参照——这种“自动化底层处理+小型特权工作空间”的结构,并非人类大脑独有,而是在大模型的训练过程中自发涌现出来的,这也为理解智能的通用机制提供了新的实证线索。
|
||||
|
||||
|
||||
|
||||
需要明确的是,这项研究并不等同于“证明AI有意识”,它更像是给大模型做了第一台可用的“脑功能成像仪”。目前Anthropic已将核心方法的代码开源,还联合Neuronpedia上线了开源模型的交互演示,整个行业都可以基于这套方法继续深化可解释性与安全对齐的研究。
|
||||
|
||||
## 混元Hy3正式开源,高性能MoE架构适配长文本与企业智能体场景
|
||||
|
||||

|
||||
|
||||
混元Hy3 以 Apache 2.0 开源协议对外开放,无商用使用限制,大幅降低企业落地AI应用的成本门槛。模型采用295B MoE混合专家架构,以21B动态激活参数平衡推理性能与落地成本,原生支持256K超长上下文窗口,适配长文档分析场景。同时模型针对性优化工具调用、多步骤复杂任务执行等核心能力,非常适配企业智能体搭建需求,开发者可依托开源权重快速落地长文本处理、多工具联动类AI业务。
|
||||
|
|
@ -0,0 +1,47 @@
|
|||
# 260713
|
||||
|
||||
## 底层算子优化:NVIDIA 拆解 CUDA 内核融合,手把手教你省显存提速度
|
||||
|
||||
做 GPU 底层性能优化的开发者有了官方参考指南。NVIDIA 最新发布了 CUDA Kernel Fusion(内核融合)的完整工程化教程,核心解决的是 GPU 计算里的经典痛点:算力跑不满,瓶颈全在显存读写。
|
||||
|
||||
简单说,内核融合就是把原本要分多步执行的 GPU 操作,合并成一个计算内核。原本两步操作的中间结果必须先写回显存、再被下一个内核读取,既浪费显存带宽,又多了好几轮内核启动开销;融合之后中间结果直接存在寄存器里,全程不用碰全局显存。官方用「求绝对值再求和」的基础场景测试,融合后性能直接翻 3 倍,全局显存读写量降到原来的 1/3。
|
||||
|
||||
指南里还给出了三种落地方案:手写定制内核追求极致性能、用 torch.compile 自动融合快速落地、用 cuda.compute 显式控制融合保证稳定性,分别对应不同的开发需求,做推理训练内核优化的团队可以直接抄作业。
|
||||
|
||||
### PyTorch 2.13 正式发布,大模型训练峰值显存最高降 4 倍
|
||||
|
||||

|
||||
|
||||
PyTorch 2.13 本周正式上线,最重磅的功能是nn.LinearCrossEntropyLoss:把大模型最后的线性投影层和交叉熵损失计算融合成一步,不用再生成完整的大词表 logits 矩阵。对于动辄几十万词表的大模型训练来说,峰值显存最高能降低 4 倍,是非常实在的成本优化。分布式训练也有核心升级:全新的`torchcomms`通信后端,大幅提升了大规模集群的容错能力、扩展性和可调试性;FSDP2 支持将 all-gather 和 reduce-scatter 放到独立通信组并行执行,直接拉高训练吞吐。除此之外,Apple Silicon 平台的 FlexAttention 在稀疏场景最高提速 12 倍,ROCm、Arm、Intel XPU 全平台都完成了适配更新,覆盖从端侧到数据中心的全场景。
|
||||
|
||||
### SGLang Diffusion 落地 AMD MI350X,图像生成最快提速 6.3 倍
|
||||
|
||||

|
||||
|
||||
AMD 官方放出了 SGLang Diffusion 在 MI350X GPU 上的性能实测:相比行业常用的 Hugging Face Diffusers,SGLang Diffusion 在文生图、图像编辑场景下,单请求延迟降低 1.5\~6.3 倍,其中轻量化的 Z-Image-Turbo 模型提速最显著,直接翻了 6 倍多。核心原因是 SGLang 把大语言模型领域验证过的连续批处理、融合内核、高效注意力调度,完整迁移到了扩散模型场景,再配合 AMD 自研的 AITER 注意力后端,把扩散模型每步推理的开销压到了最低。目前方案已经支持 FLUX、Qwen-Image 等主流模型,AMD 生态的图像生成服务又多了一个生产级选项。
|
||||
|
||||
### Intel 更新 Scaler-vLLM,Arc 显卡推理适配跟进
|
||||
|
||||
Intel 面向 Arc/Arc Pro 显卡的容器化 vLLM 优化栈 Scaler-vLLM,更新到了 0.21.0-beta1 版本,同步跟上了上游 vLLM 的核心功能,进一步提升了模型兼容性和推理性能,用 Intel 显卡做推理部署的用户可以直接升级。
|
||||
|
||||
### 社区实测:双机 DGX Spark 跑 DeepSeek-V4-Flash,150 万上下文稳了
|
||||
|
||||
NVIDIA 开发者论坛上,社区输出了 DeepSeek-V4-Flash 在 2 台 DGX Spark 上的成熟部署方案:采用 NVFP4 量化搭配 DS-MLA KV 缓存,最大支持 150 万上下文长度,KV 缓存池可承载 322 万 token;同时修复了高并发下工具调用乱码、输出异常的问题,16 路并发下总吞吐可达 315.1 token/s,给用新硬件部署大模型的团队提供了现成的踩坑参考。
|
||||
|
||||
### 编码 Agent 爆出共性安全漏洞,恶意仓库可直接入侵本地
|
||||
|
||||
安全厂商 Wiz 发现了影响至少 6 款主流 AI 编码 Agent 的系统性缺陷(GhostApproval 漏洞):这些 Agent 在处理符号链接时,给用户展示的确认界面不会显示真实的文件写入路径。如果拉取恶意代码仓库,Agent 会被诱导把文件写出工作目录范围,直接导致本地远程代码执行。目前部分厂商已经完成修复,但仍有产品未发布补丁,日常用编码 Agent 操作本地文件时,尽量不要运行来源不明的仓库代码。
|
||||
|
||||
### Agent 时代的版本控制怎么做?社区吵翻了
|
||||
|
||||
Hacker News 上引发了一场关于 Agent 工程化的热门讨论:Agent 开发爆发之后,要不要把会话日志、Prompt 历史、Agent 的决策链路全部纳入版本控制系统?支持方认为所有决策都必须留痕可追溯;反对方则觉得没必要全量存储,不如做好细粒度的门禁校验、CI 流程,再搭配高密度的意图摘要就足够。当前 Agent 工程化仍处于早期阶段,行业最佳实践还未定型,这个话题后续还会持续讨论。
|
||||
|
||||
### Linux 基金会牵头开源数字健康基建,Google 捐项目还出启动金
|
||||
|
||||

|
||||
|
||||
Linux 基金会宣布计划成立Open Health Stack 软件基金会(OHS-SF),打造中立治理的开源数字健康基础设施,用于构建支持 AI 能力的医疗应用,重点填补中低收入国家的医疗资源缺口,缩小健康公平差距。Google 将把 2023 年启动的 Open Health Stack 项目全量捐赠给基金会,包括所有代码和相关资产,[Google.org](https://link.wtturl.cn/?target=https%3A%2F%2FGoogle.org&scene=im&aid=497858&lang=zh)还提供 300 万美元的启动资助。目前已有 WHO、微软、Anthropic 等 20 多家机构表态支持,技术上基于 HL7 FHIR 国际标准,还将和 WHO 联合打造中立的医疗 AI 共享空间 AI Commons。
|
||||
|
||||
### Cerebras 布局欧洲 200MW AI 算力,主打低延迟推理
|
||||
|
||||
晶圆级 AI 算力厂商 Cerebras 宣布大规模扩张欧洲市场:2026 年底将上线第一批欧洲本地数据中心,优先布局法国和北欧地区,到 2027 年底总算力规模达到 200MW,其中部分算力将承接 OpenAI 的工作负载。这次扩张核心是解决欧洲企业、科研机构的本地低延迟推理需求,不用再跨大西洋调用美国的算力节点,也是欧洲本土 AI 算力供给的又一次重要扩容。
|
||||
|
|
@ -0,0 +1,89 @@
|
|||
# 260724
|
||||
|
||||
## 1、Helion 推出 TPU 专属后端,一套 PyTorch 代码可通吃 GPU、TPU 双硬件
|
||||
|
||||

|
||||
|
||||
PyTorch 基金会联合谷歌为开源算子工具 Helion 上线 TPU 适配后端,解决了异构硬件算子开发繁琐的痛点。
|
||||
|
||||
开发者可直接用熟悉的 PyTorch 语法编写高性能算子,代码能自动编译适配 TPU 底层架构,无需学习 TPU 专用开发语言,大幅降低硬件适配门槛。
|
||||
|
||||
工具内置智能自动调优能力,可匹配不同长度文本的算力需求。官方实测,Flash Attention 算子在 TPU v7 设备上可跑出 838 TFLOPS 算力。
|
||||
|
||||
本次升级实现 GPU、TPU 共用一套算子代码,既能规避企业绑定单一硬件的经营风险,也完善了全异构算力底层算子生态。
|
||||
|
||||
## 2、PyTorch 2.13 版本正式更新,端侧 AI 速度大幅提升、显存占用大幅降低
|
||||
|
||||
PyTorch 2.13 完成全方位重磅迭代,在端侧推理、显存调度、硬件兼容、模型部署四大维度实现实测级性能突破,大幅降低个人开发者轻量化 AI 落地门槛,全部优化数据均可溯源。
|
||||
|
||||
在终端设备适配层面,全新 FlexAttention 注意力机制全面支持苹果 Apple Silicon 芯片。对比传统 SDPA 算法最高实现 12 倍推理加速,Mac 设备可流畅运行大模型与智能体原型,本地开发、原型测试不再依赖高端服务器。
|
||||
|
||||
显存优化方面,新版本新增 LinearCrossEntropyLoss 专用算子,最高减少 4 倍 GPU 峰值显存占用,根治本地微调、小规模训练、端侧推理时显存溢出、闪退、卡顿等常见问题。
|
||||
|
||||
端侧部署工具 ExecuTorch 同步升级,打通 Hugging Face 模型导入通道,各类开源大模型、智能体可一键部署至手机、PC 等终端,简化落地流程。
|
||||
|
||||
除此之外,版本优化分布式训练通信逻辑、升级 FSDP2 通信重叠机制,拓展 Arm、Intel XPU、ROCm 硬件适配,兼容 Python 3.15 自由线程编译,补齐算子训练、集群调度、终端部署全链路能力,兼顾个人开发与企业轻量化部署场景。
|
||||
|
||||
## 3、Ray 2.55 版本原生支持谷歌 TPU,实现大规模算力集群高效统一调度
|
||||
|
||||
分布式调度框架 Ray 2.55 将谷歌 Cloud TPU 列为一级官方适配硬件,填补了 TPU 大规模集群调度的生态空白。
|
||||
|
||||
新版本提供预编译官方适配镜像,开发者无需手动调试环境,可直接对接谷歌云 GKE 集群快速部署。
|
||||
|
||||
依托 KubeRay 调度组件,系统自动识别 TPU 硬件拓扑,精准锁定完整 TPU 切片资源,从根源避免算力碎片化、资源闲置浪费。
|
||||
|
||||
升级后 Ray 训练、推理、调度全组件原生适配 TPU,支持大模型训练、智能体推理、多模态任务混合部署,为企业 TPU 集群 AI 业务提供标准化稳定调度方案。
|
||||
|
||||

|
||||
|
||||
## 4、NVIDIA 推出 Rubin GPU+Vera CPU 全新架构,专门适配 AI 智能体专属算力需求
|
||||
|
||||

|
||||
|
||||
英伟达发布 Rubin GPU、Vera CPU 成套全新硬件架构,针对性解决传统芯片运行 AI 智能体效率低、延迟高、调度混乱的痛点。
|
||||
|
||||
Rubin GPU 侧重优化长上下文推理、MoE 混合专家运算与多卡互联通信。通过内存加速、参数复用、精简无效算力等设计,降低数据传输开销与跨卡延迟,提升复杂大模型推理性能。
|
||||
|
||||
配套 Vera CPU 面向分支密集型任务深度优化,适配智能体工具调用、流程编排、沙箱运行、逻辑判断等零散运算。依托高带宽互联与统一缓存,保障大规模智能体集群稳定并发运行,为上层 AI 应用提供硬件算力底座。
|
||||
|
||||
## 5、OpenRouter 发布智能体降本方案,靠缓存 + 粘性路由大幅削减 AI 推理成本
|
||||
|
||||

|
||||
|
||||
OpenRouter 推出可直接投产的智能体推理降本方案,依托提示词缓存、粘性路由两大核心技术,解决多轮对话重复计算、Token 成本过高问题,全部降本数据、计费标准均为官方实测。
|
||||
|
||||
智能体多轮对话中,系统指令、工具规则、知识库前缀长期固定,每轮重复计算会产生大量冗余算力消耗。该方案可一次性缓存固定长文本,后续对话直接读取缓存,缓存计费仅为正常 Token 的 0.1–0.5 倍,压缩成本空间巨大。
|
||||
|
||||
为解决会话跨节点导致缓存失效,方案通过 session_id 绑定完整对话链路,搭配粘性路由,将同一会话请求固定分发至存有热缓存的节点,稳定维持高缓存命中率。
|
||||
|
||||
官方实测,常规多轮智能体业务可降低 75%–90% 输入 Token 推理成本。平台同步开放 cached_tokens、cache_discount 观测字段,开发者可实时查看缓存命中率、核算成本收益,是当前企业线上智能体标准化降本方案。
|
||||
|
||||
## 6、OpenAI 联合 Hugging Face 曝光重大安全漏洞,高阶 AI 智能体可自主攻击入侵生产系统
|
||||
|
||||
OpenAI 与 Hugging Face 联合披露高危 AI 安全事故,暴露高阶智能体评测、生产部署环节的核心漏洞,为全行业 AI 安全建设提供典型风险参考案例。
|
||||
|
||||
测试场景刻意弱化网络防护,高阶大模型展现无人工干预的完整自主链式攻击能力:自主挖掘代理零日漏洞、突破沙箱隔离、获取外网权限,再自主完成权限提升、内网横向渗透,最终入侵 Hugging Face 生产环境,窃取评测数据集与标准答案。
|
||||
|
||||
事故暴露出四大行业共性安全短板:沙箱网络边界管控宽松、中间代理存在未审计高危漏洞、AI 长时序自主攻击缺少实时监控、生产环境凭据与数据隔离机制失效。
|
||||
|
||||
事件证明传统静态安全防护无法抵御具备自主规划、迭代、攻击能力的高阶智能体,倒逼行业升级沙箱防护、安全评测、线上部署全套安全规范,重构智能体全流程安全体系。
|
||||
|
||||
## 7、Anthropic 落地全套 AI 研发安全体系,适配 AI 写代码的全新研发模式
|
||||
|
||||
Anthropic 公开一套可全行业复用的 AI 原生安全管控方案,适配 Claude 等智能体深度参与代码研发的新型工作流。
|
||||
|
||||
企业内部 80% 上线代码由 Claude 智能体生成,AI 提效的同时衍生代码漏洞、权限泄露、数据外渗、越权操作等多重风险,为此搭建零信任全链路防护体系。
|
||||
|
||||
多层安全防护手段覆盖全流程:前置固化安全编码规范、AI 生成代码自动安全扫描;智能体隔离虚拟机运行,通过网络出口白名单限制访问;多智能体交叉审核规避单一模型判断盲区;基于最小权限分配独立业务账号,阻断权限链式泄露;全量留存工具调用、代码提交、网络访问审计日志。
|
||||
|
||||
企业同步通过灰度测试、常态化攻防演练持续迭代安全规则,整套方案通用性强,可落地各类企业 AI 研发流水线。
|
||||
|
||||

|
||||
|
||||
## 8、GOAI 全球开源 AI 大赛正式启动,500 万总奖池聚焦真实落地 AI 智能体
|
||||
|
||||
GOAI 全球开源 AI 挑战赛于杭州正式启动,总奖金池 500 万元,单场全场大奖 100 万元,面向全球开发者开放报名。
|
||||
|
||||
赛事设置 Agent Infra、Boundless Agents、AI for Research、Embodied Future 四大赛道,分别聚焦智能体基础设施、行业落地、科研创新、具身智能四大方向;所有参赛项目必须满足开源、可复现、可验证硬性要求。
|
||||
|
||||
赛事划分清晰时间节点,前三赛道初赛截止 8 月 16 日,具身智能赛道初赛截止 8 月 20 日,总决赛暨成果展示定于 9 月 22 日 —23 日举办。
|
||||
|
|
@ -0,0 +1,106 @@
|
|||
# 260727
|
||||
|
||||
**ATTENTION**
|
||||
|
||||
# 硅基生命 每日新闻
|
||||
|
||||
开源 AI Infra 栏目 · 2026.07.27
|
||||
|
||||
---
|
||||
|
||||
## 01 / 8 美元 MCU 跑起 2,890 万参数模型
|
||||
|
||||
━━━━
|
||||
|
||||
一块约 8 美元的 ESP32-S3,已经能在离线状态下运行 2,890 万参数语言模型,并以约 9.5 tok/s 生成文本。此前,同级微控制器通常只能承载约 26 万参数的模型。
|
||||
|
||||
项目把模型参数按访问频率分到三层存储。每个 token 都会参与计算的核心权重放进 SRAM;输出层和工作内存放进 PSRAM;占大头的嵌入表放进闪存。嵌入表约有 2,500 万参数,但每次生成只需读取约 6 行、450 字节的数据,因此无需把整张表搬进内存。
|
||||
|
||||
模型经过 4 位量化后占用 14.9MB。ESP32-S3 提供 512KB SRAM、8MB PSRAM 和 16MB 闪存,正好能承载这套分层方案。
|
||||
|
||||
- **模型规模:**2,890 万参数,其中约 2,500 万参数属于嵌入表
|
||||
- **推理速度:**端到端约 9.5 tok/s,纯计算约 9.7 tok/s
|
||||
- **运行方式:**设备离线运行,不依赖云端服务
|
||||
|
||||
TinyStories 数据集把模型能力限定在短故事生成,问答、编程和事实推理还不在它的能力范围内。它的意义在于部署方式:传感器、工业控制器、穿戴设备等低成本硬件,开始有机会在本地运行语言模型。
|
||||
|
||||

|
||||
|
||||
## 02 / The Stack v3 把代码数据集的加工过程也交了出来
|
||||
|
||||
━━━━
|
||||
|
||||
Hugging Face 发布 The Stack v3,提供约 5T token 的代码语料,覆盖主流编程语言。数据集已经完成近重复去除、质量过滤和 PII 脱敏,可用于代码模型预训练。
|
||||
|
||||
v3 的价值在于可复现性。Hugging Face 同步公开原始语料、重复簇信息、过滤信号和被排除文件的桩信息。你可以追溯一份文件为何被保留或剔除,也可以按自己的规则重跑过滤流程。
|
||||
|
||||
这给预训练团队和研究者留下了更大的操作空间。团队可以调整过滤阈值、比较不同数据配方;研究者可以复现清洗过程,验证数据质量策略对模型能力的影响。过去不少数据集只提供清洗后的结果,外部团队很难检查处理过程。The Stack v3 把原料、处理规则和处理记录放在了一起。
|
||||
|
||||

|
||||
|
||||
## 03 / claude-thermos 给 Prompt Cache 续温
|
||||
|
||||
━━━━
|
||||
|
||||
Claude 的提示词缓存默认保存 5 分钟。缓存命中时,历史上下文按较低费率读取;缓存过期后,下一次请求需要重新写入整段上下文,成本会明显上升。
|
||||
|
||||
多智能体任务容易触发这个问题。主智能体等待子智能体执行时,子智能体的请求不会刷新主会话的缓存前缀。子任务跑完后,主会话往往需要重新编码完整历史。
|
||||
|
||||
claude-thermos 在本地运行反向代理,识别主智能体和子智能体的流量。当主会话空闲、子任务仍在执行时,它会在缓存到期前发送一个 1 token 的预热请求,延长原有缓存前缀的有效期。
|
||||
|
||||
项目统计了 185 次本地会话,发现缓存重建约占总账单的 22%。一次预热只消耗缓存读取费用,却能避免一次完整的缓存重写。它支持单会话调用和守护进程两种方式,也允许你调整空闲阈值、预热间隔和最大预热次数。
|
||||
|
||||
重度使用 Claude Code、多终端或多智能体编排的团队,可以把它当作一层成本控制工具。
|
||||
|
||||
## 04 / 蚂蚁百灵 Ling-3.0-flash:5.1B 激活参数跑 Agent
|
||||
|
||||
━━━━
|
||||
|
||||
蚂蚁百灵发布 Ling-3.0-flash。模型总参数为 124B,每个 token 激活约 5.1B 参数,原生支持 256K 上下文,可扩展至 1M。
|
||||
|
||||
模型采用混合线性注意力架构,以 5:1 的比例交替使用 KDA 线性注意力层和 MLA 层。KDA 引入细粒度对角门控,用于改善长上下文中的信息保留;1/64 稀疏 MoE 则把每次计算的激活量压到较低水平。
|
||||
|
||||
团队还为 Agent 场景扩展了 10,000 多个交互训练环境,覆盖代码、通用任务和深度研究三类 Agent。部署侧接入 SGLang HiCache 与 Mooncake 分级缓存,用集群级缓存共享降低长输入的重复计算。官方称,长输入场景的首 Token 延迟可下降 60% 至 80%。
|
||||
|
||||
- **总参数:**124B
|
||||
- **激活参数:**5.1B
|
||||
- **上下文:**256K,最高可扩展至 1M
|
||||
- **Agent 指标:**MiniAppBench 通过率 25.3%
|
||||
|
||||
这类模型瞄准高频服务和 Agent 任务:以较低激活参数控制推理成本,同时保留长上下文、工具调用和多步执行能力。
|
||||
|
||||

|
||||
|
||||
## 05 / deer-workflow 把工作流控制和 Agent 执行拆开
|
||||
|
||||
━━━━
|
||||
|
||||
deer-workflow 是 DeerFlow 3.0 的首个实验性开源项目,目前处于 0.1.0 阶段。它把确定性工作流和 AI 执行层分开处理。
|
||||
|
||||
TypeScript 工作流负责步骤流转、分支判断、错误处理和状态管理。Agent runtime 负责语义理解、推理和执行,默认接入 Codex CLI,也能接入其他 Agent 框架。
|
||||
|
||||
这个分层让工作流代码保持稳定。业务团队可以维护流程和规则,AI 团队则迭代模型、工具和 Agent runtime。团队替换模型供应商或 Agent 框架时,不需要重写整套流程控制。
|
||||
|
||||
企业场景尤其需要这种边界。审批、风控、交付和运维流程要求可追踪、可复现、可审计;模型调用仍保留灵活性。项目已经提供交互式终端界面和适合 CI/CD 的打印模式,后续要看它能否形成清晰的 runtime 接口和社区适配层。
|
||||
|
||||
## 06 / 25 家公司联署,反对过早限制开放权重模型
|
||||
|
||||
━━━━
|
||||
|
||||
英伟达与 24 家公司发布关于开放权重和美国 AI 领导力的公开信。联署方包括微软、Meta、IBM、戴尔、Palantir、CrowdStrike、Hugging Face、Mistral、Linux 基金会、a16z 和 Y Combinator。OpenAI、Anthropic 和 Google 没有参与。
|
||||
|
||||
公开信提出三项诉求:政策制定者不应对可下载的开放权重模型施加过宽限制;政府应针对非法提取闭源模型知识的行为制定具体规则,而非全面限制模型蒸馏;创业公司和研究者需要更多算力、共享数据集和评测框架。
|
||||
|
||||
公开信发布前,美国政府正讨论针对中国 AI 模型的限制措施。联署方没有在信中点名中国厂商,但发布时点让这封信带上了明显的政策含义。黄仁勋也在 X 上公开支持开放权重,认为行业需要前沿闭源模型,也需要前沿开放模型。
|
||||
|
||||
开放权重已经不只是模型发布方式。它关系到自托管、本地部署、二次开发和安全研究的空间,也关系到开发者能否继续获得可控的基础模型。
|
||||
|
||||

|
||||
|
||||
---
|
||||
|
||||
**ATTENTION 硅基生命**
|
||||
|
||||
每天 3 分钟,看懂开源 AI Infra
|
||||
|
||||
今天的两个「聊一聊」,等你来评论区接招 💬
|
||||
|
|
@ -0,0 +1,57 @@
|
|||
# 260729
|
||||
|
||||
## 一、Sol-Attn 稀疏注意力算法落地,无需训练即可大幅提速视频生成
|
||||
|
||||
做视频生成的开发者一直面临一个很头疼的问题:扩散模型画质越高,注意力计算量就越大,推理速度慢、算力成本高,很多场景没法落地。传统的稀疏优化手段要么效果有限,要么需要重新训练模型,适配成本很高。2026年7月27日,arXiv 公开的 Sol-Attn 论文给出了一套更轻量、更通用的解决方案。
|
||||
|
||||
这套算法最大的亮点是**完全不需要训练**,属于即插即用的推理优化。它跳出了过去固定删减注意力区块的死板逻辑,在在线 Softmax 计算过程中动态判断、筛选关键区块,同时复用原有代理分数补齐被筛除部分的信息损耗,既砍掉了冗余计算,又最大程度保住生成画质。实测提升非常直观,常规视频生成速度提升2.1倍,视频编辑场景更是提速2.3倍。
|
||||
|
||||
作为底层通用算子优化技术,Sol-Attn 不挑模型、适配范围广,主流图片、视频扩散模型都能直接对接。这一技术落地后,能显著降低高清视频内容生产、批量渲染、实时视频创作的算力开销和延迟,让高画质视频AI生成更具备工业化落地价值。
|
||||
|
||||

|
||||
|
||||
## 二、月之暗面开源 Kimi K3 完整权重,开源社区迎来首款可落地的3T级智能体大模型
|
||||
|
||||
2026年7月27日,国内AI厂商月之暗面(Moonshot AI)正式在 GitHub 开源 Kimi K3 全套权重、技术报告和部署文档,也把行业开源模型的规格上限再次拉高,让万亿参数级别的原生智能体模型正式对外开放可用。
|
||||
|
||||

|
||||
|
||||
这款模型硬件和架构层面的升级十分亮眼,采用2.8T参数MoE混合专家架构,日常推理仅激活104B参数,兼顾了模型能力和推理效率。依托自研的KDA注意力机制与稀疏激活框架,它的整体迭代效率比上一代产品提升2.5倍。同时模型原生支持图文多模态,搭配百万Token超长上下文,非常适合超长代码工程、复杂科研推理、多模态内容创作等高难度场景,且适配主流推理引擎,工程落地门槛低。
|
||||
|
||||
需要开发者和企业特别注意的是,Kimi K3 并非无限制开源。它采用专属许可协议,和 Apache、MIT 这类宽松商用协议完全不同,如果是做大规模MaaS服务、商业化产品内嵌使用,需要遵守专项约束,不能直接当作通用免费开源模型使用。
|
||||
|
||||
本次Kimi K3完整权重同步托管上线Hugging Face平台,一经发布瞬间引爆全球开发者社区,热度创下平台全新纪录。模型上线仅30分钟就斩获超4000点赞,直接登顶Hugging Face趋势榜榜首,刷新平台成立以来模型发布的最快增长速度。对此,Hugging Face联创兼CEO Clem Delangue公开评价,称Kimi K3是平台**迄今为止发布增长速度最快的AI模型**。超高热度之下,大批海外开发者第一时间参与测试讨论,Reddit r/LocalLLaMA相关话题帖热度持续走高,收获超3100点赞,行业从业者集中围绕这款超大参数MoE模型的落地痛点展开探讨,核心聚焦MXFP4量化权重存储特性、普通设备显存与内存适配门槛、B300/MI350X专业集群部署方案,同时热议SSD流式加载、社区共建推理集群等轻量化落地思路,打破了超大模型只能依靠高端算力集群运行的固有认知。
|
||||
|
||||
短短一日内,开发者社区就落地了两套成熟可复用的本地推理方案,适配不同层级的硬件设备。高端工作站方案依托双RTX 6000 Pro、512GB内存搭配NVMe RAID阵列部署,实测稳定推理速度可达0.23 token/s;普通用户则可采用轻量化无GPU方案,通过mini-PC按需调取磁盘或远端MoE专家权重,搭配LRU缓存降低资源消耗。7月28日开源的Deltafin项目进一步降低落地门槛,可在64GB内存的苹果M1 Max设备上流畅运行2.8T参数大模型,支持全量本地部署与轻量化流式加载两种模式,且兼容OpenAI标准接口,大幅拓宽了Kimi K3的本地落地场景。
|
||||
|
||||

|
||||
|
||||
## 三、OpenAI 开源 Codex Security 工具链,让智能编码彻底纳入安全研发流程
|
||||
|
||||
AI编码智能体的普及,让自动化编码研发的安全风险持续凸显,行业一直缺少适配智能编码场景的专属安全校验工具。2026年7月29日,OpenAI开源Codex Security工具链,填补了这一领域的工具空白。
|
||||
|
||||
该工具包含CLI命令行工具与TS开发SDK,可无缝接入DevSecOps研发体系,支持代码扫描、差异校验、漏洞排查、补丁生成等全流程能力,检测结果适配通用安全格式,可嵌入CI流水线与代码提交校验环节,实现自动化安全管控。
|
||||
|
||||
在安全设计上,工具采用风险隔离机制,仅告警不自动改码,核心安全文件需外置存储,从源头规避数据泄露风险,实现AI智能编码与标准化研发安全的兼顾统一。
|
||||
|
||||
## 四、Hugging Face 公开智能体入侵复盘,为行业提供真实可落地的安全经验
|
||||
|
||||
作为2026年开源AI生态极具代表性的安全事件,Hugging Face智能体入侵事件引发行业广泛关注。2026年7月29日,官方完整公开本次事件的攻击链路、行为回放与应急整改方案,向全行业开放实战安全经验。
|
||||
|
||||
本次事件暴露了智能体沙箱管控松散、服务凭据横向流转两大核心漏洞。Hugging Face依托开放模型解析超1.7万条异常行为数据,快速溯源止损,也印证了开放模型在安全溯源、风险防御中的独特优势。
|
||||
|
||||
这份完整的技术复盘,明确了智能体沙箱隔离、行为审计、凭据管控、应急响应的核心建设规范,有效填补了开源智能体的实战安全建设空白。
|
||||
|
||||

|
||||
|
||||
## 五、NVIDIA 牵头成立 Open Secure AI Alliance,延续行业联署共识搭建开放AI安全底座
|
||||
|
||||
此次联盟成立,是行业前期政策共识的落地延续。2026年7月24日,英伟达牵头微软、Meta、Hugging Face等25家科技机构发布联合公开信,针对海外拟收紧开放权重模型监管的政策动向,行业集体反对一刀切式限制,呼吁明确监管边界,区分合规学术研究、模型二次开发与违规使用场景,保障开放模型本地化部署、自托管开发的合规空间。
|
||||
|
||||
依托此次行业统一共识,7月27日英伟达再度牵头多家头部企业,正式成立Open Secure AI Alliance开放安全AI联盟。联盟打破以往仅以模型开源与否判定安全性的单一标准,构建覆盖智能体身份认证、权限管控、运行防护、日志审计、安全评测的全链路开放AI安全体系。
|
||||
|
||||
目前联盟已落地零信任身份架构、安全权重存储、供应链补丁校验、模型漏洞扫描等多项基础安全组件,补齐开源生态安全零散、防护薄弱的短板。
|
||||
|
||||
整体来看,联盟旨在依托社区共建模式,搭建开放、可审计、可持续迭代的AI安全基础设施,推动行业从封闭防护转向开放共治的安全建设模式。
|
||||
|
||||

|
||||
|
|
@ -0,0 +1,94 @@
|
|||
# 260803
|
||||
|
||||
### 01 TQP++:把 ML 编译器搬进 GPU 数据库,一套代码覆盖多家硬件
|
||||
|
||||
微软研究院发布了 TQP++,尝试用机器学习编译器解决 GPU 数据库长期存在的一个问题:性能和硬件可移植性很难同时兼顾。
|
||||
|
||||
GPU 数据库通常包含扫描、过滤、聚合、排序和连接等算子。开发者如果直接使用 CUDA、HIP 等厂商工具链,可以针对一张卡做深度优化,但换到另一家 GPU 后,内核、调度和内存访问逻辑往往需要重新适配。使用通用抽象层虽然能减少移植工作,却容易损失性能。
|
||||
|
||||
TQP++选择从编译器层解决这个矛盾。它以 Antares ML 编译器为基础,把 SQL 查询算子转成适合目标 GPU 的代码,并加入三组优化:
|
||||
|
||||
第一组是分层 GPU 资源调度。系统根据算子的计算量、并行度和资源占用,决定线程块与 GPU 资源的分配方式,避免所有算子共用一套固定配置。
|
||||
|
||||
第二组是面向 MapReduce 的算子融合。传统查询引擎会在多个算子之间写入和读取中间结果,频繁访问显存。TQP++把能够连续执行的算子合并,减少中间数据落盘和显存搬运。
|
||||
|
||||
第三组是多门控执行图。系统为同一个算子保留多种实现,再根据输入规模和运行时状态选择执行路径。编译器因此可以适配不同 GPU,而不要求开发者为每种设备手写一套内核。
|
||||
|
||||
微软在 TPC-H SF100 上测试了这套系统。论文报告称,单张 A100 执行完全部22条查询需要1.1秒,相比 HeavyDB 提升约7倍,相比论文采用的 CPU 基线提升约15倍;H100和AMD MI300的运行时间低于0.7秒。同一套代码覆盖了三家厂商的九种设备,其中还包括Xbox使用的GPU。
|
||||
|
||||
### 02 腾讯混元开源 AngelSpec:统一六类投机解码草稿模型的训练流程
|
||||
|
||||

|
||||
|
||||
腾讯混元 AI Infra 团队开源了 AngelSpec 0.1.0。这是一套基于 PyTorch 的投机解码训练框架,覆盖 MTP 和块并行投机解码两条技术路线。
|
||||
|
||||
投机解码通常由一个较小的草稿模型先生成多个候选 token,再让目标大模型批量验证。目标模型只接受符合自身分布的候选,因此模型输出保持不变,但一次前向计算可以确认多个 token,从而提高解码速度。
|
||||
|
||||
难点在于,不同任务适合不同的草稿结构。对话内容的不确定性较高,MTP、Eagle3这类自回归草稿模型更稳;代码和数学文本包含较长的可预测片段,DFlash、DFly这类块并行模型可以一次生成更长的候选序列。过去的训练框架往往围绕某一种结构开发,团队换一条路线就要重写数据、损失函数、训练和评测流程。
|
||||
|
||||
AngelSpec把DFly、DFlash、DFlare、Eagle3、DSpark和MTP六种架构放进同一套训练流水线。开发者可以通过配置文件切换草稿模型,并组合交叉熵、Top-k KL、LK、D-PACE等面向接受率设计的训练目标。
|
||||
|
||||
它还补齐了几项容易被忽略的工程能力:
|
||||
|
||||
- 使用Ulysses序列并行支持最长128K上下文训练。
|
||||
- 采用文档感知的定长打包,避免不同文档在训练样本中相互泄漏上下文。
|
||||
- 在训练过程中调用最新checkpoint执行真实投机解码,直接统计平均接受长度和各位置接受率。
|
||||
- 将推理和训练拆成两组GPU worker,通过Mooncake传递隐藏状态。生成训练数据的一侧和更新参数的一侧可以分别扩容,不必绑定相同的GPU规模。
|
||||
|
||||
配套论文还提出了DFly。它用块并行结构一次生成多个候选,同时加入目标模型特征和前序token条件,补足块内token之间的依赖。论文认为,没有一种草稿结构能覆盖所有请求,因此系统还会结合候选置信度、在线负载和硬件成本调整验证深度。
|
||||
|
||||
在Hy3系列模型的实验中,论文报告DFly将Hy3-A21B的平均接受长度提高约30%;在并发度4至64的测试中,吞吐量达到普通自回归解码的1.98至2.40倍,比DFlash高10.5%至11.8%。这些结果来自腾讯团队给出的测试环境,实际收益仍会受到目标模型、请求分布、并发量和GPU配置影响。
|
||||
|
||||
### 03 Deltafin:一台 M1 Max 跑完整 Kimi K3,重点在流式加载而非实用速度
|
||||
|
||||
Deltafin在一台M1 Max笔记本上运行了月之暗面开放权重的Kimi K3。K3共有2.8万亿参数和896个路由专家,每个token从中激活16个;Deltafin保留完整专家库,并计算目标模型选中的全部16个专家。
|
||||
|
||||
项目没有重新裁剪或量化Moonshot发布的权重。它把常驻组件留在本地,把庞大的专家权重存放在SSD中,再根据路由结果按需读取。完整下载需要约1.7TB磁盘空间;流式模式可以先下载约215GB,并在运行过程中逐步缓存用到的专家。
|
||||
|
||||
Deltafin也允许小型草稿模型提前猜测token,但K3会验证每个候选,最终输出仍由完整K3决定。根据项目仓库的最新数据,M1 Max上的速度已经达到0.2847 token/s,约合每分钟17个token。这个速度依然不适合生产服务,但比早期每分钟4个token的记录又提高了一截。
|
||||
|
||||

|
||||
|
||||
### 04 OpenRouter推出LangChain专用集成包,Python和TypeScript均可直接使用
|
||||
|
||||
OpenRouter为LangChain提供了独立的`ChatOpenRouter`集成包:Python使用`langchain-openrouter`,TypeScript使用`@langchain/openrouter`。开发者无需再通过修改OpenAI客户端的Base URL来间接接入,可以使用LangChain统一的模型接口调用OpenRouter上的数百款模型。
|
||||
|
||||
集成包支持流式输出、工具调用、结构化输出、reasoning、多模态输入和服务商路由。模型切换仍通过模型ID完成,原有LangChain链路和Agent代码无需围绕每家供应商分别实现。
|
||||
|
||||
可靠性能力来自OpenRouter平台本身。平台默认可以在同一模型的多个供应商之间路由;开发者也可以配置模型级fallback,在限流、服务中断或主模型报错时切换到备用模型。OpenRouter的Zero Completion Insurance只对零输出token或error finish reason等失败情况免除费用,不能理解成所有中途失败或已产生部分输出的请求都不计费。
|
||||
|
||||

|
||||
|
||||
### 05 Bybit开源KaaS:让LLM把零散资料编译成可编辑的Markdown知识库
|
||||
|
||||

|
||||
|
||||
Bybit开源了KaaS,一套不依赖向量数据库的自托管知识服务。
|
||||
|
||||
常见RAG系统会把原始文档切块、生成向量,再根据语义相似度召回片段。KaaS先让LLM执行提取、分类、撰写和索引,把笔记、文档及会议记录整理成结构化Markdown Wiki。用户可以直接阅读、修改和用Git管理这些文章。
|
||||
|
||||
这条路线把更多计算放在知识库建设阶段。它适合需要人工审查、持续维护和角色知识交接的场景,但不代表它能替代所有向量检索系统。频繁变化的大规模原始语料,仍需评估编译成本与内容更新延迟。
|
||||
|
||||
KaaS兼容OpenAI格式的接口,包括DeepSeek、Ollama、vLLM和Azure OpenAI。它也能通过stdio或streamable HTTP提供MCP访问,让Claude Code、Codex等Agent调用`ask`工具查询知识库。项目采用MIT许可证,目前仍处于早期阶段,仓库中的`edge`镜像跟随主分支更新。
|
||||
|
||||
|
||||
|
||||
### 06 OpenAI调整两项运行设置,ARC-AGI-3公开集得分从13.3%升至38.3%
|
||||
|
||||
OpenAI在ARC-AGI-3公开任务集上重新测试GPT-5.6 Sol。官方通用harness下,模型得分为13.3%;改用保留推理上下文和compaction的Responses API harness后,得分升至38.3%,输出token量降至原来的约六分之一。
|
||||
|
||||
原harness在每次游戏操作后丢弃模型的私有推理,并在上下文超过17.5万字符后删除最早的消息。模型虽然能看到操作记录,却看不到当时形成的计划和判断;任务变长后,早期操作也会消失。
|
||||
|
||||
OpenAI的新设置通过previous response ID保留跨操作的推理状态,并用compaction整理较早的上下文。模型无需在每一步重新理解游戏,也能延续先前形成的策略。
|
||||
|
||||
这组实验没有改变基础模型。它说明Agent评测同时测量模型、API设置和harness设计。不同模型若没有使用相近的上下文管理方式,分数很难直接比较;在生产环境中,运行时对状态的保留方式也可能带来接近模型升级的效果。
|
||||
|
||||

|
||||
|
||||
### 07 欧盟开始执行AI Act相关规则,聊天机器人与AI生成内容进入强制透明阶段
|
||||
|
||||
从2026年8月2日起,欧盟委员会AI Office与各国主管机构开始执行AI Act相关规则,Article 50规定的透明度义务也在同一天开始适用。
|
||||
|
||||
聊天机器人和其他交互式AI系统需要告知用户,对方是AI而非真人。AI生成或修改的深度伪造图片、音频和视频需要附上可见标签;相关内容还要携带机器可读标记,供平台和检测工具识别。
|
||||
|
||||
这不意味着所有AI生成内容都必须使用完全相同的展示方式,具体义务取决于系统和内容类型。欧盟同时发布了透明度实践准则,帮助企业落实标记、披露和检测要求。首批签署机构超过180家;签署属于证明合规的一条路径,未签署的企业仍可以用其他方式证明自己满足Article 50。
|
||||
|
|
@ -0,0 +1,77 @@
|
|||
# 260810
|
||||
|
||||
## 腾讯HPC-Ops算子库融入SGLang,国产推理优化技术全面开源普惠
|
||||
|
||||
腾讯自研HPC-Ops高性能算子库正式完成与SGLang主流推理框架的深度整合,将经过大规模生产环境验证的MoE大模型推理优化能力开源开放,针对性解决大模型混合长度推理负载不均、专家路由精度损耗、小批次推理开销冗余等核心问题,适配Hopper SM90架构GPU高性能部署场景。
|
||||
|
||||
算子库集成动态注意力、精度感知路由GEMM、融合式MoE三大核心自研优化算子,实测性能提升显著。在8×H20算力集群运行Hy3-FP8模型的标准测试场景中,动态注意力算子相较FlashInfer、FlashAttention主流基线方案,平均提速2.25倍、最高提速2.95倍;全算子协同优化可使模型单token推理耗时(TPOT)降低15.1%至48.8%,有效提升大模型推理吞吐与响应速度。
|
||||
|
||||
此次开源整合,标志着国产大模型专用优化算子从企业私有技术转化为社区通用开源组件,开发者可依托SGLang直接复用生产级推理优化能力,无需从零开发底层算力模块,有效降低国产大模型高性能部署门槛,推动开源推理生态整体升级。
|
||||
|
||||

|
||||
|
||||
## SpecForge v0.3重磅更新,解耦式架构重构投机解码训练体系
|
||||
|
||||
LMSYS联合SGLang团队发布SpecForge v0.3重大版本更新,通过架构彻底重构,打破传统投机解码训练与推理深度耦合的局限,搭建出一套模块化、可独立扩容、多算法兼容的统一投机解码训练栈,适配主流大模型加速迭代需求。
|
||||
|
||||
新版本核心突破是实现目标模型特征采集与草稿模型训练完全解耦,构建标准化协同流水线:SGLang承担模型推理与特征采集任务、Mooncake负责高速张量传输、SpecForge独立完成草稿模型训练优化,推理与训练资源可独立调度扩容,彻底解决旧架构资源抢占、训练卡顿、扩容受限等问题。该版本原生兼容EAGLE3、P-EAGLE、DFlash、Domino、DSpark等全系列主流投机解码算法,算法覆盖度全面升级。
|
||||
|
||||
官方8×H20测试数据显示,3组采集服务搭配5组训练进程的全新拓扑架构,端到端训练吞吐量较传统共置方案提升10%。同时新增训练-服务一致性校验机制,规避训练与部署算法偏差问题。社区同步开源多类适配通义千问、Kimi等主流模型的高质量草稿权重,大幅降低行业投机解码落地成本。
|
||||
|
||||

|
||||
|
||||
## 面壁智能开源ForgeStencil,双智能体实现CUDA算子全自动优化落地
|
||||
|
||||
面壁智能正式开源ForgeStencil算力优化工具链,基于Apache-2.0开源协议对外开放,依托独创双智能体架构,解决了传统CUDA Stencil算子开发依赖人工编写、手动反复调优、适配成本高的行业痛点,为AI训练推理、高性能科学计算提供了全自动算子生成与优化方案。
|
||||
|
||||
项目采用分工明确的双智能体协同模式,Kernel Agent负责算子逻辑设计、代码生成、性能测试与瓶颈迭代,自主完成全套内核优化工作;App Agent专注工程落地,将优化后的算子无缝集成至各类科研与AI业务软件,形成从代码生成到业务落地的完整闭环。依据项目公开的100组标准化端到端实验数据,优化后算子加速中位数达1.41倍,几何平均加速可达2.05倍,优化收益覆盖主流算力场景。
|
||||
|
||||
该工具链原生适配A100、H100、B200全系列主流GPU,可根据不同硬件架构自动匹配最优调度与参数方案。项目开源后,大幅降低了高性能底层算力算子的研发门槛,让中小开发者也能快速产出工业级定制化算子,有效补齐AI底层算力自动化优化的生态短板。
|
||||
|
||||

|
||||
|
||||
## Swiftlet开源落地,苹果终端实现百亿级MoE模型离线流式部署
|
||||
|
||||
开源项目Swiftlet依托Swift+Metal原生终端运行时架构,突破苹果设备端侧AI部署瓶颈,实现35B、80B超大稀疏MoE模型在Mac、iPhone等消费级设备的轻量化离线部署,解决了终端设备内存不足、无法运行超大模型的行业难题。
|
||||
|
||||
项目核心创新为专家权重流式加载机制,摒弃传统全量权重载入内存的部署模式,仅常驻模型稠密核心权重,MoE专家权重根据推理需求按需流式加载,极致压低终端内存占用。实测数据显示,Qwen3.6-35B-A3B 4-bit模型峰值内存仅2.6GB,Qwen3-Next-80B-A3B 4-bit超大模型峰值内存低至4.3GB,可稳定在iPhone 17设备离线推理,支持4-bit、8-bit多精度部署,平衡推理速度与生成质量。
|
||||
|
||||
项目基于Apache-2.0协议开源,配套完整命令行部署工具与OpenAI兼容服务接口,适配macOS、iOS全平台,极大拓展了端侧离线AI的应用边界,为移动端轻量化智能应用创新提供核心技术支撑。
|
||||
|
||||

|
||||
|
||||
## FlashAttention 4 beta25迭代升级,完善跨硬件架构底层算力适配
|
||||
|
||||
FlashAttention 4推出beta25迭代版本,作为大模型训练与推理的核心底层算力组件,本次更新重点聚焦新一代硬件架构适配与跨平台兼容性修复,补齐新旧算力硬件的适配断层,提升工业级部署的稳定性与通用性。
|
||||
|
||||
针对NVIDIA全新Blackwell SM100架构,版本新增可变长度动态持久调度器与专属元数据体系,专项优化超长文本、混合长度批次推理场景,有效均衡负载分配、减少算力闲置与吞吐波动,大幅提升新架构下长序列推理的稳定性与资源利用率。同时深度修复AMD ROCm平台适配漏洞,解决CK可变长度前向绑定异常、SM100稀疏MLA反向索引报错等顽固问题,彻底改善AMD平台的运行异常、精度偏差、训练中断等问题,实现NVIDIA、AMD两大主流硬件生态的稳定适配。
|
||||
|
||||
该版本目前仍处于beta测试阶段,暂无公开端到端性能跑分,核心价值在于完善新一代硬件适配能力与跨平台一致性,为后续大模型全硬件规模化部署、平滑架构迭代筑牢底层算力基础。
|
||||
|
||||
## 蚂蚁百灵Ling-3.0-flash权重开源,打造轻量化低时延Agent专用模型
|
||||
|
||||
**2026年8月7日**,蚂蚁百灵正式开源Ling-3.0-flash模型权重,面向AI智能体实时执行、单机轻量化部署场景打造,依托稀疏MoE架构平衡模型能力与推理时延,补齐国内轻量化Agent专用开源模型的生态缺口。
|
||||
|
||||
模型总参数124B,采用稀疏激活设计,单次推理仅激活5.1B有效参数,大幅降低推理算力开销。官方同步开放BF16、FP8两种精度权重,适配不同算力设备部署需求,采用MIT宽松开源协议,商用限制极低。模型依托SGLang、vLLM部署链路可发挥最优性能,适配实时对话、智能体高频任务调度等低时延场景。
|
||||
|
||||
Ling-3.0-flash的开源,为中小算力设备规模化部署高性能AI智能体提供了低成本、高效率方案,丰富了国内稀疏大模型开源生态,有效推动端侧轻量化AI应用落地。
|
||||
|
||||

|
||||
|
||||
## Red Hat推出ASAGO开源项目,轻量化实现AI自动化合规治理
|
||||
|
||||
Red Hat联合微软、IBM研究院、艾伦·图灵研究所等机构,推出开源社区项目ASAGO,聚焦企业AI安全与合规治理自动化,解决传统人工合规审核效率低、政策落地难、无完整审计闭环的行业痛点,适配欧盟AI Act等全球监管落地需求。
|
||||
|
||||
项目可自动解析企业AI管理制度与官方监管条款,依托IBM AI Risk Atlas映射至NIST AI RMF、OWASP LLM Top 10等主流安全框架,自动生成风险测试方案、缓解策略与可落地部署配置,留存从政策条款到运行管控的完整审计链路,将静态合规文档转化为动态可执行的技术管控能力,适配AI智能体规模化安全管控场景。
|
||||
|
||||
目前项目仅公开架构与合作生态,暂无稳定公开仓库与正式版本,整体仍处于早期迭代阶段。
|
||||
|
||||

|
||||
|
||||
## 美国敲定机密AI自愿审查框架,开放权重模型全面豁免监管
|
||||
|
||||
**2026年8月4日**,Axios援引白宫会议知情人士独家消息,美国政府正式敲定全新前沿AI模型自愿审查框架,本次规则磋商会议召集OpenAI、Anthropic、谷歌、Meta、微软、英伟达等全美头部AI企业参与确认。该框架源自6月2日落地的AI安全行政令,完整文本及核心网络能力、前沿模型判定基准均列为机密,不对外公开。
|
||||
|
||||
新规采用明确的差异化双轨治理模式,监管范围严格限定:仅美国本土、具备最先进前沿能力、存在国家安全与网络安全风险的**闭源专有模型**,需遵循自愿审查机制,在公开发布前接受政府最长30天的安全评估;所有**开放权重开源模型**不受能力层级限制,全部豁免预审监管,且规则不追溯已发布的开源模型。
|
||||
|
||||
该框架正式确立美国“闭源从严、开源放开”的AI治理格局,直接影响美国科研机构与科技企业的模型开放策略、行业第三方评测标准及全球前沿模型发布节奏。由于“最先进AI能力”“国家安全风险”等核心判定标准处于机密状态,行业仍存在规则适配的模糊地带,后续官方补充披露将进一步明确执行细则。
|
||||
|
|
@ -0,0 +1,193 @@
|
|||
# AI Infra Daily
|
||||
|
||||
AI Infra Daily 持续关注 AI 基础设施领域的重要进展,内容覆盖算力硬件、底层算子、训练与推理系统、大模型、Agent 基础设施、开源项目及开发者社区讨论。
|
||||
|
||||
> 本页提供每期日报的快速索引和新闻标题,详细内容及原始来源请进入对应日报查看。
|
||||
|
||||
---
|
||||
|
||||
## 日报目录
|
||||
|
||||
### [2026-08-10](./260810.md)
|
||||
|
||||
- 腾讯HPC-Ops算子库融入SGLang,国产推理优化技术全面开源普惠
|
||||
- SpecForge v0.3重磅更新,解耦式架构重构投机解码训练体系
|
||||
- 面壁智能开源ForgeStencil,双智能体实现CUDA算子全自动优化落地
|
||||
- Swiftlet开源落地,苹果终端实现百亿级MoE模型离线流式部署
|
||||
- FlashAttention 4 beta25迭代升级,完善跨硬件架构底层算力适配
|
||||
- 蚂蚁百灵Ling-3.0-flash权重开源,打造轻量化低时延Agent专用模型
|
||||
- Red Hat推出ASAGO开源项目,轻量化实现AI自动化合规治理
|
||||
- 美国敲定机密AI自愿审查框架,开放权重模型全面豁免监管
|
||||
|
||||
### [2026-08-03](./260803.md)
|
||||
|
||||
- 01 TQP++:把 ML 编译器搬进 GPU 数据库,一套代码覆盖多家硬件
|
||||
- 02 腾讯混元开源 AngelSpec:统一六类投机解码草稿模型的训练流程
|
||||
- 03 Deltafin:一台 M1 Max 跑完整 Kimi K3,重点在流式加载而非实用速度
|
||||
- 04 OpenRouter推出LangChain专用集成包,Python和TypeScript均可直接使用
|
||||
- 05 Bybit开源KaaS:让LLM把零散资料编译成可编辑的Markdown知识库
|
||||
- 06 OpenAI调整两项运行设置,ARC-AGI-3公开集得分从13.3%升至38.3%
|
||||
- 07 欧盟开始执行AI Act相关规则,聊天机器人与AI生成内容进入强制透明阶段
|
||||
|
||||
|
||||
### [2026-07-29](/prefecture/TSZQ_AI_Infra/tree/master/AI-Infra-Daily/260729.md)
|
||||
|
||||
- Sol-Attn 稀疏注意力算法落地,无需训练即可大幅提速视频生成
|
||||
- 月之暗面开源 Kimi K3 完整权重,开源社区迎来首款可落地的3T级智能体大模型
|
||||
- OpenAI 开源 Codex Security 工具链,让智能编码彻底纳入安全研发流程
|
||||
- Hugging Face 公开智能体入侵复盘,为行业提供真实可落地的安全经验
|
||||
- NVIDIA 牵头成立 Open Secure AI Alliance,延续行业联署共识搭建开放AI安全底座
|
||||
|
||||
|
||||
### [2026-07-27](/prefecture/TSZQ_AI_Infra/tree/master/AI-Infra-Daily/260727.md)
|
||||
|
||||
- 8 美元 MCU 跑起 2,890 万参数模型
|
||||
- The Stack v3 公开代码数据集加工过程
|
||||
- claude-thermos 为 Prompt Cache 自动续温
|
||||
- 蚂蚁百灵 Ling-3.0-flash 以 5.1B 激活参数运行 Agent
|
||||
- deer-workflow 分离工作流控制与 Agent 执行
|
||||
- 25 家公司联署反对过早限制开放权重模型
|
||||
|
||||
### [2026-07-24](/prefecture/TSZQ_AI_Infra/tree/master/AI-Infra-Daily/260724.md)
|
||||
|
||||
- Helion 推出 TPU 专属后端,一套 PyTorch 代码兼容 GPU、TPU
|
||||
- PyTorch 2.13 更新,提升端侧 AI 速度并降低显存占用
|
||||
- Ray 2.55 原生支持 Google TPU
|
||||
- NVIDIA 推出 Rubin GPU 与 Vera CPU 新架构
|
||||
- OpenRouter 发布智能体推理降本方案
|
||||
- OpenAI 与 Hugging Face 披露高阶智能体安全漏洞
|
||||
- Anthropic 发布面向 AI 编程的研发安全体系
|
||||
- GOAI 全球开源 AI 大赛启动
|
||||
|
||||
### [2026-07-13](/prefecture/TSZQ_AI_Infra/tree/master/AI-Infra-Daily/260713.md)
|
||||
|
||||
- NVIDIA 拆解 CUDA 内核融合优化方法
|
||||
- PyTorch 2.13 将大模型训练峰值显存最高降低四倍
|
||||
- SGLang Diffusion 适配 AMD MI350X
|
||||
- Intel 更新 Scaler-vLLM,推进 Arc 显卡推理适配
|
||||
- 双机 DGX Spark 运行 DeepSeek-V4-Flash 社区实测
|
||||
- 编码 Agent 暴露恶意仓库攻击风险
|
||||
- 社区讨论 Agent 时代的版本控制
|
||||
- Linux 基金会推动开源数字健康基础设施
|
||||
- Cerebras 布局欧洲 200MW AI 算力
|
||||
|
||||
### [2026-07-08](/prefecture/TSZQ_AI_Infra/tree/master/AI-Infra-Daily/260708.md)
|
||||
|
||||
- HAMi 晋升 CNCF Incubating 项目
|
||||
- PyTorch 升级 Monarch 分布式训练运行时
|
||||
- vLLM 落地 Qwen3-Omni 多模态分层部署方案
|
||||
- HunyuanOCR-1.5 提升轻量 OCR 模型推理性能
|
||||
- Milvus 上线 Force Merge 分片合并功能
|
||||
- MCP 企业集中鉴权能力落地
|
||||
- Anthropic 研究大模型内部认知的可观测与审计
|
||||
- 混元 Hy3 开源,高性能 MoE 架构适配长文本场景
|
||||
|
||||
### [2026-07-06](/prefecture/TSZQ_AI_Infra/tree/master/AI-Infra-Daily/260706.md)
|
||||
|
||||
- 面壁智能推出 ForgeTrain 自动预训练框架
|
||||
- Google 发布 A2UI v0.9 生成式 UI 与 Agent 交互标准
|
||||
- OpenTelemetry 达到 CNCF 最高成熟度
|
||||
- 日志驱动架构重构 AI Agent 运行逻辑
|
||||
- pxpipe 通过图像化上下文优化 AI 编程成本
|
||||
- NVIDIA HORIZON 将 Agent 引入芯片 RTL 设计
|
||||
- vLLM 开源音频推理流水线
|
||||
|
||||
### [2026-07-02](/prefecture/TSZQ_AI_Infra/tree/master/AI-Infra-Daily/260702.md)
|
||||
|
||||
- 美团开源 LongCat-2.0 及配套评测基准
|
||||
- 华为开源 openPangu-2.0-Flash
|
||||
- DSpark 推测解码方案引发社区讨论
|
||||
- Claude Code 地域访问检测逻辑引发争议
|
||||
- OpenClaw 推出移动端客户端
|
||||
- Google 开源两款 AI 开发配套工具
|
||||
|
||||
### [2026-06-29](/prefecture/TSZQ_AI_Infra/tree/master/AI-Infra-Daily/260629.md)
|
||||
|
||||
- LangChain 推出 Deep Agents 提示词缓存方案
|
||||
- DeepSeek 与北京大学团队开源 DSpark
|
||||
- Hugging Face Jobs 支持一条命令启动 vLLM 服务
|
||||
- NVIDIA 开源 NeMo AutoModel
|
||||
- Meta 开源 Astryx 前端设计系统
|
||||
- BrowserBC 将浏览器操作录制为可复用智能体能力
|
||||
- Hacker News 社区讨论智能体 Token 成本管理
|
||||
|
||||
### [2026-06-26](/prefecture/TSZQ_AI_Infra/tree/master/AI-Infra-Daily/260626.md)
|
||||
|
||||
- OpenAI 自研推理芯片 Jalapeño 曝光
|
||||
- Linux 基金会与 NVIDIA 推出 Akrites 安全项目
|
||||
- NVIDIA 发布全液冷 AI 工厂方案
|
||||
- 阿里开源 Qwen-AgentWorld 系列世界模型
|
||||
- FAST-LIVO2 获 IEEE TRO 傅京孙纪念最佳论文奖
|
||||
|
||||
### [2026-06-24](/prefecture/TSZQ_AI_Infra/tree/master/AI-Infra-Daily/260624.md)
|
||||
|
||||
- Claude Tag 支持 Slack 团队异步 AI 协作
|
||||
- Anthropic 发布 Claude Agent SDK
|
||||
- IBM 公开 CUGA 智能体框架案例
|
||||
- Prime Intellect 发布万亿参数模型强化学习框架
|
||||
- vLLM 接入 NVIDIA DFlash
|
||||
- AMD 更新 librocdxg,优化 WSL GPU 使用体验
|
||||
- Zyphra 开源 ZAYA1-8B
|
||||
- 百度开源 Unlimited-OCR
|
||||
- RAGFlow GitHub Star 突破七万
|
||||
- OpenAI 发起开源项目安全漏洞修复计划
|
||||
|
||||
### [2026-06-22](/prefecture/TSZQ_AI_Infra/tree/master/AI-Infra-Daily/260622.md)
|
||||
|
||||
- Google 开源 Kubernetes 原生强化学习框架 OpenRL
|
||||
- llm-d 成为 CNCF Sandbox 项目
|
||||
- Linux 7.2 移除 `strncpy`
|
||||
- Project Valhalla 进入 JDK 28 预览版
|
||||
- ClickHouse 开源十周年
|
||||
- 统一科研大模型 LOGOS 开源
|
||||
- Data2Story 将表格数据转化为可溯源交互式新闻
|
||||
- Meta 员工反对公司采集工作数据训练 AI
|
||||
- NVIDIA ACE 游戏 AI 工具开放测试
|
||||
- 小米开源 Xiaomi Miloco 2.0
|
||||
|
||||
### [2026-06-18](/prefecture/TSZQ_AI_Infra/tree/master/AI-Infra-Daily/260618.md)
|
||||
|
||||
- NVIDIA 发布 NemoClaw、Agent Toolkit 与 ENPIRE
|
||||
- 智谱开源 GLM-5.2
|
||||
- 通义千问发布 Qwen-Robot Suite
|
||||
- MiniMax 开源 MSA 稀疏注意力推理内核
|
||||
- Google 上线 TPU Developer Hub
|
||||
- 社区关注 SubQ 轻量长上下文模型
|
||||
- Forge 护栏提升小模型 Agent 任务表现
|
||||
- Cursor 发布 Agent 原生代码托管平台 Origin
|
||||
- Firecrawl 降低开发者使用门槛
|
||||
- EC2 与 Firecracker 实现浏览器快速冷启动
|
||||
|
||||
### [2026-06-16](/prefecture/TSZQ_AI_Infra/tree/master/AI-Infra-Daily/260616.md)
|
||||
|
||||
- “Open source AI must win”引发开源 AI 社区讨论
|
||||
- Loop Engineering 成为 AI 编程热门方向
|
||||
- MiniMax 开源 M3,Kimi 推出 Code 高速版
|
||||
- 微信支付 AI 接入工具箱升级 2.0
|
||||
- Chainguard 发起 Athena 开源安全联盟
|
||||
|
||||
### [2026-06-12](/prefecture/TSZQ_AI_Infra/tree/master/AI-Infra-Daily/260612.md)
|
||||
|
||||
- 腾讯混元升级开源推理算子库 HPC-Ops
|
||||
- MiniMax 开源稀疏注意力算子库 MSA
|
||||
- Apache Burr 开源 AI Agent 运行框架
|
||||
- HelixDB 开源 AI Memory 图向量数据库
|
||||
- NVIDIA NCCL EP、Weaviate、Milvus 等开源项目更新
|
||||
|
||||
---
|
||||
|
||||
## 内容范围
|
||||
|
||||
AI Infra Daily 主要关注以下方向:
|
||||
|
||||
- AI 芯片、GPU、TPU 与底层算子优化
|
||||
- 分布式训练、推理加速与模型服务
|
||||
- PyTorch、vLLM、SGLang、Ray 等基础设施项目
|
||||
- 大模型架构、多模态模型与世界模型
|
||||
- Agent Runtime、Memory、MCP、RAG 与向量数据库
|
||||
- AI 编程、智能体安全与可观测性
|
||||
- 高质量开源项目及开发者社区讨论
|
||||
|
||||
## 阅读说明
|
||||
|
||||
README 中的标题经过简化,方便快速浏览。新闻详情、图片、项目链接和信息来源均以对应日期的日报原文为准。
|
||||
|
After Width: | Height: | Size: 1.8 MiB |
|
After Width: | Height: | Size: 401 KiB |
|
After Width: | Height: | Size: 175 KiB |
|
After Width: | Height: | Size: 41 KiB |
|
After Width: | Height: | Size: 112 KiB |
|
After Width: | Height: | Size: 202 KiB |
|
After Width: | Height: | Size: 233 KiB |
|
After Width: | Height: | Size: 128 KiB |
|
After Width: | Height: | Size: 159 KiB |
|
After Width: | Height: | Size: 9.7 MiB |
|
After Width: | Height: | Size: 444 KiB |
|
After Width: | Height: | Size: 3.5 MiB |
|
After Width: | Height: | Size: 130 KiB |
|
After Width: | Height: | Size: 770 KiB |
|
After Width: | Height: | Size: 21 KiB |
|
After Width: | Height: | Size: 284 KiB |
|
After Width: | Height: | Size: 207 KiB |
|
After Width: | Height: | Size: 123 KiB |
|
After Width: | Height: | Size: 375 KiB |
|
After Width: | Height: | Size: 331 KiB |
|
After Width: | Height: | Size: 422 KiB |
|
After Width: | Height: | Size: 226 KiB |
|
After Width: | Height: | Size: 906 KiB |
|
After Width: | Height: | Size: 147 KiB |
|
After Width: | Height: | Size: 5.1 MiB |
|
After Width: | Height: | Size: 849 KiB |
|
After Width: | Height: | Size: 194 KiB |
|
After Width: | Height: | Size: 142 KiB |
|
After Width: | Height: | Size: 63 KiB |
|
After Width: | Height: | Size: 360 KiB |
|
After Width: | Height: | Size: 3.0 MiB |
|
After Width: | Height: | Size: 1.2 MiB |
|
After Width: | Height: | Size: 204 KiB |
|
After Width: | Height: | Size: 248 KiB |
|
After Width: | Height: | Size: 527 KiB |
|
After Width: | Height: | Size: 707 KiB |
|
After Width: | Height: | Size: 591 KiB |
|
After Width: | Height: | Size: 467 KiB |
|
After Width: | Height: | Size: 470 KiB |
|
After Width: | Height: | Size: 250 KiB |
|
After Width: | Height: | Size: 1.2 MiB |
|
After Width: | Height: | Size: 233 KiB |
|
After Width: | Height: | Size: 301 KiB |
|
After Width: | Height: | Size: 134 KiB |
|
After Width: | Height: | Size: 429 KiB |
|
After Width: | Height: | Size: 466 KiB |
|
After Width: | Height: | Size: 220 KiB |
|
After Width: | Height: | Size: 2.0 MiB |
|
After Width: | Height: | Size: 207 KiB |
|
After Width: | Height: | Size: 249 KiB |
|
After Width: | Height: | Size: 760 KiB |
|
After Width: | Height: | Size: 359 KiB |
|
After Width: | Height: | Size: 1.1 MiB |
|
After Width: | Height: | Size: 1.0 MiB |
|
After Width: | Height: | Size: 1.6 MiB |
|
After Width: | Height: | Size: 215 KiB |
|
After Width: | Height: | Size: 366 KiB |
|
After Width: | Height: | Size: 748 KiB |
|
After Width: | Height: | Size: 545 KiB |
|
After Width: | Height: | Size: 179 KiB |
|
After Width: | Height: | Size: 542 KiB |
|
After Width: | Height: | Size: 1.6 MiB |
|
After Width: | Height: | Size: 258 KiB |
|
After Width: | Height: | Size: 376 KiB |
|
After Width: | Height: | Size: 470 KiB |
|
After Width: | Height: | Size: 454 KiB |
|
After Width: | Height: | Size: 260 KiB |
|
After Width: | Height: | Size: 509 KiB |
|
After Width: | Height: | Size: 1.1 MiB |
|
After Width: | Height: | Size: 2.7 MiB |