mxokdzntjytqyjzywjz/eval/reports/llama_prompt_cache/linux-cpu-resource.md

1.7 KiB
Raw Blame History

Linux CPU L2 资源占用摘要

本文件是去路径化的公开摘要。原始 GNU time 输出只保存在本地远端证据区,不进入提交包。

测试环境

  • 证据等级L2普通 Linux CPU 固定环境,不等同于 openKylin/Kylin L3
  • CPUIntel Xeon Gold 5218R 2.10 GHz
  • CPU 亲和集合:0-3llama-server 推理线程数 4
  • 模型HuggingFaceTB SmolLM 135M Instruct Q8
  • 模型 SHA-256a98d3857b95b96c156d954780d28f39dcb35b642e72892ee08ddff70719e6220
  • 运行时源码llama.cpp b8470commit db9d8aa428012cc5593e18635d4c3c54095f5138
  • 协议100 Case每个 Case 依次执行 Cold、Warm Same、Warm Changed Suffix共 300 次请求;每次生成 1 Token。

GNU time 观测

指标 结果
Wall time 2 min 59.77 s
User CPU time 669.95 s
System CPU time 2.80 s
平均 CPU 占用 374%
最大 RSS 251428 KiB245.54 MiB
Major page faults 14
Swaps 0
Exit status 0

该 RSS 是完整 benchmark 进程树的峰值观测,用于说明本次 135M 模型机制验证的资源量级,不代表 Qwen3 模型、长期驻留服务或 openKylin 真机结果。性能主报告见 linux-cpu.mdlinux-cpu.json

完整性

  • 原始资源记录 SHA-2563df89aef518850f10d888576aaf251cd601170519faee37168205149a62485de
  • 主 JSON 报告 SHA-256e045468f700aa7524d654222cc8851c2c7dbe3cb22946349df041721c13a3e5a
  • 主 Markdown 报告 SHA-256843fc2db710fb6fd8f3d86da95992e96ffad8c98037d25d4c71cd2a51ac8bf1d
  • 公开报告未保存 Prompt、生成内容、稳定前缀或动态后缀原文
  • 精准遗忘后关联 Slot 擦除成功率 100%runtime_cache_residue_unknown=false