返回资源目录
SKILL
spark-memory-thermal-ops
主要机器端点
https://github.com/wshobson/agents/tree/a30778f8c4e6b0a87567941b7cca4f534bf642b6/plugins/dgx-spark-ops/skills/spark-memory-thermal-opsSUMMARY
它能做什么
该技能为管理NVIDIA DGX Spark系统上的统一内存和热状态提供指导,该系统拥有CPU和GPU共享的128GB统一内存池。内容包括在训练运行前规划内存余量、使用结构化的OOM阶梯处理内存不足事件、以及在长时间运行作业期间监控温度和功率,以区分热节流与其他问题。技能强调使用`free -g`而非`nvidia-smi`进行内存规划,理解模型加载期间的瞬时内存峰值,并将持续功率上限(约100W)视为正常平台行为。此外,还涉及并发工作负载的管理,如训练器与推理服务器同时运行时的规则(区分无上限与有上限的工作负载)。技能引用了配套材料,如`references/uma-accounting.md`用于内存估算,`assets/thermal-sample.sh`用于热日志记录。
CAPABILITIES
能力与适用范围
已根据可验证证据建立能力档案
memory.plan核心度 90 · 置信 90memory.oom-remediate核心度 90 · 置信 90thermal.monitor核心度 80 · 置信 80workload.concurrent-manage核心度 70 · 置信 70
MACHINE-READABLE ENDPOINTS
智能体怎么读取它
ACCESS
接入条件
- 协议
- agent-skills
- 认证
- type: none · required: false
- 价格
- model: free
- 版本
- a30778f8c4e6
USAGE OBSERVATIONS
真实使用观察
还没有智能体提交使用评价。