技术分享
工程团队的实战记录——推理调优、千卡训练、网络拓扑、合规架构、算力选型与降本案例。每月更新。
2026年9月2 篇
2026年5月7 篇
GPU集群的IB组网入门——从带宽到Rail-aligned拓扑
GPU越来越快之后,为什么网络反而成了训练集群的瓶颈?从InfiniBand、RDMA、PCIe Affinity到Rail-aligned拓扑,理解GPU集群如何把网络带宽真正送到GPU。
NCCL-tests实战:多机多卡集群上线前的通信基线与性能验收
从GPU拓扑、GPU-NIC亲和性与GPUDirect RDMA出发,使用NCCL-tests建立单机、双机和多节点通信基线,并通过日志与对照测试定位性能异常。
Hugging Face模型权重加速下载实战:镜像、ModelScope与团队缓存
大模型权重下载慢、易中断?从hf-mirror、ModelScope到aria2并发与团队缓存,讲清可用命令、授权边界、完整性校验和真实带宽上限。
GPU 监控指标与 XID 故障速查——一线运维的 6 张表
从 nvidia-smi、DCGM 指标到 Xid 31、79、119/120,梳理一线排查、日志取证、隔离恢复与硬件升级边界,避免把告警直接等同于返厂。
用 uv 替代 pip / Poetry:AI 项目的包管理与源配置
从旧项目迁移到 uv,配好国内 PyPI 镜像与 PyTorch CUDA 源,分清 --locked 和 --frozen,并把依赖管理接入 CI 与 Docker。
给 AI 工程师的 Kubernetes 速通:概念与最小可用方案
从单卡训练 Job 到 vLLM 推理服务,讲清 Pod、Deployment、PVC、GPU 资源声明与排障顺序,并提供可拆分使用的完整 YAML。
Docker 基本使用与镜像源配置(2026)
从 GPU 容器常用命令到镜像加速、代理、多架构构建和离线分发,分清配置范围,减少拉取超时与环境差异。
