AI 算力
-
国产AI计算卡全景解读:从参数到场景的选择指南
面对AI浪潮,国产算力芯片百花齐放。本文梳理主流国产AI计算卡的核心参数与特性,解析算力、显存、带宽等关键指标,为初学者提供从技术规格到场景选型的入门参考。
-
训练卡采购先算这五本账:昇腾平台的参数阅读法
NPU表格里的算力、显存、带宽和功耗只有放回模型、软件与集群约束中才有意义。本文给出一套从工作负载反推昇腾训练卡与推理卡的选型方法。
-
别只盯峰值算力:深度学习GPU的工作负载匹配法
显存、精度、带宽、互联和功耗共同决定深度学习任务的真实表现。本文把庞杂的GPU参数表转换成一套可复现实验流程,帮助训练与推理项目建立候选短名单。
-
Windows配置GPU计算环境:先锁兼容矩阵,再逐层验收CUDA链路
Windows上的GPU环境不是安装包越新越好,而是驱动、工具链、运行库、深度学习框架和Python环境必须形成相容组合。先从目标框架反推版本,再分别验证驱动、编译工具、动态库和框架设备,能显著减少DLL缺失与多版本冲突。
-
Linux 更换 CUDA 的低风险路线:先识别来源,再并行验证与回退
CUDA 升级最危险的做法是先删旧版再判断依赖。本文从驱动、工具链、运行库和框架四层盘点现状,说明包管理与独立安装器的差异,并设计并行安装、验证及回滚流程。
-
Keras单机多GPU训练:MirroredStrategy、全局批次与性能验收
现代Keras多卡训练应优先使用TensorFlow分布式策略。本文说明副本同步、全局批次、数据分片、模型创建、指标与检查点,并用吞吐和扩展效率判断多卡是否值得。
-
训练前先算清显存账:参数、激活、梯度和优化器状态逐项估算
模型文件大小只是显存预算的一部分,训练峰值还由梯度、优化器状态、前向激活、临时工作区与框架分配行为共同决定,必须分项估算再用实测校准。
-
Linux配置TensorFlow GPU:驱动、隔离环境与三层验证
当前官方pip路径可在环境内安装TensorFlow所需CUDA组件,宿主机主要维护NVIDIA驱动。本文给出环境隔离、安装、设备识别、真实计算与故障分层。
-
先锁运行契约再装TensorFlow:跨平台环境的分岔与验收
TensorFlow安装失败常源于平台、Python、硬件后端和项目版本没有形成同一份兼容契约。本文从CPU基线开始,给出Windows、Linux与macOS的路线选择、分层诊断、隔离升级和可回滚验收方法。