
在阿里云 GPU 云服務器https://www.aliyun.com/product/egs如gn6i,gn7,ecs-gn8等實例上安裝 AI 環(huán)境核心在于驅動、CUDA 工具包和深度學習框架的匹配。??重要前提不要自己從 NVIDIA 官網下載驅動編譯極易出現(xiàn)版本沖突導致內核崩潰。首選方案使用阿里云提供的AI 加速鏡像Deep Learning AMI或官方預裝鏡像。這是最穩(wěn)定、最省時的方法。次選方案如果必須從零搭建請嚴格遵循“驅動 - CUDA - cuDNN - PyTorch/TensorFlow”的順序。以下是兩種具體操作路徑 方案一一鍵部署推薦新手/快速上手適用場景不想折騰配置只想盡快跑通模型如 Stable Diffusion, LLM 推理。步驟 1創(chuàng)建服務器時選擇鏡像登錄阿里云 ECS 控制臺創(chuàng)建實例。在鏡像選擇階段切換到“公共鏡像”或“應用鏡像”標簽頁。尋找名為“GPU 計算型”或“AI 開發(fā)環(huán)境”相關的鏡像。例如Ubuntu 20.04/22.04 GPU Deep Learning Image。這些鏡像通常預裝了NVIDIA Driver CUDA 11.x/12.x cuDNN PyTorch/TensorFlow Jupyter Notebook。步驟 2驗證環(huán)境SSH 登錄服務器后運行以下命令檢查是否成功# 1. 檢查顯卡驅動 nvidia-smi # 如果能看到顯卡型號、驅動版本和 CUDA Version說明驅動正常。 # 2. 檢查 CUDA 版本 nvcc --version # 3. 檢查 Python 和 PyTorch python3 -c import torch; print(torch.__version__); print(torch.cuda.is_available()) # 如果輸出 True說明 GPU 加速已就緒。步驟 3啟動開發(fā)環(huán)境大多數(shù) AI 鏡像都預裝了 Jupyter Lab你可以直接訪問http://你的公網IP:8888即可在瀏覽器中進行代碼編寫和模型訓練。 方案二手動從零搭建適合高級用戶/定制需求適用場景需要特定版本的 CUDA或者使用的是自定義基礎鏡像如純 Ubuntu Server。假設你使用的是Ubuntu 22.04系統(tǒng)。第一步安裝 NVIDIA 顯卡驅動阿里云 ECS 的 GPU 實例通常已經安裝了驅動但如果是裸金屬或自定義鏡像可能需要重裝。注意阿里云官方建議通過ubuntu-drivers自動安裝避免手動.run文件安裝導致的內核不匹配。# 更新軟件源 sudo apt update sudo apt upgrade -y # 安裝推薦驅動 sudo ubuntu-drivers autoinstall # 重啟服務器使驅動生效 sudo reboot重啟后再次運行nvidia-smi確認驅動加載。第二步安裝 CUDA Toolkit關鍵原則驅動版本決定了你能安裝的最高CUDA 版本但不能低于它。 查看nvidia-smi輸出的CUDA Version: 12.4這意味著你最高可以安裝 12.4 版本的 CUDA Toolkit也可以安裝更低版本如 11.8只要兼容即可。以安裝CUDA 11.8(目前最穩(wěn)定的 AI 訓練版本) 為例# 1. 下載 CUDA 11.8 的 runfile 安裝包 (從 NVIDIA 官網獲取鏈接) wget https://developer.download.nvidia.com/compute/cuda/11.8.0/local_installers/cuda_11.8.0_520.61.05_linux.run # 2. 賦予執(zhí)行權限 chmod x cuda_11.8.0_520.61.05_linux.run # 3. 開始安裝 (注意安裝過程中會問你是否安裝驅動選 NO因為上面已經裝過了) sudo ./cuda_11.8.0_520.61.05_linux.run --silent --toolkit --samples/usr/local/cuda-11.8/samples # 4. 配置環(huán)境變量 echo export PATH/usr/local/cuda-11.8/bin${PATH::${PATH}} ~/.bashrc echo export LD_LIBRARY_PATH/usr/local/cuda-11.8/lib64${LD_LIBRARY_PATH::${LD_LIBRARY_PATH}} ~/.bashrc source ~/.bashrc # 5. 驗證 nvcc --version第三步安裝 cuDNNcuDNN 是 NVIDIA 的深度學習庫必須與 CUDA 版本嚴格對應。去 NVIDIA Developer 網站下載對應 CUDA 11.8 的 cuDNN for Linux。解壓后將頭文件和庫文件復制到 CUDA 目錄tar -xzvf cudnn-linux-x86_64-8.9.0.131_cuda11-archive.tar.xz sudo cp cudnn-*-archive/include/cudnn*.h /usr/local/cuda/include sudo cp -P cudnn-*-archive/lib/libcudnn* /usr/local/cuda/lib64 sudo chmod ar /usr/local/cuda/include/cudnn*.h /usr/local/cuda/lib64/libcudnn*第四步安裝深度學習框架 (PyTorch 示例)千萬不要用 pip install pytorch 默認源一定要去 PyTorch 官網 根據(jù)你的 CUDA 版本生成命令。對于 CUDA 11.8# 使用 conda 管理虛擬環(huán)境 (推薦) conda create -n ai_env python3.10 conda activate ai_env # 安裝 PyTorch (指定 CUDA 11.8) pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu118第五步驗證 AI 環(huán)境創(chuàng)建一個測試腳本test_gpu.pyimport torch print(fCUDA Available: {torch.cuda.is_available()}) print(fDevice Count: {torch.cuda.device_count()}) print(fCurrent Device Name: {torch.cuda.get_device_name(0)}) print(fPyTorch Version: {torch.__version__}) # 簡單的矩陣乘法測試速度 a torch.randn(1000, 1000).cuda() b torch.randn(1000, 1000).cuda() c torch.mm(a, b) print(GPU Inference Test Passed!) 常見問題排查 (Troubleshooting)nvidia-smi報錯 NVIDIA-SMI has failed because it couldnt communicate with the NVIDIA driver原因內核更新后驅動模塊未重新加載。解決重啟服務器 (sudo reboot)。如果還不行嘗試sudo modprobe nvidia。PyTorch 報RuntimeError: Found no NVIDIA driver on your system.原因雖然nvidia-smi能跑但 Python 找不到 CUDA 庫。解決檢查~/.bashrc中的LD_LIBRARY_PATH是否正確設置并執(zhí)行source ~/.bashrc。顯存不足 (OOM)解決減小 Batch Size。使用梯度累積 (Gradient Accumulation)?;旌暇扔柧?(Mixed Precision, FP16/BF16)。清理其他進程nvidia-smi查看是否有僵尸進程占用顯存kill -9 PID殺掉。如何遠程連接 Jupyter阿里云安全組需開放8888端口。啟動時加參數(shù)jupyter lab --ip0.0.0.0 --port8888 --no-browser --allow-root 最終建議對于絕大多數(shù)用戶直接使用阿里云 Marketplace 中的“Deep Learning Base Image”是最優(yōu)解。它們已經處理好了所有復雜的依賴關系你只需要關注代碼本身。只有在有極特殊的版本需求時才考慮手動搭建。