如何在晨涧云上租用 GPU 云主机

本教程比较 GPU 云主机与云容器的使用边界,完整演示晨涧云云主机的选卡、镜像、规格、磁盘、计费、创建、远程连接和验收流程,并整理驱动、数据与端口管理注意事项。

Ubuntu 远程桌面正在使用 GPU 云主机完成三维渲染
晨涧云 GPU云主机 AI算力 云容器 远程桌面 AIGC

这篇教程带你在晨涧云上创建一台 GPU 云主机,并完成从选型到远程连接的完整闭环。你会先判断任务究竟适合云容器还是云主机,再依次选择 GPU、系统镜像、CPU 与内存规格、磁盘和租用时长,最后进入系统检查 GPU 与软件环境。

晨涧云同时提供云主机和云容器。只跑 Python、Notebook、模型训练或批量推理时,两种形态都能完成任务;云主机在此基础上还提供独享操作系统、GPU 直通和桌面环境。需要运行图形界面软件的 AIGC、渲染、设计用户,或者想把云端 GPU 当成一台完整远程电脑的团队,优先选择云主机通常更稳妥。

云主机与云容器应该怎么选

云容器是隔离的进程环境,通常共享宿主机内核;云主机提供独享操作系统,更接近一台可以远程使用和维护的电脑。容器启动轻、镜像复制方便,云主机则覆盖更完整的系统、驱动、桌面和软件安装需求。

判断项

云容器

云主机

常见入口

SSH、JupyterLab、WebIDE

SSH、RustDesk、WebUI;Windows 还可用 RDP

系统形态

与宿主机共享内核的隔离环境

独享操作系统环境

图形桌面

通常不提供完整桌面

Windows 与 Ubuntu 均支持远程桌面

GPU 使用

由平台映射 GPU 资源

晨涧云为 GPU 直通、显卡独享

驱动管理

通常依赖宿主机驱动,用户调整空间有限

可按项目需要更换 GPU 驱动

适合任务

训练、微调、推理、Notebook、批处理

容器类任务,以及 AIGC、渲染、设计、桌面软件和完整开发环境

主要优势

轻量、创建快、环境复制方便

功能覆盖广、系统权限完整、桌面交互友好

哪些场景适合云容器

  • 代码和依赖已经适配 Linux,只需运行训练、微调或推理任务。
  • 主要通过 JupyterLab、SSH 或 VS Code 远程开发,不依赖完整桌面。
  • 任务使用平台已有镜像,且不需要自行调整 GPU 驱动。
  • 希望按小时随开随停,优先考虑轻量使用和成本弹性。
  • 熟悉 Linux、conda 和容器目录,能自己处理端口映射与数据持久化。

AutoDL 的常用 GPU 实例属于 Docker 容器实例,控制台工作流以 JupyterLab、终端和镜像为主。标准 Linux 深度学习实验使用这种形态很直接。

为什么更推荐云主机

Ubuntu 云主机基本能覆盖云容器的大部分功能需求:可以通过 SSH 和 VS Code 开发,可以使用 conda、Docker、JupyterLab,也能运行训练、推理和 Web 服务。同时,它还保留 Ubuntu 桌面,适合需要文件管理器、浏览器、可视化工具、IDE 或图形化安装器的工作流。

Windows 云主机则解决了另一类刚性需求:必须运行 Windows 原生 GPU 软件、插件或桌面应用。当软件依赖 Windows 系统时,常见的 Linux 云容器无法替代 Windows 云主机。

以下用户尤其适合选云主机:

  • AIGC 创作者:要在 ComfyUI、Stable Diffusion 等工具之外管理模型、插件、素材和输出,并通过桌面预览与整理结果。
  • 渲染和三维用户:要运行 Blender、渲染器、建模软件或其他图形界面程序,并随时查看画面。
  • 设计用户:工作流同时包含浏览器、素材管理、图形软件和 AI 插件,需要像本地电脑一样拖放文件和切换应用。
  • 开发与科研用户:既要 SSH、Docker、conda 和命令行,又需要 Ubuntu 桌面、图形化 IDE 或科学可视化软件。
  • 驱动版本有明确要求的项目:云主机允许更换 GPU 驱动,适合需要匹配特定 CUDA 兼容范围的环境。

有些需求在“云容器与云主机二选一”时只能由云主机满足。最明确的是 Windows 原生 GPU 桌面软件;另一个是必须自行更换 GPU 驱动的项目,因为容器看到的 GPU 驱动通常来自宿主机,无法在容器内部独立替换。需要完整 Windows 或 Ubuntu 桌面交互时,也应直接选择云主机。

云主机覆盖更广,不代表所有任务都要选它。只跑短时脚本、追求小时级按需计费时,云容器仍可能更省。若任务涉及修改内核、特殊硬件直通或平台未开放的底层能力,下单前应单独确认。

创建前先写一张配置单

项目

需要确认的内容

工作负载

训练、推理、ComfyUI、三维渲染、科研仿真或设计软件

操作系统

Windows、Ubuntu 或 CentOS;是否需要桌面

GPU

最低显存、是否需要多卡、软件是否支持该卡

驱动与 CUDA

项目要求的驱动兼容范围、CUDA、框架版本

CPU 与内存

数据预处理、编译、渲染或多进程任务的需求

磁盘

软件、模型、数据集、缓存与输出的预计容量

网络

是否要从公网访问 Web 服务,需要几个端口

时长与预算

预计使用天数、调试时间和可接受总费用

数据策略

上传哪些文件、结果备份到哪里、是否涉及敏感数据

如果项目有 README 或安装文档,先找出操作系统、GPU 驱动、CUDA、Python 和框架版本。显存只决定模型能否装下;系统、驱动、CPU、内存和磁盘不匹配,同样会让实例无法工作。

完整流程:租用一台晨涧云 GPU 云主机

第一步:登录并进入算力市场

完成账号注册或登录后,进入“算力市场”。平台会展示云主机、云容器等产品入口,本教程选择“云主机”。在显卡列表中找到符合显存和预算要求的型号,点击“立即租用”进入配置页。

列表中的价格可能是最低展示价,实际金额以下单配置页为准。第一次使用建议先租单卡、短周期实例,完成兼容性测试后再续租或升级。

第二步:选择系统镜像

在配置页按“应用场景 → 操作系统 → 系统镜像”选择镜像。晨涧云当前预装环境包括 Windows 10、Ubuntu 22.04/20.04/18.04 和 CentOS 9;最终以创建页的可选镜像为准。Windows 与 Ubuntu 支持桌面,CentOS 主要通过 SSH 使用。

选择原则:

  • Windows 原生软件选择 Windows 镜像。
  • 深度学习、Docker、JupyterLab 和 Linux 开发优先选择 Ubuntu。
  • 需要图形化 Linux 工作流时,选择 Ubuntu Desktop 镜像。
  • 依赖 CentOS 生态且不需要桌面时,再考虑 CentOS 9。
  • 已有明确版本要求时,先匹配系统、驱动与 CUDA,再看预装软件。

部分镜像已安装显卡驱动、CUDA、Docker、Anaconda、PyTorch、PyCharm 和 VS Code 等环境。预装版本不一定适合每个项目,创建后仍要验收。

第三步:选择 GPU 和数量

设置 GPU 型号与“GPU数量”。晨涧云云主机使用 GPU 直通,显卡由实例独享。第一次迁移项目建议从单卡开始;多卡只有在代码支持数据并行、模型并行,或确实要并发运行多项任务时才会带来收益。

选卡顺序:

  1. 显存能否容纳模型、输入、缓存和桌面程序。
  2. 软件是否支持该 GPU 架构与驱动版本。
  3. 预计完成时间和总费用,而不只看单日价格。
  4. 渲染软件是否需要专业卡特性,训练代码是否真正支持多卡。

第四步:选择实例规格

配置页会提供不同 CPU 与内存组合。训练、渲染和科学计算都可能受 CPU、内存或磁盘 IO 限制。大量素材解码、数据增强、多进程加载、着色器编译和仿真任务尤其不能只看 GPU。

有本地运行数据时参考峰值占用;没有数据时,先选能跑通小样本的规格,创建后观察 CPU、内存和 GPU 利用率,再决定是否升级。

第五步:规划系统盘和数据盘

晨涧云当前租用文档写明,云主机默认提供 200 GB 系统盘和 100 GB 数据盘,并允许按需扩大数据盘。下单前按下面估算:

所需空间 = 系统与软件 + 模型权重 + 数据集 + 缓存 + 输出结果 + 预留空间

系统盘用于操作系统和软件,数据盘用于模型、数据集、素材和结果。平台文档提示默认磁盘在结束使用后有保留期限,扩容后的保留规则可能不同;重要文件仍要备份到本地或可靠存储。

第六步:选择租用时长并核对订单

根据预计用量选择按天、周或月租用。平台可能按时长和多卡数量提供折扣,库存、价格和活动会变化,应以结算页为准。

提交前检查:

  • 产品类型是云主机,而非云容器。
  • 操作系统、桌面和预装环境符合需求。
  • GPU 型号、显存和数量正确。
  • CPU、内存和磁盘足够。
  • 驱动与 CUDA 有可行的兼容方案。
  • 租用时长、最终金额和数据保留规则已确认。

第七步:创建实例并等待运行

点击“立即创建”后,平台开始准备实例。官方流程给出的参考时间约为 10~15 分钟。页面会跳转到控制台,等实例状态变为“运行中”再连接;如果长时间没有完成,查看页面提示并联系平台支持,不要重复下单。

第八步:从控制台连接系统

从网站顶部进入“控制台”,在左侧打开“云主机实例”。实例列表可以查看运行状态、配置、租用信息、系统密码、端口和该镜像的专属操作指南。

  • Windows 可使用 RDP、RustDesk 或 WebUI。
  • Ubuntu 可使用 SSH、RustDesk、WebUI,也可安装平台预置的其他远程工具。
  • CentOS 9 主要通过 SSH 连接。

第一次连接时,使用当前实例“操作指南”提供的地址、端口、用户名和密码。不要照搬其他实例的连接参数。

第九步:验收 GPU、驱动与软件

进入系统后先验收,再上传大数据或安装复杂软件。在 Ubuntu 终端、Windows PowerShell 或命令提示符中运行:

nvidia-smi

确认 GPU 型号、数量和显存与订单一致,并记录当前驱动版本。使用 PyTorch 镜像时继续检查:

python -c "import torch; print(torch.__version__); print(torch.cuda.is_available()); print(torch.cuda.device_count())"

预期 torch.cuda.is_available() 返回 True,GPU 数量与订单一致。AIGC、渲染或设计任务还要打开目标桌面软件,用小素材完成一次加载、运算、预览和保存。

验收清单:

  • GPU 型号、数量和显存符合订单。
  • 系统、桌面和远程连接正常。
  • 驱动、CUDA 与框架满足项目要求。
  • 数据盘可读写,空间足够。
  • 小样本训练、推理、渲染或设计操作可完成。
  • 输出文件可以下载或同步到备份位置。

更换 GPU 驱动时要注意什么

晨涧云云主机支持更换 GPU 驱动。Windows 可卸载现有 NVIDIA 驱动后安装目标版本;Ubuntu 也可以按平台驱动安装文档调整。驱动变更会影响 CUDA、框架和桌面程序,操作前先记录原版本并保存数据。

建议按这个顺序处理:

  1. 从项目文档确定需要的驱动兼容范围,不要只看 CUDA Toolkit 版本号。
  2. 记录 nvidia-smi、CUDA、PyTorch 或目标软件的当前版本。
  3. 保存训练 checkpoint,关闭所有 GPU 任务。
  4. 按对应系统文档卸载并安装驱动,过程中允许实例重启。
  5. 重启后重新运行 nvidia-smi 和小样本任务。

驱动并非越新越好。只要当前驱动满足框架要求,通常没有必要为了追新版本冒险调整稳定环境。

对外访问服务与端口

云主机内运行 ComfyUI、JupyterLab 或推理 API 时,先用 localhost 验证,再配置公网访问。控制台会展示预留端口映射关系,外部通过“公网 IP + 公网端口”访问。

只开放必需端口,不要把数据库、系统管理面板或没有鉴权的应用直接暴露到公网。默认预留端口数量有限,需要更多端口时按控制台提示联系平台确认。

使用中的注意事项

重启、改密码和扩容前先停任务

控制台支持续租、重启、修改密码、磁盘扩容和重装系统。重启会中断任务,修改密码和磁盘扩容也可能触发重启。操作前先保存 checkpoint、写完日志并确认没有关键进程。

重装系统前必须备份

重装系统会删除实例数据,无法恢复。需要换系统或重置环境时,先备份代码、数据、模型、配置和结果。

换卡后重新获取连接信息

停机续租或更换 GPU 时可以保留系统环境与数据,但资源迁移可能改变 IP 等连接信息。完成后回到控制台获取新参数,并重新做 GPU 验收。

价格、库存和保留规则会变化

正式长租前先短期试跑,确认远程连接、软件兼容性、驱动、端口、性能和备份方式,再决定是否续租。

敏感数据先处理再上传

客户素材、未公开数据集、私有模型和访问凭据应先做脱敏与权限检查。密钥使用环境变量或项目支持的凭据管理方式,任务结束后清理临时文件。

几个实用小 Tips

  • 创建后先做 10 分钟验收,尽早发现镜像、GPU 或驱动不匹配。
  • 调试与正式运行分开,先用小数据、低分辨率或短 epoch 跑通。
  • 保存镜像名称、系统、GPU、驱动、CUDA、Python、框架和启动命令。
  • 长任务写日志并定期保存 checkpoint,远程桌面断开不应中断计算。
  • 在预计完成时间和租期到期前设置提醒,及时下载结果或续租。
  • 桌面卡顿先区分网络延迟和 GPU 计算性能,分别查看监控与任务日志。
  • Web 服务先在实例内测试,确认可用后再配置公网端口。

为什么晨涧云云主机适合作为默认选择

对于希望减少选型纠结的个人和小团队,晨涧云 Ubuntu 云主机可以作为更通用的起点。它既能完成 SSH、Docker、conda、JupyterLab、训练、推理和 API 服务等常见容器任务,也提供 Ubuntu 桌面、GPU 直通和驱动更换能力。需要 Windows 原生软件时,再选择 Windows 云主机。

云容器仍适合短时、轻量、纯命令行任务,尤其是明确需要小时级随开随停时。但只要工作流包含图形界面、AIGC 素材管理、渲染、设计软件、桌面预览或特定驱动要求,直接选择云主机能减少后续迁移和环境改造。完整流程可以压缩成六步:选云主机、匹配系统镜像、配置 GPU 与主机规格、规划磁盘和租期、等待创建、连接后验收。把产品形态选对,往往比单纯比较显卡单价更重要。