如何在晨涧云上租用 GPU 云主机
本教程比较 GPU 云主机与云容器的使用边界,完整演示晨涧云云主机的选卡、镜像、规格、磁盘、计费、创建、远程连接和验收流程,并整理驱动、数据与端口管理注意事项。
这篇教程带你在晨涧云上创建一台 GPU 云主机,并完成从选型到远程连接的完整闭环。你会先判断任务究竟适合云容器还是云主机,再依次选择 GPU、系统镜像、CPU 与内存规格、磁盘和租用时长,最后进入系统检查 GPU 与软件环境。
晨涧云同时提供云主机和云容器。只跑 Python、Notebook、模型训练或批量推理时,两种形态都能完成任务;云主机在此基础上还提供独享操作系统、GPU 直通和桌面环境。需要运行图形界面软件的 AIGC、渲染、设计用户,或者想把云端 GPU 当成一台完整远程电脑的团队,优先选择云主机通常更稳妥。
云主机与云容器应该怎么选
云容器是隔离的进程环境,通常共享宿主机内核;云主机提供独享操作系统,更接近一台可以远程使用和维护的电脑。容器启动轻、镜像复制方便,云主机则覆盖更完整的系统、驱动、桌面和软件安装需求。
判断项 | 云容器 | 云主机 |
|---|---|---|
常见入口 | SSH、JupyterLab、WebIDE | SSH、RustDesk、WebUI;Windows 还可用 RDP |
系统形态 | 与宿主机共享内核的隔离环境 | 独享操作系统环境 |
图形桌面 | 通常不提供完整桌面 | Windows 与 Ubuntu 均支持远程桌面 |
GPU 使用 | 由平台映射 GPU 资源 | 晨涧云为 GPU 直通、显卡独享 |
驱动管理 | 通常依赖宿主机驱动,用户调整空间有限 | 可按项目需要更换 GPU 驱动 |
适合任务 | 训练、微调、推理、Notebook、批处理 | 容器类任务,以及 AIGC、渲染、设计、桌面软件和完整开发环境 |
主要优势 | 轻量、创建快、环境复制方便 | 功能覆盖广、系统权限完整、桌面交互友好 |
哪些场景适合云容器
- 代码和依赖已经适配 Linux,只需运行训练、微调或推理任务。
- 主要通过 JupyterLab、SSH 或 VS Code 远程开发,不依赖完整桌面。
- 任务使用平台已有镜像,且不需要自行调整 GPU 驱动。
- 希望按小时随开随停,优先考虑轻量使用和成本弹性。
- 熟悉 Linux、conda 和容器目录,能自己处理端口映射与数据持久化。
AutoDL 的常用 GPU 实例属于 Docker 容器实例,控制台工作流以 JupyterLab、终端和镜像为主。标准 Linux 深度学习实验使用这种形态很直接。
为什么更推荐云主机
Ubuntu 云主机基本能覆盖云容器的大部分功能需求:可以通过 SSH 和 VS Code 开发,可以使用 conda、Docker、JupyterLab,也能运行训练、推理和 Web 服务。同时,它还保留 Ubuntu 桌面,适合需要文件管理器、浏览器、可视化工具、IDE 或图形化安装器的工作流。
Windows 云主机则解决了另一类刚性需求:必须运行 Windows 原生 GPU 软件、插件或桌面应用。当软件依赖 Windows 系统时,常见的 Linux 云容器无法替代 Windows 云主机。
以下用户尤其适合选云主机:
- AIGC 创作者:要在 ComfyUI、Stable Diffusion 等工具之外管理模型、插件、素材和输出,并通过桌面预览与整理结果。
- 渲染和三维用户:要运行 Blender、渲染器、建模软件或其他图形界面程序,并随时查看画面。
- 设计用户:工作流同时包含浏览器、素材管理、图形软件和 AI 插件,需要像本地电脑一样拖放文件和切换应用。
- 开发与科研用户:既要 SSH、Docker、conda 和命令行,又需要 Ubuntu 桌面、图形化 IDE 或科学可视化软件。
- 驱动版本有明确要求的项目:云主机允许更换 GPU 驱动,适合需要匹配特定 CUDA 兼容范围的环境。
有些需求在“云容器与云主机二选一”时只能由云主机满足。最明确的是 Windows 原生 GPU 桌面软件;另一个是必须自行更换 GPU 驱动的项目,因为容器看到的 GPU 驱动通常来自宿主机,无法在容器内部独立替换。需要完整 Windows 或 Ubuntu 桌面交互时,也应直接选择云主机。
云主机覆盖更广,不代表所有任务都要选它。只跑短时脚本、追求小时级按需计费时,云容器仍可能更省。若任务涉及修改内核、特殊硬件直通或平台未开放的底层能力,下单前应单独确认。
创建前先写一张配置单
项目 | 需要确认的内容 |
|---|---|
工作负载 | 训练、推理、ComfyUI、三维渲染、科研仿真或设计软件 |
操作系统 | Windows、Ubuntu 或 CentOS;是否需要桌面 |
GPU | 最低显存、是否需要多卡、软件是否支持该卡 |
驱动与 CUDA | 项目要求的驱动兼容范围、CUDA、框架版本 |
CPU 与内存 | 数据预处理、编译、渲染或多进程任务的需求 |
磁盘 | 软件、模型、数据集、缓存与输出的预计容量 |
网络 | 是否要从公网访问 Web 服务,需要几个端口 |
时长与预算 | 预计使用天数、调试时间和可接受总费用 |
数据策略 | 上传哪些文件、结果备份到哪里、是否涉及敏感数据 |
如果项目有 README 或安装文档,先找出操作系统、GPU 驱动、CUDA、Python 和框架版本。显存只决定模型能否装下;系统、驱动、CPU、内存和磁盘不匹配,同样会让实例无法工作。
完整流程:租用一台晨涧云 GPU 云主机
第一步:登录并进入算力市场
完成账号注册或登录后,进入“算力市场”。平台会展示云主机、云容器等产品入口,本教程选择“云主机”。在显卡列表中找到符合显存和预算要求的型号,点击“立即租用”进入配置页。
列表中的价格可能是最低展示价,实际金额以下单配置页为准。第一次使用建议先租单卡、短周期实例,完成兼容性测试后再续租或升级。
第二步:选择系统镜像
在配置页按“应用场景 → 操作系统 → 系统镜像”选择镜像。晨涧云当前预装环境包括 Windows 10、Ubuntu 22.04/20.04/18.04 和 CentOS 9;最终以创建页的可选镜像为准。Windows 与 Ubuntu 支持桌面,CentOS 主要通过 SSH 使用。
选择原则:
- Windows 原生软件选择 Windows 镜像。
- 深度学习、Docker、JupyterLab 和 Linux 开发优先选择 Ubuntu。
- 需要图形化 Linux 工作流时,选择 Ubuntu Desktop 镜像。
- 依赖 CentOS 生态且不需要桌面时,再考虑 CentOS 9。
- 已有明确版本要求时,先匹配系统、驱动与 CUDA,再看预装软件。
部分镜像已安装显卡驱动、CUDA、Docker、Anaconda、PyTorch、PyCharm 和 VS Code 等环境。预装版本不一定适合每个项目,创建后仍要验收。
第三步:选择 GPU 和数量
设置 GPU 型号与“GPU数量”。晨涧云云主机使用 GPU 直通,显卡由实例独享。第一次迁移项目建议从单卡开始;多卡只有在代码支持数据并行、模型并行,或确实要并发运行多项任务时才会带来收益。
选卡顺序:
- 显存能否容纳模型、输入、缓存和桌面程序。
- 软件是否支持该 GPU 架构与驱动版本。
- 预计完成时间和总费用,而不只看单日价格。
- 渲染软件是否需要专业卡特性,训练代码是否真正支持多卡。
第四步:选择实例规格
配置页会提供不同 CPU 与内存组合。训练、渲染和科学计算都可能受 CPU、内存或磁盘 IO 限制。大量素材解码、数据增强、多进程加载、着色器编译和仿真任务尤其不能只看 GPU。
有本地运行数据时参考峰值占用;没有数据时,先选能跑通小样本的规格,创建后观察 CPU、内存和 GPU 利用率,再决定是否升级。
第五步:规划系统盘和数据盘
晨涧云当前租用文档写明,云主机默认提供 200 GB 系统盘和 100 GB 数据盘,并允许按需扩大数据盘。下单前按下面估算:
所需空间 = 系统与软件 + 模型权重 + 数据集 + 缓存 + 输出结果 + 预留空间系统盘用于操作系统和软件,数据盘用于模型、数据集、素材和结果。平台文档提示默认磁盘在结束使用后有保留期限,扩容后的保留规则可能不同;重要文件仍要备份到本地或可靠存储。
第六步:选择租用时长并核对订单
根据预计用量选择按天、周或月租用。平台可能按时长和多卡数量提供折扣,库存、价格和活动会变化,应以结算页为准。
提交前检查:
- 产品类型是云主机,而非云容器。
- 操作系统、桌面和预装环境符合需求。
- GPU 型号、显存和数量正确。
- CPU、内存和磁盘足够。
- 驱动与 CUDA 有可行的兼容方案。
- 租用时长、最终金额和数据保留规则已确认。
第七步:创建实例并等待运行
点击“立即创建”后,平台开始准备实例。官方流程给出的参考时间约为 10~15 分钟。页面会跳转到控制台,等实例状态变为“运行中”再连接;如果长时间没有完成,查看页面提示并联系平台支持,不要重复下单。
第八步:从控制台连接系统
从网站顶部进入“控制台”,在左侧打开“云主机实例”。实例列表可以查看运行状态、配置、租用信息、系统密码、端口和该镜像的专属操作指南。
- Windows 可使用 RDP、RustDesk 或 WebUI。
- Ubuntu 可使用 SSH、RustDesk、WebUI,也可安装平台预置的其他远程工具。
- CentOS 9 主要通过 SSH 连接。
第一次连接时,使用当前实例“操作指南”提供的地址、端口、用户名和密码。不要照搬其他实例的连接参数。
第九步:验收 GPU、驱动与软件
进入系统后先验收,再上传大数据或安装复杂软件。在 Ubuntu 终端、Windows PowerShell 或命令提示符中运行:
nvidia-smi确认 GPU 型号、数量和显存与订单一致,并记录当前驱动版本。使用 PyTorch 镜像时继续检查:
python -c "import torch; print(torch.__version__); print(torch.cuda.is_available()); print(torch.cuda.device_count())"预期 torch.cuda.is_available() 返回 True,GPU 数量与订单一致。AIGC、渲染或设计任务还要打开目标桌面软件,用小素材完成一次加载、运算、预览和保存。
验收清单:
- GPU 型号、数量和显存符合订单。
- 系统、桌面和远程连接正常。
- 驱动、CUDA 与框架满足项目要求。
- 数据盘可读写,空间足够。
- 小样本训练、推理、渲染或设计操作可完成。
- 输出文件可以下载或同步到备份位置。
更换 GPU 驱动时要注意什么
晨涧云云主机支持更换 GPU 驱动。Windows 可卸载现有 NVIDIA 驱动后安装目标版本;Ubuntu 也可以按平台驱动安装文档调整。驱动变更会影响 CUDA、框架和桌面程序,操作前先记录原版本并保存数据。
建议按这个顺序处理:
- 从项目文档确定需要的驱动兼容范围,不要只看 CUDA Toolkit 版本号。
- 记录
nvidia-smi、CUDA、PyTorch 或目标软件的当前版本。 - 保存训练 checkpoint,关闭所有 GPU 任务。
- 按对应系统文档卸载并安装驱动,过程中允许实例重启。
- 重启后重新运行
nvidia-smi和小样本任务。
驱动并非越新越好。只要当前驱动满足框架要求,通常没有必要为了追新版本冒险调整稳定环境。
对外访问服务与端口
云主机内运行 ComfyUI、JupyterLab 或推理 API 时,先用 localhost 验证,再配置公网访问。控制台会展示预留端口映射关系,外部通过“公网 IP + 公网端口”访问。
只开放必需端口,不要把数据库、系统管理面板或没有鉴权的应用直接暴露到公网。默认预留端口数量有限,需要更多端口时按控制台提示联系平台确认。
使用中的注意事项
重启、改密码和扩容前先停任务
控制台支持续租、重启、修改密码、磁盘扩容和重装系统。重启会中断任务,修改密码和磁盘扩容也可能触发重启。操作前先保存 checkpoint、写完日志并确认没有关键进程。
重装系统前必须备份
重装系统会删除实例数据,无法恢复。需要换系统或重置环境时,先备份代码、数据、模型、配置和结果。
换卡后重新获取连接信息
停机续租或更换 GPU 时可以保留系统环境与数据,但资源迁移可能改变 IP 等连接信息。完成后回到控制台获取新参数,并重新做 GPU 验收。
价格、库存和保留规则会变化
正式长租前先短期试跑,确认远程连接、软件兼容性、驱动、端口、性能和备份方式,再决定是否续租。
敏感数据先处理再上传
客户素材、未公开数据集、私有模型和访问凭据应先做脱敏与权限检查。密钥使用环境变量或项目支持的凭据管理方式,任务结束后清理临时文件。
几个实用小 Tips
- 创建后先做 10 分钟验收,尽早发现镜像、GPU 或驱动不匹配。
- 调试与正式运行分开,先用小数据、低分辨率或短 epoch 跑通。
- 保存镜像名称、系统、GPU、驱动、CUDA、Python、框架和启动命令。
- 长任务写日志并定期保存 checkpoint,远程桌面断开不应中断计算。
- 在预计完成时间和租期到期前设置提醒,及时下载结果或续租。
- 桌面卡顿先区分网络延迟和 GPU 计算性能,分别查看监控与任务日志。
- Web 服务先在实例内测试,确认可用后再配置公网端口。
为什么晨涧云云主机适合作为默认选择
对于希望减少选型纠结的个人和小团队,晨涧云 Ubuntu 云主机可以作为更通用的起点。它既能完成 SSH、Docker、conda、JupyterLab、训练、推理和 API 服务等常见容器任务,也提供 Ubuntu 桌面、GPU 直通和驱动更换能力。需要 Windows 原生软件时,再选择 Windows 云主机。
云容器仍适合短时、轻量、纯命令行任务,尤其是明确需要小时级随开随停时。但只要工作流包含图形界面、AIGC 素材管理、渲染、设计软件、桌面预览或特定驱动要求,直接选择云主机能减少后续迁移和环境改造。完整流程可以压缩成六步:选云主机、匹配系统镜像、配置 GPU 与主机规格、规划磁盘和租期、等待创建、连接后验收。把产品形态选对,往往比单纯比较显卡单价更重要。