AI Infra

Tags

#vast

5posts

Day 24

Day 24 · W4 复习:一条命令起环境的完整清单、五道验收题、错题本

把 W4 五天的工程活压成一张能打勾的清单:开机前、开机后、收尾三段,每项对应哪个脚本、哪条计费事实。然后做路线图 W4 的五道验收题,把这周三篇文章里口径不一致的地方统一掉,最后整理错题本。W4 结束时的标准只有一句:一条命令起环境,跑完自己消失,钱花在哪一眼可查。

Day 22

Day 22 · 三层自动销毁:脚本末尾关机、空闲检测、余额上限

忘记关机是这条路上预算失控的唯一原因,而它不会因为「这次一定记得」而消失。给三种不同的失败方式各配一道保险:任务结束脚本自己销毁实例,GPU 空闲太久看门程序销毁实例,前两层都失效时账户余额兜底。每一层写出来、跑一遍,验收是故意跑完一个任务,然后看实例自己消失。

Day 21

Day 21 · bootstrap 脚本:从零到能跑代码 5 分钟

把「开机之后手工装环境」这件事变成一个幂等的脚本:装依赖、拉代码、配 token、预热模型、打印 nvidia-smi。每一步都计时,找出最慢的那一步。验收标准只有一条:从实例启动到能跑第一行 GPU 代码,全自动,不超过 5 分钟。

Day 20

Day 20 · 实例销毁后什么会丢:代码、数据、模型权重各放哪

租来的机器是一次性的,销毁之后盘上的一切都没了。今天把 RunPod 和 Vast 的几种存储在 stop 和 delete 时的命运搞清楚,算一笔「存着」和「重下」哪个便宜的账,然后给代码、模型权重、实验结果三类东西各定一个去处,画成决策树。

Day 19

Day 19 · 第一次租 GPU:RunPod / Vast 开 spot 实例,SSH 进去看 nvidia-smi

W4 第一天,从免费 Colab 换到按秒计费的租卡。两家平台怎么选、便宜的可中断实例到底便宜在哪、选哪张卡要先算显存再看价,以及第一次 SSH 进去必须做的三件事。全程只充 10 到 20 美元。