非技术创业者 · GPU 云与算力代理入门

AI 算力代理
启蒙指南

不把你训练成工程师。目标是让你能听懂客户、问对需求、看懂报价、守住边界

AI 基础01
算力产品02
需求翻译03
报价毛利04
风险边界05
行动清单06
先纠正前提02

“懂一点 AI”并不等于能卖对算力

真正的业务能力,是知道客户问题处在哪一层,并在证据不足时停止承诺。

误区 1

背模型和 GPU 名字

型号会变,客户需求也不会自动变成有效配置。

误区 2

最贵就是最好

显存、并发、延迟、网络、存储和交付方式都可能改变答案。

误区 3

能跑就是能上线

生产环境还要看稳定性、安全、监控、故障恢复与服务责任。

这份指南教的是“商业判断所需的最低技术素养”,不是替代技术售前。
先认清自己卖什么03

“算力代理”至少可能是四种不同生意

A

GPU 云分销

卖标准云资源、套餐和续费。

核心:渠道、价格、账期
B

裸金属 / 集群代理

卖独占服务器或多机集群。

核心:供给、交付、SLA
C

资源撮合平台

把多家供给与客户需求匹配。

核心:调度、信用、价差
D

解决方案服务

连同部署、迁移、运维一起交付。

核心:技术团队、责任边界
默认场景:你代理 GPU 云资源,负责获客、需求初筛和商务;复杂选型由上游技术售前复核。
不是知识竞赛04

学完后,你应该能完成五个真实动作

01

解释

用人话讲清模型、训练、推理与算力。

02

追问

把“我要大模型”追问成有效需求。

03

识别

看懂报价中缺失的配置和费用。

04

转交

把技术问题完整交给售前复核。

05

止损

不在证据不足时承诺性能与合规。

课程目标成为可信的需求翻译者,而不是伪装成架构师。
先看全图05

AI 生意,是从资源一路走到业务结果

DATA

数据

原料与业务上下文

MODEL

模型

理解与生成能力

GPU

算力

让模型运行的资源

APP

应用

界面、流程与权限

VALUE

结果

增收、提效、控风险

客户真正购买的不是 GPU 名字,而是“在成本与风险可接受的前提下得到业务结果”。
AI 基础 ①

别把所有 AI 都叫“大模型”:它们是包含关系

AI

人工智能

让机器完成通常需要智能的任务,是最宽的概念。

ML

机器学习

AI 的一类方法:从数据中学习规律,而非逐条写规则。

DL

深度学习

机器学习的一部分,使用多层神经网络处理复杂模式。

LLM

大语言模型

生成式 AI 的重要类别,擅长理解和生成语言;不是 AI 的全部。

业务判断:先问客户要解决什么任务,再判断是否真的需要生成式 AI 或大模型。
AI 基础 ②06

模型像发动机,产品才是能上路的整车

MODEL

模型提供能力

  • 理解文字、图片、语音或视频
  • 预测、生成或分类
  • 本身不等于完整业务流程
强模型 ≠ 好产品
VS
PRODUCT

产品负责交付

  • 加入界面、知识、工具和权限
  • 接入企业系统与人工审批
  • 对速度、稳定和结果负责
产品才面对客户
AI 基础 ③

参数、Token、上下文:回答的是三种不同问题

能力

参数

模型训练后得到的大量数值。参数量常影响能力与资源需求,但更大不保证更适合你的任务。

计量

Token

模型处理文字时使用的片段单位。它不等于汉字数或单词数,不同模型的切分方法不同。

容量

上下文窗口

一次请求中模型能处理的 Token 范围;过长内容可能被截断,也会影响延迟、缓存和费用。

报价前要问:输入多长、输出多长、是否多轮对话、峰值并发多少。只问“多少亿参数”远远不够。
AI 基础 ④

要改回答,先分清是指令、知识还是行为问题

指令

提示词

告诉模型角色、任务、格式和限制。适合先验证流程,不会改写模型权重。

例:按固定字段总结合同
知识

RAG

先从外部知识库检索相关内容,再连同问题交给模型生成答案。

例:基于企业制度回答
行为

微调

继续训练模型,使输出风格或特定任务行为发生改变;需要数据与评测。

例:稳定遵循专业输出范式
常见顺序:先提示词与小样本验证;知识更新频繁时评估 RAG;行为仍不稳定且样本充足时再评估微调。
AI 基础 ⑤07

先分清工作负载,再谈需要多少算力

外部

调用模型 API

按请求使用供应商的模型服务,不直接管理 GPU。

主指标:质量、配额、Token 费用
推理

自主管理推理

让训练好的模型持续处理新请求。

主指标:延迟、吞吐、并发、显存
适配

微调

在现有模型上继续训练,使其更适合特定任务。

主指标:样本、训练时间、评测
训练

从头训练

更新大量模型参数,通常需要更长时间和更大集群。

主指标:集群、网络、稳定与恢复
注意:这里按管理方式与关注指标分类,不代表固定的“轻、中、重”顺序。NVIDIA TensorRT:推理定义
第一个商业判断08

API 和自部署之间,还有两种常见中间形态

省事

共享模型 API

供应商管理模型与基础设施,按调用计费。

适合:需求与用量尚未稳定
托管

托管推理端点

选择模型与规格,由平台处理较多部署和伸缩工作。

适合:要一定控制但团队较轻
独享

专属 / 私有实例

资源隔离更清晰,但仍可能由平台提供运维能力。

适合:稳定负载、隔离与可预测性
自管

自部署

团队管理模型服务、扩缩容、监控、安全和故障恢复。

适合:强控制要求且有人负责运维
没有通用“调用量阈值”。应把质量、数据边界、延迟、弹性、利用率、工程人力和退出成本一起比较。
AI 基础 ⑥

“要快”不是指标:至少拆成四个可测量量

TTFT

首字时间

从发送请求到收到第一个 Token,影响用户是否觉得“马上开始回答”。

E2E

端到端延迟

从请求发出到完整结果返回,适合衡量整个任务完成时间。

TPS

生成速度 / 吞吐

可按每请求 Token/s、系统总 Token/s 或请求/s 描述,口径必须写清。

LOAD

并发与可用性

同时有多少请求、排队多久、在多大负载下还能达到目标。

验收必须绑定测试条件:模型版本、输入/输出长度、并发、地域、持续时间和统计分位数。
AI 基础 ⑦

同一个模型,也可能有不同精度与资源占用

PRECISION

精度像数字的“刻度”

  • FP32、FP16、BF16、INT8、INT4 等表示方式不同
  • 较低位宽通常能减少权重占用,并可能提升某些硬件上的效率
  • 支持情况与收益取决于模型、算子、框架和硬件
QUANTIZATION

量化不是免费压缩

  • 可能影响质量、稳定性或兼容性
  • 训练和推理对精度的要求不相同
  • 必须用客户任务做质量与性能回归
“某模型需要多少显存”没有脱离精度、框架、上下文、批量与并发的唯一答案。
02
COMPUTE WITHOUT PANIC

算力,不只是“一张卡”

先用工厂类比理解整套系统,再学习影响选型的关键变量。

一套贯穿全课的类比10

把一套 AI 系统想成一座按单生产的工厂

DATA

数据

生产所需原料

原料质量影响结果
MODEL

模型

配方与生产工艺

决定能做什么
GPU

GPU

并行生产设备

提供计算能力
VRAM

显存

设备旁工作台

装不下要换方案或付代价
NET

网络

车间运输通道

多机协作靠它
SLA

运维

厂长与检修制度

保证持续交付
说明:这是帮助理解的类比,不是技术定义。
算力基础 ①11

CPU 擅长统筹,GPU 擅长大规模并行计算

CPU

像经验丰富的总调度

  • 处理操作系统与复杂控制逻辑
  • 擅长多种不同任务
  • AI 服务器仍然离不开 CPU
+
GPU

像大量协同的生产单元

  • 适合重复、可并行的矩阵计算
  • 深度学习常从中获得加速
  • 不是所有程序都能同样受益
正确说法不是“GPU 比 CPU 更强”,而是“它们擅长的工作不同”。
算力基础 ②12

显存像工作台:装不下时,要换方案或接受代价

模型权重 + 运行时数据 + 缓存

模型越大

通常需要存放更多参数。

上下文越长

推理期间的缓存可能增加。

并发越高

同时处理更多请求会占用更多资源。

可尝试降精度、量化、分片或卸载到 CPU / 磁盘,但往往带来速度、质量、复杂度或稳定性代价。最终必须实测。
算力基础 ③13

慢,不一定是 GPU 不够快

计算

模型操作需要的数学计算超过设备供给。

表现:GPU 忙,任务仍需时间
显存 / 带宽

数据搬运速度或显存容量成为限制。

表现:算力指标高也未必快
网络 / 存储

多机同步、读写数据和模型加载被拖慢。

表现:设备等待数据
软件 / 调度

框架、驱动、批处理和任务排队影响利用率。

表现:有卡却没有有效产出
算力基础 ④14

从一张卡到一个集群,复杂度不是线性增加

1

单卡

适合能装入单卡的开发、测试或轻量推理。

N

单机多卡

共享一台服务器,但卡间连接方式仍影响协作。

N×N

多机集群

网络、同步、调度、故障恢复成为核心。

OPS

生产服务

还需要监控、扩缩容、权限、备份与值守。

“八张同型号 GPU”仍不足以描述一套系统:它们在哪台机器、怎样互联、配什么 CPU、内存、网络和存储,都要确认。
算力基础 ⑤15

GPU 型号只是入口,选型至少看六个变量

01

能否装下

模型、精度、上下文与并发决定显存需求。

02

跑得多快

看真实吞吐和延迟,不只看理论峰值。

03

怎样互联

多卡、多机时网络与拓扑很重要。

04

软件兼容

驱动、框架和推理引擎是否匹配。

05

供给稳定

地域、库存、交付周期与替换方案。

06

全周期成本

资源费、运维、迁移、停机与人力一起计算。

最可靠的方法:用客户的真实工作负载做小规模基准测试,再决定配置。
看懂产品16

客户买的不是卡,而是一套可使用的资源栈

应用入口控制台、API、Notebook、镜像市场好不好用
运行环境驱动、框架、容器、推理引擎能不能跑
调度与隔离任务排队、权限、租户隔离、配额会不会抢
计算资源GPU、CPU、内存与节点拓扑跑多快
数据通道本地盘、对象存储、网络与出口搬得动吗
运营保障监控、告警、备件、支持与 SLA坏了谁管
产品不是一类17

同一块 GPU,可以被包装成完全不同的商品

VM

GPU 云主机

像租一间带设备的办公室,自主管理系统。

灵活,但客户承担更多运维
BARE METAL

裸金属服务器

整台机器独占,控制更强,交付更重。

适合稳定、明确的负载
PLATFORM

托管训练 / 推理

平台代管更多环境、调度和部署工作。

卖的是效率和工程能力
API

模型 API

按请求获得模型能力,看不到底层 GPU。

最接近业务能力采购
报价前先问:客户要的是“资源控制权”,还是“直接得到模型结果”?
看懂价格18

GPU 时价,只是总成本的一部分

GPU / 主机费
+
存储与网络
+
环境与运维
+
停机与迁移风险

购买方式

按量、包月、预留或可中断资源,风险不同。

地域与库存

价格、网络、数据位置和可获得性会变化。

闲置率

买到却没被有效使用,单价再低也可能亏。

03
THE CUSTOMER SAYS

“给我八张 H100。”

不要立刻报价。先判断这是一项真实需求、一个参考型号,还是一句未经验证的愿望。

需求初筛表20

报价前,至少把这十二个问题问清楚

01业务最终要解决什么问题?
07响应速度与高峰并发要求?
02调用 API、推理、微调还是训练?
08数据量、存储量与迁移方式?
03模型、版本与精度是否确定?
09数据是否敏感,允许放在哪里?
04文本、图片、视频还是多模态?
10临时项目还是持续生产服务?
05上下文、输入输出大约多长?
11预算、上线时间与中断容忍度?
06模型、数据和软件的商用许可是否明确?
12验收指标、测试样本和责任人是谁?
任何一项不知道,都应标记“待确认”;没有验收口径,就没有可签字的性能承诺。
真正的代理价值21

把客户说法翻译成可验证的技术问题

客户原话
需要追问
影响的变量
“我要跑一个大模型”
训练还是推理?什么模型?
显存、卡数、运行时
“一定要快”
首字延迟还是整体吞吐?
批处理、并发、网络
“不能泄露数据”
哪些数据?允许在哪处理?
部署、权限、日志、地域
“先用一个月看看”
能否中断?预计利用率?
按量、包月、可中断资源
“保证一直能用”
可用率目标和赔付要求?
SLA、冗余、支持等级
案例 A · 推理服务22

“做 AI 客服”首先不是一道 GPU 型号题

CUSTOMER STORY

一家企业想上线内部知识客服

它关心回答速度、知识准确、权限隔离和高峰可用性,但尚未确定是否自部署模型。

先比较 API、RAG 与自部署方案,再决定是否租 GPU。
1

确认业务

用户、知识范围、敏感数据和失败后果。

2

做小验证

用真实问题测试质量、速度和成本。

3

再选资源

根据实测并发与控制要求确定交付方式。

案例为教学假设,不代表特定客户或固定配置。
案例 A · 第 1 步

先写需求假设,未知项绝不偷偷补成事实

场景

内部知识客服

仅供员工查询制度与产品资料;首期不对公众开放。

负载

300 人 / 峰值 20 并发

单次约 1,200 输入 Token、300 输出 Token。

数据

含内部资料

禁止进入训练集;访问需按员工身份控制;地域待法务确认。

目标

4 周完成试点

先验证回答质量、引用、速度、峰值稳定和单位成本。

全部数字均为教学假设需客户确认真实项目应把用户量、Token 长度与并发从日志或压测中核实。
仍未知:候选模型、文档规模、权限系统、允许地域、月预算、失败后果与正式 SLA;这些未知项会改变方案。
案例 A · 第 2 步

比较四条路,而不是先替客户决定 GPU

方案
控制与工程量
首期优势
主要风险 / 待验证
共享模型 API + RAG
控制较低;工程量较小
最快验证质量与流程
数据条款、配额、价格变化
托管推理端点 + RAG
控制中等;平台代管较多
可选模型和弹性更可控
平台绑定、冷启动、地域
专属 / 私有实例
隔离较强;固定成本更高
性能和资源边界更清晰
低利用率、锁定与扩容
自部署开源模型 + RAG
控制最高;工程责任最大
模型、日志和运维更自主
选型、质量、安全、故障恢复
教学选择:先用“共享 API + RAG”做限时试点;这不是最终结论。若数据条款不满足,应立即改走托管、专属或自部署评估。
方案判断是基于上一页假设的示例;真实选择需看供应商合同、实测质量、成本和客户控制要求。
案例 A · 第 3 步

试点不是“感觉不错”,要形成验收—报价—SLA闭环

验收

固定测试条件

  • 100 道经业务确认的真实问题
  • 有用答案 ≥ 85%,引用正确率 ≥ 95%
  • 20 并发下 p95 首字 ≤ 2.5 秒、完整回答 ≤ 12 秒
报价

按实测算账

  • 试点调用与 RAG 基础设施
  • 实施、支持、税费与账期成本
  • 超量单价、变更范围与退出成本
SLA

承诺可取证

  • 生产可用时间与维护窗口
  • 故障分级、响应与恢复目标
  • 性能口径、排除项和赔付上限
以上阈值全部是教学假设,不是行业标准。技术售前必须用真实模型与负载复核;未通过试点,或客户未签验收口径,就不签固定 GPU 配置与性能承诺。
事实:测试结果估算:未来用量决策:是否转专属 / 自部署
案例 B · 重型负载23

同样叫“AI 项目”,算力需求可能完全不同

VIDEO INFERENCE

批量生成营销视频

  • 关注单条生成时间与排队吞吐
  • 任务可能允许异步完成
  • 可以尝试弹性或可中断资源
MODEL TRAINING

持续训练自有模型

  • 关注多机互联与长任务稳定性
  • 中断可能浪费已运行时间
  • 检查点、存储与恢复很重要
工作负载决定产品;“AI 行业客户”不是一个可以统一报价的客户类别。
案例为教学假设;实际方案必须基于模型与实测负载。
你的专业边界24

你可以完成初筛,但不能独立签字选型

YOU CAN OWN

商务可以负责

  • 客户目标与预算访谈
  • 收集模型、并发、数据与地域要求
  • 对齐合同、账期和支持流程
  • 跟踪试用、验收和续费
TECH SIGN-OFF

必须由技术复核

  • 显存、卡数、拓扑和网络设计
  • 性能、稳定性与容量承诺
  • 迁移、容灾和安全架构
  • 生产环境变更与故障定责
停止点:没有模型信息、没有负载样本、没有技术复核,就不承诺具体性能。
报价不是抄单价25

完整报价,要把资源、服务和风险写在一起

上游资源成本
+
实施、支持与财务成本
+
税费与风险准备
+
目标毛利
=
对客报价

写清包含项

GPU、CPU、内存、盘、流量、镜像、支持、税率与发票类型。

写清限制项

模型版本、地域、库存、期限、可中断和验收条件。

写清变更项

扩容、迁移、续费、超量、价格调整和退出规则。

看见隐性成本26

纸面价差,不等于最后赚到的钱

闲置

锁定资源却没被使用

账期

上游先付、下游后收

售后

免费支持不断扩大

降价

锁价后市场价格下行

故障赔付

责任不清导致额外损失

商业判断只靠“哪里有便宜 GPU”的信息差,通常比需求翻译、交付协调和售后能力更容易被压价。
合同保护业务27

“稳定”不是形容词,要写成可检查的条款

可用

服务目标

明确服务时段、可用率口径、维护窗口、故障等级、响应与恢复目标。

性能

测试口径

模型、输入输出、并发、地域、分位数、采样周期与数据来源。

定责

排除与赔付

平台、客户代码和第三方故障如何取证,补偿上限与适用条件。

上游给你的 SLA,必须能覆盖你向客户承诺的 SLA。
不要口头承诺“绝不宕机”“绝不丢数据”“一定达到某速度”。
风险不是一句合规28

先判断你提供的是什么服务,再判断适用什么要求

01

你接触数据吗?

仅销售资源,还是会代客户迁移、调试或查看日志?

02

数据放在哪里?

地域、跨境、备份、删除与访问权限是否明确?

03

谁面向公众?

算力出租方不当然等于生成式 AI 服务提供者。

04

谁负责判断?

涉及个人信息、重要数据或公共服务时,请专业法务复核。

本页是风险提示,不是法律意见;不能把某项备案要求笼统套到所有算力代理。
官方原文:《生成式人工智能服务管理暂行办法》。适用性取决于实际服务模式;本页不替代法务意见。
看到就先停29

六类红旗,可能让一单生意变成一场事故

!

授权与许可说不清

没有资源授权、责任主体,或模型与软件商用许可不明。

!

价格与票税说不清

低价无法解释地域、共享、中断、税率、发票和付款主体。

!

只谈卡,不谈系统

CPU、内存、网络、存储和软件环境全部缺失。

!

拒绝试跑与验收

无法用客户真实负载验证性能。

!

责任靠口头承诺

故障、退款、迁移和数据处理没有条款。

!

先收长期大额预付

但交付计划、退出机制与资金安全不清楚。

从课件走向业务30

七天内,完成第一轮可验证的能力闭环

DAY 1

画地图

用自己的话讲清数据、模型、算力、应用和结果。

DAY 2

认产品

拆解一份真实上游产品与报价单。

DAY 3

练十二问

模拟客户访谈,不替客户补答案。

DAY 4

做试跑

跟技术售前看一次真实工作负载测试。

DAY 5

算毛利

把账期、支持和风险写入报价。

DAY 6

审合同

核对 SLA、数据与退出边界。

DAY 7

复盘

完成一次从需求到技术复核的模拟成交。

最后自测31

能回答这六问,才算真正入门

01为什么“八张 H100”仍不是完整需求?
02什么时候 API 比租 GPU 更合理?
03GPU 单价之外还要算哪些成本?
04哪些承诺必须由技术售前复核?
05上游 SLA 与对客 SLA 为什么必须对齐?
06你怎样区分事实、估算和销售判断?
你的价值不是“什么都敢答”,而是把问题问清、证据补齐、责任交给正确的人。
资料来源32

稳定概念看官方文档,价格与规则按日期更新

NVIDIA DOCS

推理性能指标

核对 TTFT、延迟与吞吐口径;量化另见 TensorRT 链接。

GOOGLE CLOUD

GPU 定价说明

核对地区、购买方式和配套资源对费用的影响。

核对日期:2026-09-01价格、型号、库存与监管规则可能变化案例均为教学假设
← → 翻页 · O 目录 · R 阅读 · F 全屏 · E 编辑
已保存