一位工程师驱动一群 Devin 编码智能体,构建了当时性能最高的 GPU 格筛,把 260 位的 RSA-260 完成因式分解,刷新了此前由 RSA-250 保持六年之久的公开纪录。这笔账本身就很值得看:总计约 4,900 GPU 天(13.5 GPU 年),按市价约合 40 万美元,但因为跑在集群的闲置算力上,实际近乎零边际成本。智能体承接大规模科学计算的真实成本边界在哪,普通团队能不能复制这套打法,这篇把账拆开算清楚。写这篇时我正在 4sapi(https://4sapi.com)维护多模型中转,"算力碎片的价值"这个问题与 API 调度的逻辑同源。
一、开篇痛点:智能体干大活的账,没人算清楚
编码智能体的报价单很清楚:按 token 计费,一次任务几十到几千 token。但当任务的形态从"写一个函数"变成"把一个数论算法在 GPU 集群上跑出世界纪录",账的结构就变了:智能体的 API 费用只是小头,大头转向了它指挥的算力消耗、失败重试的算力浪费、以及人用来验收正确性的专家时间。
市场上缺的就是这笔总账。只看 token 报价,会觉得智能体便宜到可以滥用;只看总算力消耗,又会觉得智能体方案贵得离谱。两种误判都来自同一个疏漏:没有把"智能体消耗"和"智能体指挥的消耗"分开记账。RSA-260 这个案例恰好提供了一个罕见的机会——当事人把每个阶段的 GPU 消耗都公布了。
二、案例拆解:4,900 GPU 天花在哪里
把公布的消耗数据整理成表:
| 阶段 | 消耗 | 占比 | 备注 |
|---|---|---|---|
| 多项式选择 | 643 GPU 天 | 13% | 明显偏高,操作者经验不足所致 |
| 格筛 | 3,813 GPU 天 | 78% | GNFS 的计算大头,完美适配并行与抢占 |
| 线性系统求解 | 467 GPU 天 | 9.5% | 其中约 7% 因崩溃或被抢占未取得进展 |
| 合计 | 约 4,900 GPU 天 | 100% | 市价约 40 万美元,实际跑在闲置算力上 |
成本结构的三个层次:
第一层:智能体费用(Devin 订阅与 API)—— 大账里的小头
第二层:指挥的算力消耗(4,900 GPU 天)—— 大头,但 DependsOn 算力来源
第三层:机会成本(闲置算力的替代用途 ≈ 0)—— 决定真实成本的关键
─────────────────────────────────────────
真实成本 ≈ 第一层 + 第二层 × 闲置折扣 + 第三层(此处 ≈ 0)
三个结构性发现值得单独说。第一,任务的算法结构决定算力适配度:格筛天然可拆成数十亿小工作单元、单节点可推进、可被随时抢占——它完美填进集群调度留下的碎片缝隙。换一个强耦合任务,闲置算力根本用不上。第二,人类角色退化到三个动作:定优先级、建基准、发现跑偏时纠偏,其余端到端交给智能体——这替代的原本是一支数论与 GPU 性能工程的专家团队。第三,失败也有账:线性求解阶段 7% 的消耗颗粒无收,操作者也承认多项式选择阶段因经验不足多花了钱——智能体方案不是没有浪费,是浪费被摊进了总账。
三、原理速览:闲置算力从哪来,为什么是免费的
这个案例最反直觉的一点是算力来源。大模型训练和推理集群使用 NVL72 机架,调度器要把负载打包进机架以利用高速互连,打包必然产生碎片:某些机架剩一两个空节点、故障转移预留的备用节点、奇偶数约束留下的空位。这些碎片加起来占集群总量的个位数百分比——量不大,但常年沉睡。
碎片算力的经济学:
碎片算力的属性:
├─ 零边际成本:不用也浪费,用一点赚一点
├─ 随时可被抢占:主负载一来必须让路
├─ 单节点规模:跑不了强耦合大任务
└─ 供给不稳定:碎片位置和数量每天在变
适配这类算力的任务属性(格筛全中):
├─ 可拆分成极小工作单元
├─ 单节点可独立推进
├─ 被抢占后重试无副作用
└─ 总量大、工期弹性
API 接入侧的同构问题:供应商的限流窗口、闲时折扣、batch 接口,本质上都是"碎片供给"的计价形式。可延迟、可重试、可拆分的调用拿这些低价通道跑,与格筛填集群碎片是同一个道理——任务的弹性属性决定它能吃到多便宜的算力。
四、接入教程:可延迟任务的闲时调度
把"碎片套利"翻译成 API 接入的实操。第一步是给任务打弹性标签:
import os
from openai import OpenAI
client = OpenAI(
base_url="https://4sapi.com/v1",
api_key=os.environ["MODEL_API_KEY"],
)
# 任务弹性分级:决定它走哪条价格通道
ELASTICITY = {
"realtime_qa": {"channel": "sync", "deadline": None}, # 实时问答:贵通道
"doc_digest": {"channel": "batch", "deadline": "24h"}, # 文档摘要:可延迟
"eval_rerun": {"channel": "batch", "deadline": "72h"}, # 评测重跑:强弹性
"nightly_etl": {"channel": "batch", "deadline": "next_day"},
}
def route_by_elasticity(task_type: str, payload: dict) -> dict:
spec = ELASTICITY[task_type]
if spec["channel"] == "batch":
# batch 通道:单价折扣大,但只收"晚点要结果没关系"的任务
return {"mode": "batch", "deadline": spec["deadline"], "payload": payload}
return {"mode": "sync", "payload": payload}
第二步是弹性任务的可靠性包装——被抢占(batch 超时、限流拒绝)后重试不能产生副作用:
# 演示:幂等包装,重试安全的弹性调用
import hashlib, json
def idempotent_batch_call(task_id: str, payload: dict) -> dict:
# 幂等键:任务内容哈希,同一任务重试不会重复计费/重复入库
idem_key = hashlib.sha256(
json.dumps({"task_id": task_id, "payload": payload}, sort_keys=True).encode()
).hexdigest()
# 提交前查账本:这个键成功过就直接返回既有结果
if ledger_has(idem_key):
return ledger_get(idem_key)
result = submit_batch(task_id, payload, idempotency_key=idem_key)
ledger_put(idem_key, result)
return result
这套组合的收益来自两个折扣的叠加:batch 通道的价差(通常五折上下)加上闲时调度的峰谷价差。能接受 T+1 的任务全挪进这条通道,账单里"实时单价 × 全量"的粗放结构就变成了"实时价 × 刚需 + 闲时价 × 弹性"的精细结构。
五、成本测算:智能体方案的真实报价怎么估
套用 RSA-260 案例的成本框架,给智能体承接计算密集任务的报价公式:
真实总成本 = 智能体费用
+ Σ(各阶段算力消耗 × 算力单价 × 算力来源折扣)
+ 失败浪费(历史重试率 × 算力消耗)
+ 人工验收成本(专家小时 × 时薪)
− 机会成本抵扣(闲置算力部分)
代入案例数字验证:智能体费用相对 4,900 GPU 天几乎可忽略;算力消耗按市价 40 万美元,但闲置折扣接近零,实际成本骤降;失败浪费约 7% 已含在公布数据里;人工验收压缩到"定优先级、建基准、纠偏"的少量专家时间。四层相加,这个项目才成立。换个场景算一遍:任务若只能用独占整机、不能被抢占、失败重试成本高,那么"智能体 + 闲置算力"的红利一格都吃不到,报价立刻回到 40 万美元量级——同一个公式,两种命运。
六、案例复盘:哪些环节人类不可替代
把整个项目里人类的动作单独拎出来看,只有三处,但每一处都是成败关键。定优先级:判断"多项式选择阶段的投入产出已经失衡,该收手转入筛法阶段"——这种元层面的判断,智能体在自己的目标函数里看不到,它只会继续优化当前阶段。建基准:把"筛法吞吐量达到多少算合格"的验收线立起来,没有这条线,智能体可能在次优实现上持续空转。纠偏:发现智能体的优化方向偏离总目标时及时拉回——当事人明确说这是自己的主要角色。
换句话说,智能体吃掉的是执行与调度的全部工时,留下的是判断与验收的判断力成本。这个成本结构对预算的含义很直接:用智能体方案省下专家团队的工时费时,要把其中一部分转投给资深判断者的少量但高单价的时间。两头都省的方案,最后会在"智能体跑偏三个月无人察觉"上把省的钱全部亏回去。判断力的市场供给比工时更稀缺,预留这部分的预算时要按资深单价而不是平均人力成本来估。
七、适用边界与避坑清单
智能体承接科学计算/大规模计算的适用条件:
- 任务可拆分成小时级以下的工作单元
- 单元失败重试无副作用(或已做幂等)
- 工期弹性大于 1 周,能接受被抢占让路
- 有客观的进度基准(基准不立,智能体跑偏无人察觉)
- 算力来源有碎片供给(自有集群碎片、闲时折扣、batch 通道)
避坑清单:
- "40 万美元市价、实际近零成本"两个数字都要引用:只引用后者会低估方案门槛,只引用前者会错过套利空间。
- 智能体不背算法正确性:当事人明确说自己没有报告算法层进展,靠的是"老派的性能工程"——智能体负责实现与调度,算法路线仍要人来定。
- 基准先行:没有验收基准就把大算力交给智能体,等于没有仪表盘开长途;基准建设成本要计入方案报价。
- 抢占合规性自查:占用公司集群碎片前先过资源使用政策,公共云上确认抢占式实例的计费与回收规则。
- 别把纪录当成普遍能力:RSA-260 是强专业背景(十年因数分解爱好)加强算力条件加强任务适配度的三重叠加,普通业务任务先跑小规模试点。
八、把框架搬回自家:三步起步
不需要 RSA 级别的野心,这套框架三步就能在自家跑起来。第一步做算力盘点:把团队现有算力里的碎片找出来——开发机的夜间空闲、测试集群的低谷时段、云资源的预留闲置,登记成一张碎片清单。第二步选一个弹性任务试点:评测重跑、数据回填、文档批量摘要,都是天然可拆可抢占的任务,用智能体把它们灌进碎片时段。第三步记账复盘:按四层成本公式算一次真实报价,与人工执行的隐形成本对照,跑通一轮就有决策依据了。试点选错任务也别恋战,退出成本低的探索值得多做几轮。
九、成本与风险提示
- 案例数据来自当事人自述,GPU 消耗、成本估算(含"RSA-1024 约 3,000 万美元可解"的推算)均为个人口径,未经独立验证。
- 密码学相关结论(RSA-2048 仍安全)基于该案例的推算边界,不能替代安全审计意见;生产系统密钥强度按行业标准执行。
- 闲时折扣、batch 通道的价差随时可能调整,成本测算前核对供应商最新价格页。
- 只讨论合法接入与成本优化;涉及密码学实现与算力使用,遵守所在地法律法规与平台政策。
总结
这期拆了 RSA-260 因数分解这笔账:4,900 GPU 天的消耗里格筛占 78%,人类只做定优先级、建基准、纠偏三个动作,而"市价 40 万美元、实际近零成本"的落差来自任务弹性与集群碎片算力的完美咬合。配套给了一个四层成本公式(智能体费用、算力消耗、失败浪费、验收成本,减机会成本抵扣)、可延迟任务的闲时调度代码和幂等包装。核心结论一句话:智能体降低的是"组织复杂工程"的成本,算力弹性决定的是"买算力"的成本,两个折扣叠加才是智能体科学计算的真实报价,缺一层都不成立。这套成本框架来自我在 4sapi(https://4sapi.com)维护多模型中转时对弹性调度的日常实践。
欢迎在评论区聊聊手里有没有适合"碎片算力"的任务,以及智能体承接大工程时踩过的坑。