一句话描述推理服务需求(模型、请求量、延迟预算),系统在全部候选硬件与 API 中找约束下成本最低的方案——哪张卡、几张、自建还是 API、调哪家。
推荐引擎由服务端提供算力支持,保存到本地的副本无法运行。请访问官方站点使用。
延迟为简化估算(排队近似),实际以压测为准;成本价格按 data/prices.json 周更数据,截至日期见页头。自建成本 = 租赁 + 电费;API 成本 = 调用费。