Laya 能在 CPU 上运行吗?
2026 年 9 月 24 日的项目报告使用 AWS m7a.xlarge:AMD EPYC 9R14、4 个物理核心、16 GiB 内存、Linux、无 swap;Laya 0.3.20,fp32、4 线程,PyTorch 2.14.0、Transformers 5.17.0,检查点版本为 55cf4c4。
| 检查点 | 1 个问题 | 5 | 10 | 50 |
|---|---|---|---|---|
| english | 580 ms | 3,072 ms | 6,244 ms | 35,969 ms |
| multilingual | 193 ms | 912 ms | 1,842 ms | 11,157 ms |
| typed-decisions | 584 ms | 2,819 ms | 6,031 ms | 35,653 ms |
表中为 p50,每行预热 2 次后计时 10 次,是进程内测量而非 HTTP 请求。整个脚本峰值 RSS 为 9.31 GiB,同时最多加载 5 个检查点;不能把它当作单模型最低内存。
查看原始 CPU 测量 JSON ↓Laya 需要什么 GPU?
GPU 可用于加速,但以下数据来自不同测试条件,不能作为统一硬件排行榜。
| 公开测试配置 | 单问题延迟 | 测量范围 |
|---|---|---|
| Tesla T4 · multilingual | 32.8 ms p50 | 项目 Colab 测试,常规路径 |
| RTX 4070 Ti SUPER · multilingual | 14.1 ms 常规 / 2.8 ms 加速 | 输入 72 token;含分词的 agent.predict 端到端耗时;TileLang 加速路径 |
| NVIDIA GB10 · typed-decisions | 100.2 ms p50 / 169.3 ms p95 | laya 0.3.5、HTTP 包装、共享 GPU;预热后 40 次调用 |
RTX 加速路径需要可选的 TileLang 等依赖,新长度桶首次使用有编译开销。GB10 数据包含 HTTP 包装开销且使用共享 GPU,因此更贵的 GPU 不一定让单次请求更快。
Laya 需要多少内存和显存?
README 列出英文和 typed-decisions 检查点为 421M 参数,多语言检查点为 322M 参数。参数量乘以每个权重的字节数,只能得到纯权重的估算:
| 检查点 规模 | 仅 FP32 权重 | 仅 16 位权重 |
|---|---|---|
| 421M 参数 | ≈ 1.68 GB | ≈ 0.84 GB |
| 322M 参数 | ≈ 1.29 GB | ≈ 0.64 GB |
这里使用十进制 GB,不是实测 RAM 或 VRAM。还需要考虑激活值、分词器、运行时、下载文件、并发以及额外检查点。现有报告没有给出通用最低显存。
文档要求 Python 3.10 或更新版本;PyTorch 安装包要匹配实际平台。安装成功不代表正在使用 CUDA、MPS 或 XPU。
从什么配置开始?
小规模试用可先用现有机器、一个检查点,记录内存峰值和预热后的延迟,再增加输入长度。参考公开 CPU 配置,16 GiB 内存可作为实验起点,但不能保证任何任务都足够。
生产部署前,应测量实际输入、队列和并发下的延迟,再决定租用资源。
来源与核查说明
资料核查日期:2026 年 9 月 27 日。本站未重新执行模型推理;引用的测试结果属于原作者,产品文档可能继续更新。
- Laya 测试报告 — 硬件与测量条件
- Laya README — 模型规模与依赖要求