模型
各模块使用的模型、大小和许可证,以及模型下载说明
TopLocal Studio 的安装包里不包含任何模型,你只需在应用内下载自己要用的模型。下表中的大小均为近似值。
图片
| 模型 | 大小 | 适合做什么 | 许可证 |
|---|---|---|---|
| Z-Image-Turbo | 5.5 GB | 快速文生图 | Apache-2.0 |
| FLUX.2 klein 4B | 4.3 GB | 文生图和改图,适合内存较少的电脑 | Apache-2.0 |
| FLUX.2 klein 9B | 8.9 GB | 文生图和改图,细节更丰富 | FLUX Non-Commercial(非商业) |
视频
| 模型 | 大小 | 适合做什么 | 许可证 |
|---|---|---|---|
| LTX-2.5 Distilled | 约 30 GB | 用文字或图片生成带声音的短视频(3/5/8 秒,480p/720p),需要 24 GB 及以上内存 | LTX-2.x Community License |
音乐
| 模型 | 大小 | 适合做什么 | 许可证 |
|---|---|---|---|
| ACE-Step 1.5 | 6.2 GB | 根据描述生成完整歌曲,可用自己的歌词,也可生成纯音乐 | MIT |
| YuE2 | 4.6 GB | 中文演唱的歌曲 | CC BY-NC 4.0(非商业) |
| Qwen3-4B(作词助手) | 2.5 GB | 帮你起草歌词 | Apache-2.0 |
语音
| 模型 | 大小 | 适合做什么 | 许可证 |
|---|---|---|---|
| Qwen3-ASR 0.6B | 1.2 GB | 语音转文字,导出 TXT 和 SRT,体积较小 | Apache-2.0 |
| Qwen3-ASR 1.7B | 2.5 GB | 语音转文字,导出 TXT 和 SRT,模型更大 | Apache-2.0 |
| SenseVoice | 0.25 GB | 语音转文字,下载体积很小 | FunASR Model License |
| Kokoro | 0.2 GB | 文字转语音,下载体积很小 | Apache-2.0 |
| Qwen3-TTS | 2 GB | 文字转语音,支持声音克隆 | Apache-2.0 |
许可证与生成内容
应用本身的代码采用 Apache-2.0 许可证。每个模型都有各自的许可证,用该模型生成的内容也受其约束。应用会在下载每个模型之前显示它的许可证。
部分许可证不允许商业使用,例如 FLUX Non-Commercial(FLUX.2 klein 9B)和 CC BY-NC 4.0(YuE2)。如果你打算把生成结果用于商业用途,请选择允许商用的模型,并仔细阅读许可证原文。
下载说明
- 模型默认从 Hugging Face 下载;开启镜像后改从镜像下载。
- 下载中断后可以断点续传。
- 每个下载的文件在使用前都会做 sha256 校验。
- 模型保存在应用的数据文件夹中,具体位置见快速上手。
视频模型需要 Hugging Face 令牌
只有 LTX-2.5 视频模型需要 Hugging Face 访问令牌(Access Token),其他模型都不需要。
获取方法:登录 huggingface.co,在账号设置里创建一个访问令牌,然后在下载视频模型之前把它填入 TopLocal Studio。
国内镜像
在中国大陆直接从 Hugging Face 下载可能很慢,甚至失败。可以在应用设置里开启国内镜像,改从 hf-mirror.com 下载模型。