编写提示词
描述场景、主体与光线。具体的提示词比含糊的提示词能生成更好的图片。
描述一个画面,Z-Image-Turbo 就在你自己的机器上作画。模型只从 Hugging Face 获取一次并缓存在你的浏览器中,因此 73hi 服务器从不承载模型,你的提示词也绝不上传。
尚未检查 GPU。检查不会下载模型文件。
Windows 上的 Chrome 使用分配给浏览器的 GPU。此页面无法列出所有已安装的显卡,也无法切换到浏览器未暴露的显卡。
chrome://flags/#force-high-performance-gpu,在可用时启用该选项,然后重启 Chrome。这会请求高性能 GPU;它不会按名称选择显卡。如果两个 Windows 选项都显示同一块不想要的显卡,仅选择高性能并不会选中你的另一块 GPU。浏览器必须先暴露那块显卡。GPU 名称可能以厂商和架构报告,而非完整型号名称。
Chrome 在 Windows 上的 GPU 限制先加载模型,然后输入提示词并生成。
首次加载模型会从 Hugging Face 下载约 5.5 GB,因此可能需要几分钟,网络慢时更久。 请保持此标签页打开,直到进度条完成。当浏览器存储可用时文件会被缓存;选择本地文件可跳过下载。 在获取任何模型文件之前会先运行一个小的 GPU 测试。你的浏览器必须暴露一块支持 WebGPU f16 着色器的 GPU。在有多块 GPU 的电脑上,你可能需要在系统显示卡设置中为浏览器 选择一块兼容的 GPU,并完全重启浏览器。
你的图片会显示在这里
上面每个文件名都是直链,因此点击某个文件名只会下载该文件;.onnx_data
配套文件必须与其计算图一起获取,手动加载才能生效。INT4 ONNX 版本位于
huggingface.co/webnn/Z-Image-Turbo。
Hugging Face 允许跨域请求,因此本页面直接从 Hub 拉取。
无需账号、无需排队、无需往返服务器,从文字作画。
描述场景、主体与光线。具体的提示词比含糊的提示词能生成更好的图片。
选择加载模型并等待文件就绪,然后选择生成。生成使用已加载的文件,绝不下载模型。
去噪步骤完成后,图片会绘制在画布上,可下载为 PNG。
整个流程都在页面内运行:提示词被编码,一个隐变量被去噪若干步,然后 VAE 把它变成像素。
| 阶段 | 做什么 | 在哪里运行 |
|---|---|---|
| Tokenizer 与文本编码器 | 把你的提示词转成模型能理解的嵌入 | 你的浏览器 |
| Transformer | 预测调度中每一步要去除的噪声 | 你的浏览器 |
| 调度器辅助 | 应用 flow matching 步骤并产生下一个隐变量 | 你的浏览器 |
| VAE 解码器 | 把完成的隐变量转换成可见图像 | 你的浏览器 |
一次性成本:模型文件合计约 5.5 GB。它们来自 Hugging Face 而非 73hi,你的浏览器会为下次访问缓存它们。
在不把提示词交给第三方的前提下作画所需的一切。
提示词和图片绝不离开你的设备。只下载模型。
借助 WebGPU,去噪循环在你的显卡上运行,因此一张图片只需几秒而非几分钟。
选择分辨率、步数与随机种子,即可精确复现任意图片。
无需注册、没有每日上限,你生成的任何内容都没有水印。
页面直接从 Hugging Face 下载 Z-Image-Turbo 的 INT4 ONNX 版本,后者以宽松的跨域响应头提供该文件。73hi 服务器从不存储或转发模型。
即使采用 4 bit 量化,文本编码器与 transformer 合计仍约 5.5 GB。首次运行后它们会缓存在你的浏览器中。
需要。仅 transformer 权重就有 3.44 GB,而 WebAssembly 后端是为 wasm32 构建的,其全部内存上限为 4 GB,因此模型根本放不下。WebGPU 转而把权重流式传输到你的显卡,这是此模型在浏览器中运行的唯一方式。请使用 Chrome 或 Edge 130 及更新版本。
不会。提示词的编码与生成完全在你的设备上完成。只下载模型和很小的 tokenizer。
权重在每种分辨率下都相同,但 transformer 内部的注意力图会随图像 token 数量的平方增长。512 x 512 的图片在 64 x 64 的隐变量上运算,即 4,096 个 token;而 1024 x 1024 在 128 x 128 的隐变量上运算,即 16,384 个 token,中间数据是前者的十六倍。那是显存的问题,而非 WebAssembly:运行时已经向适配器请求它所能提供的最大限制。如果 1024 在你的显卡上失败,请先用 768;在 768 及以上分辨率时,工具会在去噪循环前释放文本编码器,尽可能为图片本身留出更多内存。
留空则没有任何变化。填写它并把引导系数设为大于 1,即运行无分类器引导(classifier free guidance):每一步都会针对两个提示词分别评估模型并合并结果,从而让图片远离你列出的内容。引导系数为 1 表示不引导。由于 Z-Image-Turbo 是一个蒸馏的少步模型,请把该值保持在较低水平,约 1.2 到 2,因为更高的值往往会让图片过饱和。注意引导会使 transformer 的推理次数翻倍,因此一张图片大约需要两倍时间。
能。用文件选择器选取模型文件,工具会使用本地副本,而不会再次下载。