openai/gpt-image-1 的 API 参考,由 Comfy Router 提供,模型源自 OpenAI。
快速开始
在你的 Comfy 工作区中创建密钥,并将其导出为COMFY_API_KEY。Python、TypeScript 和 Swift 代码片段使用 Comfy SDK(pip install comfy-sdk、npm install @comfyorg/sdk 以及 ComfySwiftSDK Swift 包);cURL 代码片段是通过原生 HTTP 进行的相同调用。
模型 ID: openai/gpt-image-1
端点: POST https://api.comfy.org/v2/models/openai/gpt-image-1
- 等待结果
- 排队,稍后收集
Schema
输入
string
背景透明度可能的值:
transparent、opaquestring | string[]
要编辑的源图像。此字段的出现即选定编辑操作:完全省略它则进行文生图生成。
模型公布的示例是生成调用,它省略了此字段。添加
image 就是两种模式之间的全部差异:相同的端点、相同的模型 id。区别只在于编辑提示描述的是你想要的更改而非场景,因此下面的编辑请求体读起来与生成示例不同,尽管结构上新增的只有这一个字段。
它可以原样复制:{"prompt": "give the rocketship rainbow coloring", "image": ["data:image/png;base64,iVBORw0KGgoAAAANSUhEUgAAAAEAAAABCAYAAAAfFcSJAAAADUlEQVR42mP8z8BQDwAEhQGAhKmMIQAAAABJRU5ErkJggg=="], "size": "1024x1024"}。该载荷是一个完整的 1x1 PNG,并非省略写法,而且该请求体在 Router 自身的请求验证测试中被顶固为可接受的用例。请替换为你自己图像的字节。
接受一张图像或一个图像数组;gpt-image-1 及更高版本最多接受 16 张,Router 会在派发之前依据此 schema 强制执行。string
单张图像,可以是 Router 代调用方抓取的 https URL,也可以是内联携带字节的
data:image/<format>;base64,<payload> URI。可接受的图像类型为 png、webp 和 jpeg,该集合在解析时强制执行,而非留给提供商:svg、gif、avif 或 tiff 会在此处被拒绝并指明你发送的图像,而不会在离原因两跳之外变成一个合作伙伴错误。
优先使用 URL 形式。base64 载荷大约膨胀 4/3,而整个请求体上限为 100 MiB,因此内联形式的上限约为 75 MB 的源图像;URL 则完全避开这一点。本描述末尾所述的每张图像与每请求媒体上限比请求体上限更严格,因此对于任何实际尺寸的图像,你会先遇到它们。
该 URL 必须无需你的凭据即可解析。Router 在服务器端抓取它,并且不会随请求发送任何调用方凭据,因此预签名 URL(签名位于查询字符串中的 URL)才是受支持的形式。诸如 /api/assets/{id}/content 这样的需认证端点会给 Router 返回 401 而非图像;请自行请求该 URL,并传入它重定向到的已签名 URL。
抓取被限定在一组具名主机内,而非开放互联网,并且同一份列表会重新应用于每一个重定向跳转以及你发送的 URL。因此,位于任何其他主机的 URL,或重定向离开该列表的 URL,都会在联系任何提供商之前被拒绝。目前该列表仅为 Comfy 自身的资产分发:位于 Comfy 资产存储桶下的已签名 storage.googleapis.com URL,也就是 /api/assets/{id}/content 重定向你到达的形式。合作伙伴 CDN 或普通的 https 主机不在该列表中。
两项放宽正在逐步推出,且目前默认均为关闭。它们通过同一个切换项发布并一起启用,因此请将以下所有内容视为即将推出,而非现在就能依赖的东西:在依赖其中任意一项之前请先询问。
第一项是 POST /customers/storage 将你的上传签名到其中的那个存储桶。在推广到达你的环境之前,来自该端点的上传 URL 会在此处被拒绝,即便该存储桶属于 Comfy 自己且主机是同一个,因此”先上传到 Comfy,再传入 URL”目前并不可行,可行的形式是 /api/assets/{id}/content 重定向到的已签名 URL。
第二项是按账户启用,而非对所有人一次性启用,因为这些主机背后的存储桶是你的而非我们的:即使上面的切换已打开,未启用第三方入站媒体的账户仍会被拒绝,并被以此措辞告知,而不是被告知主机不受支持。请联系你的 Comfy 对接人以为你的账户启用它。它额外允许以下第三方对象存储主机,其中的存储桶属于你,Router 对其不作任何所属声明:Cloudflare R2(<account>.r2.cloudflarestorage.com、<id>.r2.dev)、Amazon S3(s3.amazonaws.com 和 s3.<region>.amazonaws.com,路径样式或 <bucket>. 前缀形式均可)、Azure Blob Storage(<account>.blob.core.windows.net)以及阿里云 OSS(<bucket>.oss-<region>.aliyuncs.com,包括 oss-accelerate 端点)。这些具体是对象存储端点:同一提供商域名上的通用端点,例如阿里云函数计算触发器,不在该列表中,会被拒绝。
下面的示例仅展示形状:真实值还带有签名查询参数,此处有意省略,因为已发布的示例会永远留在 spec 中,而真实的签名既是泄露的凭据,也是一条会失效的链接。
每张图像上限为 25 MiB,单个请求的图像总量上限为 64 MiB。string
要运行的 gpt-image 模型。Router 会拼接所寻址的模型 id,因此寻址 /v2/models/openai/gpt-image-2 的调用方无需发送此字段。
string
内容审核设置可能的值:
low、autointeger
要生成的图像数量(1-10)。范围:
1 到 10integer
JPEG 或 WebP 的压缩级别(0-100)范围:
0 到 100string
输出图像的格式可能的值:
png、webp、jpegstring
必填
对要生成的图像、或要对
image 进行的编辑的文本描述。string
已生成或已编辑图像的质量可选值:
low、medium、high、standard、hdstring
图像尺寸(例如 1024x1024、1536x1024、auto)
string
用于终端用户监控的唯一标识符
GET /v2/models/openai/gpt-image-1/openapi.json 提供的 schema 生成,该文档与请求到达提供商之前用于校验调用的文档是同一份。
输出
object[]
string
Base64 编码的图像数据
string
修订后的提示词
string
图像的 URL
object
integer
object
integer
integer
integer
object
integer
integer
integer
string
生成图像的背景是
opaque 还是 transparent,即 OpenAI 为本次生成解析出的结果。请求参数默认为 auto,因此未固定该参数的调用方可以在这里得知实际生成的是哪一种。integer
生成完成时的 Unix 时间戳,单位为秒。它是 OpenAI 在图像生成响应中声明为 REQUIRED 的唯一成员,因此只要生产者是 OpenAI,它就会出现;由 fal 提供的
openai/gpt-image-2 响应则完全省略它,与其他四个已解析参数成员一样。声明为 int64,因为当前时代的 epoch 值足够接近 2^31,未经格式化的 integer 在许多 SDK 生成器中会生成 32 位字段。格式:int64string
data[].b64_json 中字节的编码格式:png、webp 或 jpeg。它是 OpenAI 实际编码所用的格式:发送了请求的 output_format 时即为该值,未发送时则为 png。因此解码器可以直接依据它,而不必再从请求中重新推断格式。string
本次生成实际使用的质量档位:OpenAI 会报告
low、medium、high、xhigh 或 max 之一。它是已解析的档位,而不是对请求的回显,因为请求自身的 quality 默认值为 auto。string
本次生成实际使用的像素尺寸,格式为
<width>x<height>。它是已解析的尺寸:请求的 size 默认值为 auto 且明确接受 auto,因此这里是唯一报告实际所用尺寸的地方。示例
输入
输出
发布前须知
SDK 会生成Idempotency-Key 并在自动重试中复用它。手动重试时,请复用原始 key。Router 最长可保持连接 10 分钟。
请求失败时,Router 会发送 X-Comfy-Error-Type 响应头说明原因。422 表示 Router 在调用提供商之前就拒绝了输入,413 表示请求体超出了 Router 可接受的大小。已生成的资源请及时下载,因为结果 URL 会过期。
上文任何字段描述中提到的尺寸限制,都是提供商对该字段自身的限定,引自提供商的规范。Router 会对整个请求体另行设置上限,base64 编码的媒体内容也计入其中:参见请求体大小。
本页记录的是通过 Comfy Router 调用的某一个合作伙伴模型。同一个 comfy-sdk / @comfyorg/sdk 包还提供第二个客户端,用于在 Comfy Cloud 上运行完整的 ComfyUI 工作流图:Comfy(api_key=...) / new Comfy({ apiKey }),并带有 client.workflows、client.assets 和 client.jobs。请参阅 Comfy SDKs。
请求头
身份验证、幂等性、请求 ID、错误分类、重试节奏、消费限额。
使用 Router API
模型发现、验证错误、重试与计费。
限制
Router 目前不支持的功能,以及替代方案。