图像生成
需要制作配图、概念图或视觉草稿时,可以为 Agent 启用图像生成。配置完成后,用户仍在原来的聊天窗口里提出要求,Agent 会把生成的图片作为附件发回。若所选模型支持参考图,还可以让 Agent 在原图上继续修改。
选择执行路径
公共 image_generation 工具有两条执行路径:
- **Hosted 路径:**配置 Agent 的
image_generate档案。AIGateway 使用该档案的独立 Provider 和模型执行工具,再把结果交回主模型。 - **原生路径:**不配置
image_generate,并让主 Provider 声明支持原生图像生成。OpenAI 和 ChatGPT 订阅支持这条路径。AIGateway 会把公共工具透传给该 Provider。
因此,image_generate 是路由开关,不是能力开关。若该档案为空,且主 Provider 没有声明原生图像生成,AIGateway 会返回明确的配置错误。
使用 Hosted 路径:
- 在 Console 的 LLM Provider 页面添加支持目标图像模型的 Provider。
- 打开智能体,选择目标 Agent。
- 在模型档案中找到
image_generate。 - 选择图像 Provider 和模型,然后保存。
- 回到聊天渠道,向 Agent 发出一条明确的图像请求。
主模型 token 用量记在主 Provider 的凭据上;图像 token 用量记在实际生成图像的凭据上,即使中途发生过池轮换也不会串账。
把要求写成一份视觉说明
图像请求不需要写得很长,但要让 Agent 知道这张图用在哪里、画什么,以及哪些地方不能自行发挥。先说用途和主体,再补构图、视觉风格和限制,比堆砌形容词更有效。
可以按下面五项来写,不需要机械地填满每一项:
- 用途与画幅:说明图片用于网页、演示文稿还是社交媒体,并给出横版、竖版、方形或具体比例。
- 主体与场景:说清画面中的主角、环境和正在发生的事。
- 构图与风格:只写真正影响结果的视角、位置、留白、材质、光线或视觉媒介。
- 图片内文字:把必须出现的原文放进引号,并说明位置。文字较长时,最好留在图片外排版。
- 限制:明确不要出现的文字、水印、标志或物体;使用参考图时,也要写清哪些部分必须保持不变。
例如:
用途:产品发布说明头图,16:9,网页标题将放在左侧。
主体:一台白色设备放在深蓝色桌面上,位于画面右侧。
画面:简洁的几何构图,柔和侧光,左侧保留大块空白。
文字:图片内只出现“ANKOLE 2.0”,位于右下角。
限制:不要人物、水印、其他品牌标志或额外文字。
不同模型对文字、尺寸和参考图的处理能力会有差异,具体以当前模型及其 Provider 的说明为准。
在同一会话中逐步修改
图片很少一次成稿。先让 Agent 生成一个方向,再在同一会话中逐步调整。每轮只改一个问题或一组相关问题,更容易控制结果,也不必从头复述整份要求。
修改现有图片时,要同时说明“改什么”和“保持什么”。例如:
只把背景改成浅灰色。主体、构图、光线、文字位置和颜色都保持不变。
如果上传了多张参考图,请用“图 1”“图 2”分别说明它们的作用,例如用图 1 的主体和图 2 的配色。只有当前模型支持参考图或图像编辑时,这类要求才会生效。
没有生成图片时
- Agent 只回复了文字:确认客户端或 Agent 暴露了
image_generation工具;再确认已经配置image_generate,或主 Provider 支持原生图像生成。 - 找不到可选模型:当前 LLM Provider 没有提供图像生成模型,请添加支持该能力的 Provider。
- 要求不受支持:换用能力匹配的模型,或删去该模型不支持的尺寸、格式、透明背景、参考图或编辑要求。
- 图片生成了,但内容不符合要求:这通常不是配置问题。回到同一会话,明确指出要修改和保持不变的部分。
- 生成成功但聊天中没有附件:检查聊天渠道是否仍可上传文件,并查看该次对话的错误信息。
可用的尺寸、格式、透明背景、参考图和编辑能力,以 Console 中当前可选模型及其 Provider 的说明为准。