---
title: "图像生成"
description: "为 Agent 选择图像模型，并在聊天中生成或修改图片。"
url: "https://ankole.agentbull.com/zh-Hans-CN/docs/image-generation/"
lang: "zh-Hans-CN"
---

> 面向 AI Agent 的文档索引：https://ankole.agentbull.com/zh-Hans-CN/llms.txt

# 图像生成

需要制作配图、概念图或视觉草稿时，可以为 Agent 启用图像生成。配置完成后，用户仍在原来的聊天窗口里提出要求，Agent 会把生成的图片作为附件发回。若所选模型支持参考图，还可以让 Agent 在原图上继续修改。

## 选择执行路径

公共 `image_generation` 工具有两条执行路径：

- **Hosted 路径：**配置 Agent 的 `image_generate` 档案。AIGateway 使用该档案的独立 Provider 和模型执行工具，再把结果交回主模型。
- **原生路径：**不配置 `image_generate`，并让主 Provider 声明支持原生图像生成。OpenAI 和 ChatGPT 订阅支持这条路径。AIGateway 会把公共工具透传给该 Provider。

因此，`image_generate` 是路由开关，不是能力开关。若该档案为空，且主 Provider 没有声明原生图像生成，AIGateway 会返回明确的配置错误。

使用 Hosted 路径：

1. 在 Console 的 **LLM Provider** 页面添加支持目标图像模型的 Provider。
2. 打开**智能体**，选择目标 Agent。
3. 在模型档案中找到 `image_generate`。
4. 选择图像 Provider 和模型，然后保存。
5. 回到聊天渠道，向 Agent 发出一条明确的图像请求。

主模型 token 用量记在主 Provider 的凭据上；图像 token 用量记在实际生成图像的凭据上，即使中途发生过池轮换也不会串账。

## 把要求写成一份视觉说明

图像请求不需要写得很长，但要让 Agent 知道这张图用在哪里、画什么，以及哪些地方不能自行发挥。先说用途和主体，再补构图、视觉风格和限制，比堆砌形容词更有效。

可以按下面五项来写，不需要机械地填满每一项：

- **用途与画幅**：说明图片用于网页、演示文稿还是社交媒体，并给出横版、竖版、方形或具体比例。
- **主体与场景**：说清画面中的主角、环境和正在发生的事。
- **构图与风格**：只写真正影响结果的视角、位置、留白、材质、光线或视觉媒介。
- **图片内文字**：把必须出现的原文放进引号，并说明位置。文字较长时，最好留在图片外排版。
- **限制**：明确不要出现的文字、水印、标志或物体；使用参考图时，也要写清哪些部分必须保持不变。

例如：

```text
用途：产品发布说明头图，16:9，网页标题将放在左侧。
主体：一台白色设备放在深蓝色桌面上，位于画面右侧。
画面：简洁的几何构图，柔和侧光，左侧保留大块空白。
文字：图片内只出现“ANKOLE 2.0”，位于右下角。
限制：不要人物、水印、其他品牌标志或额外文字。
```

不同模型对文字、尺寸和参考图的处理能力会有差异，具体以当前模型及其 Provider 的说明为准。

## 在同一会话中逐步修改

图片很少一次成稿。先让 Agent 生成一个方向，再在同一会话中逐步调整。每轮只改一个问题或一组相关问题，更容易控制结果，也不必从头复述整份要求。

修改现有图片时，要同时说明“改什么”和“保持什么”。例如：

```text
只把背景改成浅灰色。主体、构图、光线、文字位置和颜色都保持不变。
```

如果上传了多张参考图，请用“图 1”“图 2”分别说明它们的作用，例如用图 1 的主体和图 2 的配色。只有当前模型支持参考图或图像编辑时，这类要求才会生效。

## 没有生成图片时

- **Agent 只回复了文字**：确认客户端或 Agent 暴露了 `image_generation` 工具；再确认已经配置 `image_generate`，或主 Provider 支持原生图像生成。
- **找不到可选模型**：当前 LLM Provider 没有提供图像生成模型，请添加支持该能力的 Provider。
- **要求不受支持**：换用能力匹配的模型，或删去该模型不支持的尺寸、格式、透明背景、参考图或编辑要求。
- **图片生成了，但内容不符合要求**：这通常不是配置问题。回到同一会话，明确指出要修改和保持不变的部分。
- **生成成功但聊天中没有附件**：检查聊天渠道是否仍可上传文件，并查看该次对话的错误信息。

可用的尺寸、格式、透明背景、参考图和编辑能力，以 Console 中当前可选模型及其 Provider 的说明为准。
