Skip to main content

多模态文生图应用

多模态文生图应用1. 概念介绍1.1 什么是文生图(Text-to-Image)?****核心原理1.2 什么是 FastSDCPU?核心特点适用场景2.项目部署2.1部署环境2.2局域网访问2.3使用文生图功能2.4 部署成功后启动方法

由于ollama不支持文生图的功能,我们需要借助其他工具来实现本地文生图功能。


1. 概念介绍

1.1 什么是文生图(Text-to-Image)?

文生图是一种通过文字描述 自动生成对应图像的人工智能技术。只需输入一段文字(例如“一只戴着墨镜的柴犬在沙滩上冲浪”),AI 模型就会根据语义理解生成符合描述的图片,无需任何绘画或设计基础。

核心原理

  1. 语言理解 :AI 先解析你的文字,识别关键词(如“柴犬”“墨镜”“沙滩”)。
  2. 图像生成 :基于海量图像数据训练,AI 将文字转化为视觉元素,并组合成合理的画面。
  3. 风格适配 :可指定风格(写实、卡通、水彩等),AI 会调整生成效果。

1.2 什么是 FastSDCPU?

FastSDCPU 是一个专为 CPU 设备优化Stable Diffusion 文生图 开源项目。它通过算法与工程优化,实现在无 GPU 的普通计算机上快速生成高质量图像,显著降低 AI 绘画的硬件门槛。

核心特点

  1. 纯 CPU 运行 :无需独立显卡,可在笔记本、台式机或边缘设备上直接运行。
  2. 高速推理 :结合 Latent Consistency Models(LCM)等技术,仅需 4–8 步即可生成图像,大幅缩短等待时间。
  3. 轻量化部署 :支持模型量化(如 INT8)与 OpenVINO 加速,减少资源占用,提升响应效率。

适用场景

  • 本地化 AI 创作工具
  • 企业内网图像生成服务
  • 教学演示与原型开发
  • 资源受限环境下的轻量级部署

2.项目部署

2.1部署环境

注:若是使用我们的出厂镜像,无需部署环境,直接跳过部署步骤。直接参考最下面的 <2.4部署成功后启动方法> ,直接启动即可。

打开一个终端,然后执行以下代码:

​ x #如果主板上没有git,就先运行 sudo apt update sudo apt install git -y sudo apt install python3.10-venv -y ​ #添加环境变量 echo 'export PATH="$HOME/.local/bin:$PATH"' >> ~/.bashrc source ~/.bashrc ​ # 克隆项目代码 git clone https://github.com/rupeshs/fastsdcpu.git cd fastsdcpu ​ # 创建虚拟环境并安装依赖 python -m venv venv source venv/bin/activate ​ #安装uv curl -Ls https://astral.sh/uv/install.sh | sh(这一步如果在中国没有挂代理可能会无法成功,如果不超过可以跳过这一步,执行下一条命令) ​ #上一步使用curl命令安装uv不成功的就运行这三条指令 wget https://mirrors.huaweicloud.com/astral/uv/0.8.4/uv-aarch64-unknown-linux-gnu -O ~/.local/bin/uv chmod +x ~/.local/bin/uv ~/.local/bin/uv --version ​ chmod +x install.sh start-webui.sh ./install.sh --disable-gui

安装成功,按任意键退出:

image-20250801214649785

2.2局域网访问

启动之前,需要修改一个文件,用于支持局域网的访问,否则只能本地访问webui:

xxxxxxxxxx vim ~/fastsdcpu/src/frontend/webui/ui.py

打开 ui.py 文件之后,翻到最后一行,找到 webui.launch(share=share) 这句代码,修改成 webui.launch(server_name="0.0.0.0",share=share)

然后保存

启动:

xxxxxxxxxx ./start-webui.sh

image-20250801221311739

然后就可以在浏览器上面输入你的主板IP:7860 来访问这个webui了。

2.3使用文生图功能

在终端使用ifconfig查询我们主板的ip,例如我的是192.168.2.106。

然后我们就打开浏览器,输入 你的主板ip:7860 。例如我,就输入192.168.2.106:7860,然后就能进入webui了。

image-20250804105134704

接着我们点击LCM-LoRA,这个模型对内存的占用比较小,如果想使用其他模型,可以自行研究。

然后再点击Models,可以看到LCM LoRA的模型设置,可以自己更改自己想要的模型,也可以和我一样选择默认的就可以了。

image-20250804105439656

接着点击Generation Settings,将里面的Inference Steps拉高,可以提高生成图片的质量,我这里拉到5.

image-20250804111046973

接着继续回到我们的Text to Image中,在对话框里输入我们想生成的内容,接着按Generate,就可以开始生成图片了。

image-20250804105656393

首次使用的话,需要下载模型,可以在终端看到刚才默认选择的模型正在被下载中,等它下载完毕之后,就会开始执行文生图的功能。

image-20250804105710057

生成的结果:

image-20250804113118977

实测本项目对英文的支持会更好,生成的图片会更贴合文字。建议使用英文描述来生成图片。

2.4 部署成功后启动方法

xxxxxxxxxx cd fastsdcpu #进入fastsdcpu的目录 source venv/bin/activate #进入虚拟环境 ./start-webui.sh #启动webui

webui启动成功后,就在浏览器上输入你的主板IP:7860,就可以开始文生图功能了。