用 Jina 云端嵌入 API 替代本地 GPU 模型,无 GPU 也能部署视觉 RAG
将文档向量化交给 Jina 云端 API,服务端仅保留检索与工作流,省去 15GB 模型下载与 GPU 需求
方案简介
这是 LAYRA 针对无 GPU 或 GPU 资源受限用户的轻量部署配方:以 Jina-Embeddings-v4 云端 API 替代本地 ColQwen 嵌入模型,消除本地 GPU 需求。用户只需在 .env 中配置 Jina API Key 与嵌入模型参数,使用专用 compose 文件启动,即可获得与视觉 RAG 相同的能力——文档嵌入在云端完成,启动时无需下载任何模型权重,速度更快。适合没有大显存 GPU、希望快速体验 LAYRA 视觉 RAG 与工作流能力的个人开发者与中小团队。
亮点与能力
- 消除本地 GPU 需求,云端完成文档向量化
- 启动时不下载模型权重,部署快速
- 通过环境变量切换嵌入模型与 DPI 参数
- 同样接入 Milvus 向量库与 FastAPI 后端的完整 LAYRA 能力
组成与分工
- Jina-Embeddings-v4:云端多模态嵌入 API,负责将文档图像转为语义向量
- Milvus:存储嵌入向量,支撑视觉 RAG 检索
- FastAPI:LAYRA 后端服务框架
- Docker Compose:使用
docker-compose-no-local-embedding.yml编排无本地嵌入服务
实施步骤
1. 克隆仓库并编辑 .env
bash
git clone https://github.com/liweiphys/layra.git
cd layra
针对 Jina(云端 API)Embeddings v4 用户,配置:
bash
vim .env
EMBEDDING_IMAGE_DPI=100 # DPI for document-to-image conversion. Recommended: 100 - 200 (12.5k - 50k tokens/img)
EMBEDDING_MODEL=jina_embeddings_v4
JINA_API_KEY=your_jina_api_key
JINA_EMBEDDINGS_V4_URL=https://api.jina.ai/v1/embeddings
2. 启动无本地嵌入服务
bash
Initial startup will not download any model weights (fast!)
docker compose -f docker-compose-no-local-embedding.yml up -d --build
Monitor logs in real-time (replace with actual name)
docker compose logs -f
注意事项与常见问题
EMBEDDING_IMAGE_DPI推荐范围 100-200(对应每图 12.5k-50k tokens)- 需要有效的 Jina API Key 与 API 地址
- 同样需注意使用 Docker Compose v2,否则可尝试带连字符的
docker-compose
优缺点
- ✓ 无需本地 GPU
- ✓ 启动快不下载模型权重
- ✕ 需 Jina API Key
- ✕ 依赖外部云服务
出处
本方案挖掘自开源项目 liweiphys/layra,方案内容与实施命令均来自其 README 原文。
本方案由真实开源项目挖掘整理,实施命令均来自其 README 原文,安装使用请遵循项目开源协议。