开始输入,可搜索发票、服务、域名、工单,以及 更多...
为跨境业务搭建私有 AI 客服知识库(RAG),最务实的做法是:把文档、向量数据库和对话记录放在自己掌控的独立服务器上,只在生成向量和回答时调用官方大模型 API。IMIDC 在日本东京、新加坡、台湾台北和美国洛杉矶提供独立服务器,这些地区都在 OpenAI、Anthropic Claude 和 Google Gemini API 的官方支持范围内,能让客户数据留在其所服务的地区。
检索增强生成(RAG)让模型依据你自己的文档回答问题,而不是凭"记忆"作答,能明显减少胡编乱造、确保回答符合公司政策。
流程并不复杂:把产品手册、FAQ、退换货政策、规格表和历史工单解决方案切成小段,每段转成向量(embedding)存入向量数据库。客户或客服提问时,系统先把问题向量化,检索最相近的若干段落,再把这些段落和问题一起发给大模型,由它生成带引用来源的回答。
对于同时处理日文、英文和中文工单的跨境卖家,一个多语种索引即可服务所有渠道。
文档量大、数据要求严格或咨询量稳定时,独立服务器更划算:内存、硬盘和成本都是固定的,数据除你主动发送的片段外不会离开服务器。
| 对比项 | SaaS RAG 机器人 | IMIDC 独立服务器自建 RAG |
|---|---|---|
| 文档与对话记录存放位置 | 服务商云端,地区常不明确 | 你在东京、新加坡、台北或洛杉矶的服务器 |
| 计费方式 | 按坐席、消息数或文档数 | 固定月租 + 按 token 计费的 API 用量 |
| 向量容量 | 受套餐限制 | 只受内存和 NVMe 容量限制 |
| 权限控制 | 服务商既定模式 | 按团队、品牌、客户等级自定义 ACL |
| 模型选择 | 通常绑定一家 | 可在 OpenAI、Claude、Gemini 或本地 embedding 模型间切换 |
| 运维投入 | 低 | 需自行维护 Docker、备份和更新 |
内存是关键资源。100 万个 1536 维 float32 向量约占 6 GB 原始数据,另加索引开销;Qdrant 和 pgvector 在索引全部驻留内存时性能最佳。配备 64–128 GB 内存的独立服务器足以同时容纳向量、PostgreSQL、导入程序和缓存,也不会像小规格 VPS 那样受"邻居"干扰。
知识库应部署在客户所在地和数据合规要求所在地,并且只能选 AI API 官方支持的地区。
| IMIDC 机房 | 适合场景 | AI API 可用性 | 数据保护法规(简述) |
|---|---|---|---|
| 日本东京 | 日本客户、乐天/亚马逊日本卖家 | 官方支持 | APPI(个人信息保护法) |
| 新加坡 | 东南亚、多国联合客服中心 | 官方支持 | PDPA |
| 台湾台北 | 繁体中文客服、台湾市场 | 官方支持 | 台湾个人资料保护法 |
| 美国洛杉矶 | 北美客户、美国电商平台 | 官方支持 | 美国各州隐私法 |
| 香港 / 俄罗斯莫斯科 | 不建议用于此类业务 | 无官方服务 | — |
起步只需三个容器:向量数据库、存放元数据和对话历史的 PostgreSQL,以及你自己的导入/问答 API。
先安装 Docker(可参考帮助中心的 Docker 安装教程),再创建以下文件。所有端口只绑定 127.0.0.1,对外统一通过 Nginx + HTTPS 发布。
# docker-compose.yml - private RAG stack (all ports bound to localhost)
services:
qdrant:
image: qdrant/qdrant:v1.12.4
restart: unless-stopped
volumes:
- ./qdrant_storage:/qdrant/storage
ports:
- "127.0.0.1:6333:6333"
environment:
QDRANT__SERVICE__API_KEY: ${QDRANT_API_KEY}
postgres:
image: pgvector/pgvector:pg16
restart: unless-stopped
environment:
POSTGRES_USER: rag
POSTGRES_PASSWORD: ${PG_PASSWORD}
POSTGRES_DB: kb
volumes:
- ./pgdata:/var/lib/postgresql/data
ports:
- "127.0.0.1:5432:5432"
rag-api:
build: ./rag-api # your ingestion + retrieval + chat service
restart: unless-stopped
env_file: .env # OPENAI_API_KEY / ANTHROPIC_API_KEY / GEMINI_API_KEY
depends_on: [qdrant, postgres]
ports:
- "127.0.0.1:8080:8080" # publish through Nginx + HTTPS only
# .env (chmod 600, never commit)
QDRANT_API_KEY=change-me-long-random
PG_PASSWORD=change-me-long-random
OPENAI_API_KEY=sk-...
ANTHROPIC_API_KEY=sk-ant-...
EMBED_MODEL=text-embedding-3-small
CHUNK_TOKENS=500
CHUNK_OVERLAP=60
如果只想维护一个数据库,可以去掉 Qdrant,用 pgvector 同时存元数据和向量:
-- pgvector alternative: one table, one HNSW index
CREATE EXTENSION IF NOT EXISTS vector;
CREATE TABLE chunks (
id bigserial PRIMARY KEY,
doc_id text NOT NULL,
lang text,
acl text[], -- which teams/customers may see it
content text NOT NULL,
embedding vector(1536)
);
CREATE INDEX ON chunks USING hnsw (embedding vector_cosine_ops);
向量超过数百万条、需要 payload 过滤或量化压缩时,Qdrant 更合适;团队本身就在用 PostgreSQL 时,pgvector 更省心。导入前先确认服务器能正常访问 API:
# confirm the API endpoints are reachable from this server
curl -s -o /dev/null -w "%{http_code}\n" https://api.openai.com/v1/models \
-H "Authorization: Bearer $OPENAI_API_KEY"
curl -s -o /dev/null -w "%{http_code}\n" https://api.anthropic.com/v1/models \
-H "x-api-key: $ANTHROPIC_API_KEY" -H "anthropic-version: 2023-06-01"
回答质量更多取决于切分和元数据,而不是模型本身。
数据库部署在当地有帮助,但发给大模型 API 的文本会由服务商处理,因此要尽量减少并记录离开服务器的数据。
以上为一般性信息,不构成法律意见,具体义务请咨询专业律师。
先按向量规模和并发量确定配置,再选离客户最近的机房。
新加坡服务器以及自定义内存/硬盘配置请联系 IMIDC 销售。从其他服务商迁移过来?IMIDC 提供免费服务器迁移。
IMIDC 在东京和新加坡提供带当地原生 IP 的独立服务器,当地可官方使用 OpenAI、Claude、Gemini API。向量数据库和文档都在你自己的硬件上,按固定月租计费。
如果依赖 OpenAI、Claude 或 Gemini API 则不行:这些服务在香港、中国大陆和俄罗斯均未官方开放。基于 API 的 AI 业务请选择东京、新加坡、台北或洛杉矶。
每 100 万个 1536 维向量约需 6 GB,未含索引开销,建议按两倍规划给 HNSW 索引和其他组件。Qdrant 的标量量化可把向量内存降到约四分之一。
仅靠机房位置无法实现合规。本地存储能简化问题,但仍需合法目的、告知义务以及对发送给 API 服务商数据的保护措施;本文不构成法律意见。
准备搭建你的客服知识库?可对比 东京独立服务器、台北独立服务器 和 洛杉矶独立服务器,新加坡及大内存定制配置请 联系 IMIDC 销售。老客户也可以 提交工单 获取配置建议。