開始輸入,可搜尋發票、服務、域名、工單,以及 更多...
為跨境業務搭建私有 AI 客服知識庫(RAG),最務實的做法是:把文件、向量資料庫和對話記錄放在自己掌控的獨立伺服器上,只在生成向量和回答時呼叫官方大模型 API。IMIDC 在日本東京、新加坡、台灣台北和美國洛杉磯提供獨立伺服器,這些地區都在 OpenAI、Anthropic Claude 和 Google Gemini API 的官方支援範圍內,能讓客戶資料留在其所服務的地區。
檢索增強生成(RAG)讓模型依據你自己的文件回答問題,而不是憑"記憶"作答,能明顯減少胡編亂造、確保回答符合公司政策。
流程並不複雜:把產品手冊、FAQ、退換貨政策、規格表和歷史工單解決方案切成小段,每段轉成向量(embedding)存入向量資料庫。客戶或客服提問時,系統先把問題向量化,檢索最相近的若幹段落,再把這些段落和問題一起發給大模型,由它生成帶引用來源的回答。
對於同時處理日文、英文和中文工單的跨境賣家,一個多語種索引即可服務所有渠道。
文件量大、資料要求嚴格或諮詢量穩定時,獨立伺服器更劃算:記憶體、硬碟和成本都是固定的,資料除你主動傳送的片段外不會離開伺服器。
| 對比項 | SaaS RAG 機器人 | IMIDC 獨立伺服器自建 RAG |
|---|---|---|
| 文件與對話記錄存放位置 | 服務商雲端,地區常不明確 | 你在東京、新加坡、台北或洛杉磯的伺服器 |
| 計費方式 | 按坐席、訊息數或文件數 | 固定月租 + 按 token 計費的 API 用量 |
| 向量容量 | 受套餐限制 | 只受記憶體和 NVMe 容量限制 |
| 許可權控制 | 服務商既定模式 | 按團隊、品牌、客戶等級自定義 ACL |
| 模型選擇 | 通常繫結一家 | 可在 OpenAI、Claude、Gemini 或本地 embedding 模型間切換 |
| 運維投入 | 低 | 需自行維護 Docker、備份和更新 |
記憶體是關鍵資源。100 萬個 1536 維 float32 向量約佔 6 GB 原始資料,另加索引開銷;Qdrant 和 pgvector 在索引全部駐留記憶體時效能最佳。配備 64–128 GB 記憶體的獨立伺服器足以同時容納向量、PostgreSQL、匯入程式和快取,也不會像小規格 VPS 那樣受"鄰居"干擾。
知識庫應部署在客戶所在地和資料合規要求所在地,並且只能選 AI API 官方支援的地區。
| IMIDC 機房 | 適合場景 | AI API 可用性 | 資料保護法規(簡述) |
|---|---|---|---|
| 日本東京 | 日本客戶、樂天/亞馬遜日本賣家 | 官方支援 | APPI(個人資訊保護法) |
| 新加坡 | 東南亞、多國聯合客服中心 | 官方支援 | PDPA |
| 台灣台北 | 繁體中文客服、台灣市場 | 官方支援 | 台灣個人資料保護法 |
| 美國洛杉磯 | 北美客戶、美國電商平台 | 官方支援 | 美國各州隱私法 |
| 香港 / 俄羅斯莫斯科 | 不建議用於此類業務 | 無官方服務 | — |
起步只需三個容器:向量資料庫、存放後設資料和對話歷史的 PostgreSQL,以及你自己的匯入/問答 API。
先安裝 Docker(可參考幫助中心的 Docker 安裝教程),再建立以下檔案。所有埠只繫結 127.0.0.1,對外統一通過 Nginx + HTTPS 釋出。
# docker-compose.yml - private RAG stack (all ports bound to localhost)
services:
qdrant:
image: qdrant/qdrant:v1.12.4
restart: unless-stopped
volumes:
- ./qdrant_storage:/qdrant/storage
ports:
- "127.0.0.1:6333:6333"
environment:
QDRANT__SERVICE__API_KEY: ${QDRANT_API_KEY}
postgres:
image: pgvector/pgvector:pg16
restart: unless-stopped
environment:
POSTGRES_USER: rag
POSTGRES_PASSWORD: ${PG_PASSWORD}
POSTGRES_DB: kb
volumes:
- ./pgdata:/var/lib/postgresql/data
ports:
- "127.0.0.1:5432:5432"
rag-api:
build: ./rag-api # your ingestion + retrieval + chat service
restart: unless-stopped
env_file: .env # OPENAI_API_KEY / ANTHROPIC_API_KEY / GEMINI_API_KEY
depends_on: [qdrant, postgres]
ports:
- "127.0.0.1:8080:8080" # publish through Nginx + HTTPS only
# .env (chmod 600, never commit)
QDRANT_API_KEY=change-me-long-random
PG_PASSWORD=change-me-long-random
OPENAI_API_KEY=sk-...
ANTHROPIC_API_KEY=sk-ant-...
EMBED_MODEL=text-embedding-3-small
CHUNK_TOKENS=500
CHUNK_OVERLAP=60
如果只想維護一個資料庫,可以去掉 Qdrant,用 pgvector 同時存後設資料和向量:
-- pgvector alternative: one table, one HNSW index
CREATE EXTENSION IF NOT EXISTS vector;
CREATE TABLE chunks (
id bigserial PRIMARY KEY,
doc_id text NOT NULL,
lang text,
acl text[], -- which teams/customers may see it
content text NOT NULL,
embedding vector(1536)
);
CREATE INDEX ON chunks USING hnsw (embedding vector_cosine_ops);
向量超過數百萬條、需要 payload 過濾或量化壓縮時,Qdrant 更合適;團隊本身就在用 PostgreSQL 時,pgvector 更省心。匯入前先確認伺服器能正常訪問 API:
# confirm the API endpoints are reachable from this server
curl -s -o /dev/null -w "%{http_code}\n" https://api.openai.com/v1/models \
-H "Authorization: Bearer $OPENAI_API_KEY"
curl -s -o /dev/null -w "%{http_code}\n" https://api.anthropic.com/v1/models \
-H "x-api-key: $ANTHROPIC_API_KEY" -H "anthropic-version: 2023-06-01"
回答質量更多取決於切分和後設資料,而不是模型本身。
資料庫部署在當地有幫助,但發給大模型 API 的文本會由服務商處理,因此要儘量減少並記錄離開伺服器的資料。
以上為一般性資訊,不構成法律意見,具體義務請諮詢專業律師。
先按向量規模和併發量確定配置,再選離客戶最近的機房。
新加坡伺服器以及自定義記憶體/硬碟配置請聯絡 IMIDC 銷售。從其他服務商遷移過來?IMIDC 提供免費伺服器遷移。
IMIDC 在東京和新加坡提供帶當地原生 IP 的獨立伺服器,當地可官方使用 OpenAI、Claude、Gemini API。向量資料庫和文件都在你自己的硬體上,按固定月租計費。
如果依賴 OpenAI、Claude 或 Gemini API 則不行:這些服務在香港、中國大陸和俄羅斯均未官方開放。基於 API 的 AI 業務請選擇東京、新加坡、台北或洛杉磯。
每 100 萬個 1536 維向量約需 6 GB,未含索引開銷,建議按兩倍規劃給 HNSW 索引和其他元件。Qdrant 的標量量化可把向量記憶體降到約四分之一。
僅靠機房位置無法實現合規。本地儲存能簡化問題,但仍需合法目的、告知義務以及對傳送給 API 服務商資料的保護措施;本文不構成法律意見。
準備搭建你的客服知識庫?可對比 東京獨立伺服器、台北獨立伺服器 和 洛杉磯獨立伺服器,新加坡及大記憶體定製配置請 聯絡 IMIDC 銷售。老客戶也可以 提交工單 獲取配置建議。