Windows11 25H2系统+WSL2子系统本地部署fikrikarim/parlor
安装概述
- 系统:Windows 11 25H2
- 目标:WSL2 + Ubuntu 24.04 装到 D 盘 + 镜像网络 + 不用 uv/不用 conda + 直接系统 pip 装 Parlor 依赖 + 源码编译 llama.cpp CUDA 版 + 跑 Gemma 4 E2B + 浏览器对话
阶段一:Windows 侧(PowerShell 管理员)
1. 装 WSL2 平台 + Ubuntu 24.04(先落 C 盘,后面迁 D)
wsl --install -d Ubuntu-24.04装完会让你设 Linux 用户名/密码。设完退出。
2. 迁到 D 盘
wsl --shutdown
mkdir D:\WSL2
wsl --export Ubuntu-24.04 D:\WSL2\ubuntu24.tar
wsl --unregister Ubuntu-24.04
wsl --import Ubuntu-24.04 D:\WSL2\Ubuntu-24.04 D:\WSL2\ubuntu24.tar --version 2(以后物理文件在 D:\WSL2\Ubuntu-24.04\ext4.vhdx)
3. 写镜像网络配置(不重开 PowerShell,用 wsl --shutdown 重启 WSL 即可)
记事本写 C:\Users\你的Windows用户名\.wslconfig:
[wsl2]
networkingMode=mirrored
dnsTunneling=true
autoProxy=true
localhostForwarding=true
memory=12GB
processors=12然后 PowerShell 执行(这就是“重启 WSL 让配置生效”的命令,不需要关 PowerShell 窗口):
wsl --shutdown再进 Ubuntu 就已是镜像网络。
阶段二:进 WSL2 Ubuntu(开始菜单点 Ubuntu 24.04,或 wsl -d Ubuntu-24.04)
4. 基础包 + CUDA 用户态头文件
sudo apt update && sudo apt upgrade -y
sudo apt install -y python3.12 python3.12-venv python3-pip git curl cmake build-essential libcurl4-openssl-dev
sudo apt install -y nvidia-cuda-toolkit # 提供 nvcc + headers,匹配你 3060验证驱动穿透(不重开终端):
nvidia-smi5. 编译 llama.cpp CUDA 版(build ≥ 9503)
cd ~
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
cmake -B build -DGGML_CUDA=ON -DCMAKE_BUILD_TYPE=Release
cmake --build build -j$(nproc)
sudo ln -sf ~/llama.cpp/build/bin/llama-server /usr/local/bin/llama-server
llama-server --version # 应显示 build 10xxx6. 装 Parlor 的 Python 依赖(不用 uv、不用 conda,直接用系统 pip 装进一个 venv)
cd ~
git clone https://github.com/fikrikarim/parlor.git
cd parlor
python3.12 -m venv .venv
source .venv/bin/activate # ← 这条就是“不重开终端让 venv 生效”的命令
pip install -i https://pypi.tuna.tsinghua.edu.cn/simple --upgrade pip
pip install -i https://pypi.tuna.tsinghua.edu.cn/simple -e .7. 让 llama-server 路径对当前 shell 生效(不重开终端)
export PATH="/usr/local/bin:$PATH"
which llama-server # 当前终端立即认得8. 走 HF 镜像下模型(避免直连超时)
export HF_ENDPOINT=https://hf-mirror.com
export MODEL=e2b阶段三:启动 + 浏览器
9. 起 Parlor 服务(当前终端接着用)
cd ~/parlor
source .venv/bin/activate
export MODEL=e2b
export HF_ENDPOINT=https://hf-mirror.com
export PATH="/usr/local/bin:$PATH"
python src/parlor/server.py --host 0.0.0.0 --port 8000首次会自动从 HF 镜像下 gemma-4-E2B-it-qat-q4_0.gguf(~2.6GB)+ mmproj,加载完打印:
Uvicorn running on http://0.0.0.0:800010. Windows 浏览器打开
http://localhost:8000允许麦克风加摄像头 → 说话 → 英文口语老师对话。
11. 以后每次要运行时
打开Powershell输入wsl按回车再输入以下命令回车然后打开浏览器http://localhost:8000
cd ~/parlor && export PATH="/usr/local/bin:$PATH" && export HF_ENDPOINT=https://hf-mirror.com && export MODEL=e2b && .venv/bin/python src/parlor/server.py --host localhost --port 800012. 利用cloudflared tunnel实现手机也可以访问
cd ~
wget https://github.com/cloudflare/cloudflared/releases/latest/download/cloudflared-linux-amd64 -O cloudflared
chmod +x cloudflared
sudo mv cloudflared /usr/local/bin/运行以后打开一个新的wsl窗口执行
cloudflared tunnel --url http://localhost:8000