GitHub:google-ai-edge/gallery · ⭐ 18K+ · Kotlin/Dart · Apache 2.0
AI Edge Gallery是Google开源的Android应用,让用户完全离线在手机上运行开源大模型(如Gemma 4B/2B)。核心推理引擎是Google自研的LiteRT(原TensorFlow Lite),模型量化后仅1-4GB,普通手机即可流畅运行。
这不是一个Demo——它支持多轮对话、图片理解(VLM)、文本生成、代码补全等功能,且所有推理100%在设备本地完成,数据零上传、零泄露。iOS版本即将支持。
# 方式1:Google Play安装(推荐)
# 搜索 "AI Edge Gallery" 或访问:
# https://play.google.com/store/apps/details?id=com.google.ai.edge.gallery
# 方式2:下载APK
# 从GitHub Releases页面下载最新APK
# https://github.com/google-ai-edge/gallery/releases
# 方式3:源码编译
git clone https://github.com/google-ai-edge/gallery.git
cd gallery
flutter pub get
flutter build apk --release
| 模型 | 大小 | 最低内存 | 速度 |
|---|---|---|---|
| Gemma 2B | 1.4GB | 4GB | ~15 tok/s |
| Gemma 4B | 2.6GB | 6GB | ~8 tok/s |
| Gemma 7B(量化) | 4.1GB | 8GB | ~4 tok/s |
| Falcon 1B | 0.8GB | 3GB | ~25 tok/s |
| Phi-3 Mini | 2.2GB | 5GB | ~10 tok/s |
| 功能 | 说明 |
|---|---|
| 多轮对话 | 支持上下文记忆,可连续追问 |
| 图片理解 | 拍照或上传图片,模型描述内容(需Gemma 4B+) |
| 文本生成 | 写邮件、写文案、翻译、总结 |
| 代码补全 | 本地代码生成,适合隐私敏感场景 |
| 模型管理 | 一键下载/切换/删除模型,支持Hugging Face模型 |
| 离线运行 | 飞行模式下完全可用,数据不离开手机 |
# 1. 打开App → 选择模型 → 下载Gemma 2B(约1.4GB)
# 2. 等待下载完成 → 进入聊天界面
# 3. 开始对话:
# 用户:"帮我写一封请假邮件,理由是家里有事"
# 模型:(离线生成,无需联网)
# 4. 图片理解:
# 点击📷 → 拍一张照片 → "描述这张图片"
# 模型:识别物体、场景、文字(OCR)
# 5. 飞行模式测试:
# 开启飞行模式 → 仍然可以正常对话
相比 vLLM服务器端部署>,AI Edge Gallery无需GPU服务器,手机就是AI设备。代价是模型规模受限(最大7B量化版),但对日常简单任务足够使用。
| 场景 | 说明 |
|---|---|
| 隐私敏感 | 医疗/法律/金融文档处理,数据不出设备 |
| 离线环境 | 出差/地铁/无网络环境下使用AI助手 |
| 零成本AI | 无需API Key、无需订阅、无Token费用 |
| 移动办公 | 手机随手查资料、写文案、翻译 |
| 学习实验 | 体验端侧大模型能力,理解LiteRT推理流程 |
GitHub:google-ai-edge/gallery · ⭐ 18K+ · Kotlin/Dart · Apache 2.0
vLLM本地部署教程:2块卡跑70B大模型