AI Edge Gallery:Google手机端离线大模型教程

GitHub:google-ai-edge/gallery · ⭐ 18K+ · Kotlin/Dart · Apache 2.0

项目简介

AI Edge Gallery是Google开源的Android应用,让用户完全离线在手机上运行开源大模型(如Gemma 4B/2B)。核心推理引擎是Google自研的LiteRT(原TensorFlow Lite),模型量化后仅1-4GB,普通手机即可流畅运行。

这不是一个Demo——它支持多轮对话、图片理解(VLM)、文本生成、代码补全等功能,且所有推理100%在设备本地完成,数据零上传、零泄露。iOS版本即将支持。

安装

# 方式1:Google Play安装(推荐)
# 搜索 "AI Edge Gallery" 或访问:
# https://play.google.com/store/apps/details?id=com.google.ai.edge.gallery

# 方式2:下载APK
# 从GitHub Releases页面下载最新APK
# https://github.com/google-ai-edge/gallery/releases

# 方式3:源码编译
git clone https://github.com/google-ai-edge/gallery.git
cd gallery
flutter pub get
flutter build apk --release

支持模型与硬件要求

模型大小最低内存速度
Gemma 2B1.4GB4GB~15 tok/s
Gemma 4B2.6GB6GB~8 tok/s
Gemma 7B(量化)4.1GB8GB~4 tok/s
Falcon 1B0.8GB3GB~25 tok/s
Phi-3 Mini2.2GB5GB~10 tok/s

核心功能

功能说明
多轮对话支持上下文记忆,可连续追问
图片理解拍照或上传图片,模型描述内容(需Gemma 4B+)
文本生成写邮件、写文案、翻译、总结
代码补全本地代码生成,适合隐私敏感场景
模型管理一键下载/切换/删除模型,支持Hugging Face模型
离线运行飞行模式下完全可用,数据不离开手机

快速使用

# 1. 打开App → 选择模型 → 下载Gemma 2B(约1.4GB)

# 2. 等待下载完成 → 进入聊天界面

# 3. 开始对话:
# 用户:"帮我写一封请假邮件,理由是家里有事"
# 模型:(离线生成,无需联网)

# 4. 图片理解:
# 点击📷 → 拍一张照片 → "描述这张图片"
# 模型:识别物体、场景、文字(OCR)

# 5. 飞行模式测试:
# 开启飞行模式 → 仍然可以正常对话

相比 vLLM服务器端部署>,AI Edge Gallery无需GPU服务器,手机就是AI设备。代价是模型规模受限(最大7B量化版),但对日常简单任务足够使用。

适用场景

场景说明
隐私敏感医疗/法律/金融文档处理,数据不出设备
离线环境出差/地铁/无网络环境下使用AI助手
零成本AI无需API Key、无需订阅、无Token费用
移动办公手机随手查资料、写文案、翻译
学习实验体验端侧大模型能力,理解LiteRT推理流程

📚 常见问题

AI Edge Gallery是什么?

GitHub:google-ai-edge/gallery · ⭐ 18K+ · Kotlin/Dart · Apache 2.0

如何上手AI Edge Gallery?

vLLM本地部署教程:2块卡跑70B大模型