MultiVis-1.0是专注于图文交互的多模态模型,支持图像理解、图文生成、视觉问答(VQA)。基于ViT+LLM融合架构,部署包仅2.8GB。
图像理解:识别场景、物体、文字(OCR)并生成解读
视觉问答:输入图片+问题,AI回答关于图片的内容
图文生成:根据图片内容生成描述性文字
格式支持:JPG/PNG/WEBP,分辨率最高4K
内置中文视觉知识库:无需额外配置即可处理中文场景
docker pull multivis/multivis-1.0:latest docker run -d -p 8080:8080 --name multivis multivis/multivis-1.0:latest
访问 http://localhost:8080 即可使用Web界面。
from multivis import MultiVis
mv = MultiVis.load()
result = mv.analyze("image.jpg", question="这张图片里有什么?")
print(result)
MultiVis提供RESTful API,可直接对接客服系统。用户发送图片,MultiVis自动识别并回复。
智能客服(图片问诊)、图像分析系统、无障碍辅助(为视障用户描述图片)、内容审核(图片内容识别)
MultiVis-1.0是专注于图文交互的多模态模型,支持图像理解、图文生成、视觉问答(VQA)。基于ViT+LLM融合架构,部署包仅2.8GB。