应用介绍
想要一个能看图、读文档、理解视频的多模态模型,闭源 API 贵,数据还得传出去。InternVL 是上海 AI 实验室的开源多模态对话模型系列,表现接近 GPT-4o。
它覆盖从 1B 到数百亿参数的多个尺寸,擅长 OCR、图表理解和视频问答,可本地部署和微调。
图文理解:看图问答。
文档 OCR:表格与图表。
视频理解:长视频问答。
多尺寸:端侧到服务器。
它覆盖从 1B 到数百亿参数的多个尺寸,擅长 OCR、图表理解和视频问答,可本地部署和微调。
软件功能
图文理解:看图问答。
文档 OCR:表格与图表。
视频理解:长视频问答。
多尺寸:端侧到服务器。

