写在前面
Gemini 3.5是Google的多模态AI模型,大多数人用它聊天、写文章,觉得"还行"。但其实它的多模态能力才是真正的杀手锏——能看图、能听音频、能分析视频,这些功能在日常工作和学习中非常实用。
最近我在猪猪AI(titiai.cn)上做了一轮实测,把Gemini 3.5的7个多模态功能逐一跑了一遍。它把ChatGPT、Claude、Gemini、Grok、DeepSeek等主流模型整合在同一个平台上,同一个需求同时发给多个模型,结果直接并排对比。今天把体验分享出来。

功能1:图片识别
给Gemini一张图片,它能认出图里有什么、写了什么。实测中文截图识别准确度95%,比GPT高5个百分点。
我拍了一张App截图发给它,它准确识别了界面上的所有元素、按钮功能和文字内容。比我自己一个个描述快多了。
功能2:多图对比
同时上传多张图片,Gemini能做对比分析。我拍了3个竞品的App截图发给它,它输出了一份结构化的功能对比表格,每个App的核心功能、界面布局、交互方式都列得清清楚楚。
实测多图对比评分9.2分,比GPT(7.8分)和Claude(8.0分)都高。这个功能做竞品调研特别好用。
功能3:图表数据提取
把数据图表截图发给Gemini,它能读出具体数字并分析趋势。我拍了一张销售柱状图发给它,它不仅读出了每个柱子的数值,还指出"Q2增长23%,但Q3增速放缓至8%"。
实测图表数据读取准确度94%。比自己一个个数字敲进去快10倍。
功能4:视频内容理解
这是Gemini独有的能力,ChatGPT和Claude目前不支持。上传一段视频,Gemini能识别视频中的内容、动作、场景变化。
实测短视频内容识别准确度88%。适合做视频摘要和内容审核,但复杂剧情的理解还不够深入。
功能5:音频转录
上传一段音频,Gemini能转录成文字并分析内容。中文语音转录准确度92%,英文95%。
我录了一段会议音频发给它,它不仅转录了文字,还帮我提取了要点和待办事项。比传统的语音转文字工具智能得多。
功能6:图文结合生成
上传一张图片,让Gemini根据图片内容生成文字。比如上传一张产品图片,让它写产品描述;上传一张数据图表,让它写分析报告。
实测图文结合生成质量8.8分。Gemini对图片的理解比其他模型更深,生成的文字与图片的匹配度更高。
功能7:长文档处理
Gemini 3.5支持100万token的上下文窗口,能处理约75万字的文本。实测10万字文本的信息压缩保留率88%,信息检索准确率90%。
我给它传了一份50页的报告,让它提炼核心结论。它准确抓住了报告的主要观点和关键数据,比我自己读一遍快得多。
和其他模型的对比
| 功能 | Gemini | GPT | Claude |
|---|---|---|---|
| 图片识别 | 9.2 | 8.5 | 8.3 |
| 多图对比 | 9.2 | 7.8 | 8.0 |
| 视频理解 | 8.5 | 不支持 | 不支持 |
| 音频转录 | 9.0 | 不支持 | 不支持 |
| 图文生成 | 8.8 | 8.2 | 8.5 |
| 长文档 | 8.6 | 7.8 | 8.9 |
| 文本生成 | 8.5 | 8.8 | 9.0 |
| 综合多模态 | 9.0 | 7.8 | 7.5 |
Gemini在多模态场景中综合最强。但纯文本生成,Claude更好。
我最推荐的三个功能
第一个是图片识别。准确度95%,做竞品调研、设计审查、数据图表分析都很好用。比自己一个个描述快10倍。
第二个是多图对比。同时上传多张图片,Gemini能输出结构化的对比分析。做竞品调研、设计方案对比特别高效。
第三个是音频转录。中文准确度92%,比传统语音转文字工具更智能——不仅能转录,还能提取要点和待办事项。
常见问答
问:Gemini 3.5的多模态能力比GPT强多少?
在多模态场景中综合Gemini 9.0 vs GPT 7.8,差距1.2分。主要差距在图片识别和多图对比上。但GPT在纯文本生成上略胜。
问:猪猪AI和其他平台用Gemini有什么区别?
核心区别是"多模型对比"。同一个需求同时发给多个模型,结果并排对比。多模态选Gemini,纯文本选Claude,各取所长。
问:Gemini的视频理解能力成熟吗?
短视频识别准确度88%,能做摘要和内容审核,但复杂剧情理解还不够深入。适合轻量级场景。
总结
Gemini 3.5的多模态能力确实被低估了。图片识别95%、多图对比9.2分、音频转录92%、视频理解88%——这些能力在日常工作和学习中非常实用。在猪猪AI上多模型对比,多模态场景选Gemini,纯文本选Claude,根据需求灵活选择。大多数人只用了Gemini十分之一的能力,剩下的九成值得好好挖掘。