第 6 章:多模态与内容渲染——图片、视频与富文本
6.1 先确认模型能不能看图
“App 能上传图片”和“模型能理解图片”是两件事。选择模型时应查看服务商说明,确认该模型支持图片或视觉输入。只支持文字的模型收到图片后可能报错,也可能完全忽略图片。
最简单的测试是上传一张无敏感信息的截图并问:
请只描述图片左上角的文字。如果看不到图片,请明确告诉我。
6.2 从相册添加图片
- 在对话输入区打开附件入口。
- 选择相册或系统文件选择器。
- 选择图片。
- 需要时进行裁剪、旋转、画笔圈选或马赛克处理。
- 回到输入框,补充明确问题后发送。
不要只发一张图不写问题。说明你希望 AI 做什么,例如“找出报错”“识别表格字段”“比较两处差异”。
6.3 拍照上传
第一次拍照时 Android 会请求摄像头权限。若拒绝过,可到 设置 → 应用权限 → 摄像头,再进入系统应用信息页允许。
拍摄文字时:
- 保持光线充足;
- 尽量正对纸面或屏幕;
- 避免反光和运动模糊;
- 只保留需要分析的区域;
- 身份证、地址、账号、二维码等先打码。
6.4 图片标注工具
- 裁剪:去掉无关边缘,减少模型处理内容;
- 旋转:把文字转正;
- 画笔:圈出按钮、裂纹、报错行等重点;
- 马赛克:遮挡个人信息、密钥、头像或订单号;
- 蒙版透明度:调节标注遮罩显示强度。
马赛克适合降低肉眼可见性,但极重要的秘密最好不要上传原图,直接重新截图并彻底移除敏感区域。
6.5 查看和保存 AI 返回的媒体
AI 返回的图片或视频会显示缩略图。点击可预览,并可通过保存/另存入口写入设备。支持的来源包括:
- HTTP/HTTPS URL;
- Data URL;
- Base64 媒体数据;
- 应用可访问的本地媒体文件。
保存前确认来源可信。媒体文件也可能包含隐私元数据或恶意内容,不要随意打开陌生来源的文件。
6.6 Markdown 显示
AI 正文支持常用 Markdown:
- 标题、粗体、斜体;
- 有序和无序列表;
- 引用;
- 表格;
- 行内代码与代码块;
- 链接和图片。
如果模型输出的表格列太多,在手机上需要横向滚动。可以追问“改成每项一段的列表”。
6.7 代码块和公式
代码块会根据语言标记进行语法高亮,例如:
print('Hello, Lyra Code')LaTeX 数学公式在本地渲染,例如行内公式 $E=mc^2$ 和块级公式:
$$ f(x)=\int_{-\infty}^{\infty} e^{-t^2},dt $$
公式显示异常时,让 AI 输出标准 LaTeX,不要把公式放在普通代码块里。
6.8 当前限制
- 图片能否被理解取决于模型与接口兼容性;
- 文档文件不能简单等同于图片多模态;PDF、Word 等并非所有接口都能直接作为模型输入;
- 视频缩略图和预览不代表模型一定能理解完整视频;
- 大图片或大量图片可能超过服务商大小、数量或上下文限制。
6.9 常见问题
上传按钮没有相册或摄像头
到 设置 → 应用权限 检查媒体和摄像头权限;某些 Android 版本还会使用系统照片选择器,无需永久授予全部相册权限。
图片发出后请求失败
换成明确支持视觉的模型,减少图片数量或尺寸,再新建会话测试。还要确认第三方 OpenAI 兼容网关是否支持多模态字段。
AI 识别文字不准确
重新裁剪、转正、提高分辨率,并在问题中说明语言和目标区域。关键数字必须人工核对。
下一章:个性化与主题
