Skip to content

多模态与内容渲染

第 6 章:多模态与内容渲染——图片、视频与富文本 ​

6.1 先确认模型能不能看图 ​

“App 能上传图片”和“模型能理解图片”是两件事。选择模型时应查看服务商说明,确认该模型支持图片或视觉输入。只支持文字的模型收到图片后可能报错,也可能完全忽略图片。

最简单的测试是上传一张无敏感信息的截图并问:

请只描述图片左上角的文字。如果看不到图片,请明确告诉我。

6.2 从相册添加图片 ​

  1. 在对话输入区打开附件入口。
  2. 选择相册或系统文件选择器。
  3. 选择图片。
  4. 需要时进行裁剪、旋转、画笔圈选或马赛克处理。
  5. 回到输入框,补充明确问题后发送。

不要只发一张图不写问题。说明你希望 AI 做什么,例如“找出报错”“识别表格字段”“比较两处差异”。

6.3 拍照上传 ​

第一次拍照时 Android 会请求摄像头权限。若拒绝过,可到 设置 → 应用权限 → 摄像头,再进入系统应用信息页允许。

拍摄文字时:

  • 保持光线充足;
  • 尽量正对纸面或屏幕;
  • 避免反光和运动模糊;
  • 只保留需要分析的区域;
  • 身份证、地址、账号、二维码等先打码。

6.4 图片标注工具 ​

  • 裁剪:去掉无关边缘,减少模型处理内容;
  • 旋转:把文字转正;
  • 画笔:圈出按钮、裂纹、报错行等重点;
  • 马赛克:遮挡个人信息、密钥、头像或订单号;
  • 蒙版透明度:调节标注遮罩显示强度。

马赛克适合降低肉眼可见性,但极重要的秘密最好不要上传原图,直接重新截图并彻底移除敏感区域。

6.5 查看和保存 AI 返回的媒体 ​

AI 返回的图片或视频会显示缩略图。点击可预览,并可通过保存/另存入口写入设备。支持的来源包括:

  • HTTP/HTTPS URL;
  • Data URL;
  • Base64 媒体数据;
  • 应用可访问的本地媒体文件。

保存前确认来源可信。媒体文件也可能包含隐私元数据或恶意内容,不要随意打开陌生来源的文件。

6.6 Markdown 显示 ​

AI 正文支持常用 Markdown:

  • 标题、粗体、斜体;
  • 有序和无序列表;
  • 引用;
  • 表格;
  • 行内代码与代码块;
  • 链接和图片。

如果模型输出的表格列太多,在手机上需要横向滚动。可以追问“改成每项一段的列表”。

6.7 代码块和公式 ​

代码块会根据语言标记进行语法高亮,例如:

python
print('Hello, Lyra Code')

LaTeX 数学公式在本地渲染,例如行内公式 $E=mc^2$ 和块级公式:

$$ f(x)=\int_{-\infty}^{\infty} e^{-t^2},dt $$

公式显示异常时,让 AI 输出标准 LaTeX,不要把公式放在普通代码块里。

6.8 当前限制 ​

  • 图片能否被理解取决于模型与接口兼容性;
  • 文档文件不能简单等同于图片多模态;PDF、Word 等并非所有接口都能直接作为模型输入;
  • 视频缩略图和预览不代表模型一定能理解完整视频;
  • 大图片或大量图片可能超过服务商大小、数量或上下文限制。

6.9 常见问题 ​

上传按钮没有相册或摄像头 ​

到 设置 → 应用权限 检查媒体和摄像头权限;某些 Android 版本还会使用系统照片选择器,无需永久授予全部相册权限。

图片发出后请求失败 ​

换成明确支持视觉的模型,减少图片数量或尺寸,再新建会话测试。还要确认第三方 OpenAI 兼容网关是否支持多模态字段。

AI 识别文字不准确 ​

重新裁剪、转正、提高分辨率,并在问题中说明语言和目标区域。关键数字必须人工核对。


下一章:个性化与主题

AGPLv3