第 9 章:模型高级配置——接口、可达性与辅助模型
先完成快速上手。本章用于解决兼容服务、模型很多、长对话成本高等问题。
9.1 额外功能模型是什么
主对话模型负责回答和调用工具;额外功能模型只承担标题总结或历史压缩。为它们选一个便宜、响应快、稳定的小模型,通常能降低成本。
入口:设置 → 额外功能模型。
9.2 话题总结模型
开启独立话题总结模型后,新会话发送第一条消息时,应用会让它生成简短标题,不再占用主对话模型的工具调用。
配置步骤:
- 先在模型服务中保存并启用一个轻量模型;
- 打开 额外功能模型 → 话题总结模型;
- 选择服务商和模型;
- 保存;
- 新建会话并发送首条消息,观察侧边栏标题。
它只影响之后的新标题,不会自动重命名所有旧会话。
9.3 历史压缩模型
长对话会不断累积用户消息、AI 输出、思考过程和工具上下文。当接近模型上下文上限时,应用可以分段压缩并逐级合并为结构化上下文。
有两种选择:
- 跟随当前会话模型:配置简单,压缩质量与主模型一致,但可能较贵;
- 使用独立压缩模型:节省主模型费用,但应选择上下文足够长、总结稳定的模型。
配置步骤:
- 打开 额外功能模型 → 历史压缩模型;
- 选择跟随当前模型,或打开独立模型;
- 选择已保存的服务商和模型;
- 保存;
- 在长对话中手动压缩一次,检查压缩结果是否保留目标、约束、文件路径和未完成事项。
压缩失败不会替换原上下文。重要结论仍应写入工作区文件,不要只依赖对话记忆。
9.4 接口格式
Lyra Code 支持三类主要接口:
| 格式 | 适用对象 | 常见默认请求路径 |
|---|---|---|
| OpenAI Chat Completions 兼容 | OpenAI 及大量第三方服务 | /chat/completions 一类路径 |
| Anthropic Messages | Claude 官方或兼容服务 | /messages 一类路径 |
| Gemini GenerateContent | Google Gemini | 与模型名组合的 generateContent 路径 |
实际地址由服务商决定。不要因为模型叫 Claude 就擅自选 Anthropic 格式;第三方网关可能要求 OpenAI 兼容格式。
9.5 Base URL 和请求路径
- Base URL:协议、域名、可选端口和基础前缀;
- 请求路径:具体 API 路径;
- 模型列表:通常从 Base URL 对应的
/models获取。
预设服务商保持默认最安全。自定义服务商按其文档拆分,不要重复路径。例如 Base URL 已经带 /v1 时,请求路径里通常不要再写第二遍 /v1。
配置页会显示最终请求端点和模型列表地址,保存前逐字核对。
9.6 可达性检测
- 进入某个服务商的 选择模型并检测可达性。
- 勾选一个或多个已知可用模型。
- 点击开始检测。
- 查看服务商整体状态、每个模型结果和延迟。
“服务商可用”只说明检测请求成功,不保证所有多模态、工具调用、流式输出和高级参数都兼容。仍需实际发起一次普通对话和一次工具任务。
9.7 推理深度
推理深度只对支持该参数的推理模型有意义。更高不一定更正确,通常还会更慢、更贵。建议:
- 日常问答:低或默认;
- 代码审查、复杂规划:中;
- 明确需要深入推理且预算允许:高;
- 服务商报未知参数:恢复默认或关闭相关选项。
9.8 HTTP 明文接口
应用允许填写 HTTP 地址,但会提示风险。HTTP 会让同一网络中的第三方更容易看到 API Key、提示词和返回内容。
只有在可信的本机或隔离局域网测试服务时才考虑 HTTP;访问公网服务应使用 HTTPS。
9.9 故障定位顺序
- 用服务商控制台确认 Key 和额度;
- 核对接口格式;
- 核对 Base URL;
- 核对请求路径;
- 核对模型 ID 和启用状态;
- 做可达性检测;
- 新建空白会话,只发纯文字;
- 再逐步测试流式、多模态和工具调用。
这样能判断问题在基础连接还是高级能力,而不是一次混测所有功能。
下一章:子代理编排
