功能简介
多模态 AI 解题器将文本问题、摄像头画面或选定屏幕区域发送到你配置的 AI 服务商和模型。它包含 18 个预定义的图像分析提示词模板以及 Custom Mode(自定义模式)。默认的 Local demo(本地演示)无需网络请求即可体验界面。
Local demo 返回一个示例响应,不会识别或推理所拍摄的图像。要进行实际的摄像头或屏幕分析,请使用支持视觉的实时模型。
开始之前
- 摄像头和屏幕捕获需要较新的浏览器、安全的 HTTPS 上下文和明确的权限授权。
- 屏幕捕获的可用性因浏览器和设备而异,在移动设备上通常受限。
- 实时摄像头或屏幕分析需要接受图像输入的模型。
- 实时请求需要你自己的服务商密钥和网络访问。
- 切勿捕获密码、私人消息、未发表数据或受监管记录,除非已授权将其发送给所选服务商。
快速流程
- 打开多模态 AI 解题器。
- 在 Input Mode(输入模式)下,选择一个工作流:
- Camera Capture(摄像头采集):选择 Enable camera(启用摄像头),授予权限,然后选择 Capture and solve(采集并解题)。
- Screen Capture(屏幕捕获):选择 Capture Screen(捕获屏幕),选择屏幕、窗口或标签页,调整选择框,然后选择 Analyze Selected Area(分析选定区域)。
- Text Question(文本提问):输入文本并选择 Ask and Get Answer(提问并获取答案)。
- 在 Solver model(解题模型)下,保持 Local demo 或选择服务商、模型和 API 密钥。当所选预设未标记为支持视觉时,摄像头和屏幕模式会显示警告。
- 在 Prompt Settings(提示词设置)下,选择一个 PromptPreset(提示词预设)。选择 Custom Mode 以编辑 Question (for image mode)(问题——用于图像模式)。
- 在 Response(响应)下阅读结果。如果服务商提供用量元数据,末尾会显示 token 计数。
控件与输出
| 控件或输出 | 用途 |
|---|---|
| Enable camera / Turn off camera | 启动或停止本地视频流。页面从不自动启动。 |
| Capture and solve | 采集一帧压缩的摄像头画面,并连同当前图像提示词一起提交。 |
| Capture Screen | 请求浏览器屏幕共享权限并捕获一帧。 |
| 选择框 | 通过四个角和四条边的控制点移动或调整屏幕裁剪区域。 |
| Analyze Selected Area | 仅编码并提交选定的屏幕区域。 |
| Ask and Get Answer | 按输入原样发送文本字段。 |
| Solver model | 选择 Local demo 或已配置的外部服务商、端点、模型和密钥。 |
| PromptPreset | 为摄像头和屏幕请求选择 18 个预定义提示词之一或 Custom Mode。 |
| Last image size | 报告图像准备就绪后编码的 JPEG 大小。 |
| Response | 显示服务商文本和可用的最终 token 用量。 |
预定义提示词涵盖通用分析、数学、实验室安全、植物识别、代码审查、学术文献翻译、物理、化学、英语学习、文字提取、生物、历史、医学影像、工程图纸、财务报表、艺术、法律文档和教育材料。
当前文本预设行为
PromptPreset 指令目前仅附加到摄像头和屏幕请求。普通的 Text Question 不会附带所选预设提示词发送。
输入精确命令(如 /preset Math Problem Solver)会更改图像模式预设并返回确认消息。该命令本身不会运行分析,下一个普通文本问题仍不会附带该预设提示词发送。
工作原理
摄像头采集会将画面缩放至最长边不超过 1,280 像素,然后以 0.85 的质量编码为 JPEG。实时预览保留在设备上;编码的静态图像仅在 Capture and solve 之后创建。
屏幕模式向浏览器请求共享显示流,捕获一帧后立即停止该流。在你移动或调整选择区域时,该帧保留在本地。Analyze Selected Area 裁剪选定的源像素并以 0.85 的质量编码为 JPEG。
对于图像模式,应用将 JPEG 以 base64 格式连同当前图像提示词一起发送。文本模式仅发送输入的文本。启动新请求会中止之前由页面管理的进行中请求。
应用原样显示返回的文本。仅当服务商响应包含可识别的用量字段时才附加 token 用量。
数据、隐私与外部服务
摄像头视频和未提交的屏幕帧保留在本地。选择 Capture and solve 或 Analyze Selected Area 会将生成的图像和提示词发送到 Solver model 中显示的端点。选择 Ask and Get Answer 会发送输入的文本。
API 密钥仅保存在当前标签页的内存中,在切换服务商、刷新或离开页面时清除,并发送到所显示的端点。浏览器输入的凭据不像服务端密钥那样受保护。请使用受限的测试密钥;生产环境请使用你自己的已认证后端代理。
即使密钥正确,直接请求也可能因服务商 CORS 策略、地区限制、模型权限、账单或配额而失败。
预设是提示词模板,不是经过验证的专家系统。医学、法律、财务、实验室安全和识别输出可能有误,不得替代合格的专业审查。
局限性
- 没有图像文件上传、响应历史、复制按钮、下载或分享功能。
- Local demo 不会分析图像内容。
- 文本问题目前不会继承 PromptPreset 指令。
- 预设可以引导模型,但不会添加专家数据库、确定性 OCR 或验证。
- 图像质量和答案质量取决于设备、裁剪、服务商和确切模型。
- 屏幕捕获在移动设备上可能不可用或受浏览器策略限制。
- 自定义模型 ID 可能支持视觉,即使应用无法验证该能力。
- token 计数仅在服务商返回时出现。
排障
- 摄像头关闭: 选择 Enable camera 并授予权限;关闭其他使用摄像头的软件。
- 不支持摄像头访问: 通过 HTTPS 使用较新的浏览器或切换到 Text Question。
- 屏幕捕获不可用或已取消: 检查浏览器/设备支持并授予浏览器的共享权限。
- 选择区域无法再缩小: 其最小尺寸为 50 个源像素,或源帧尺寸更小时以源帧为准。
- 模型拒绝图像: 选择支持视觉的模型,或使用文本模型配合 Text Question。
- 未找到预设命令: 使用小写
/preset加上确切的预设 ID 或完整显示名称。 - 401、403、404 或 429: 验证服务商、密钥、确切模型 ID、权限、账单和配额。
- CORS 或 Failed to fetch: 服务商阻止了直接浏览器访问;使用已认证的后端代理。
- 响应为空或不准确: 改善裁剪和提示词,用合适的模型重试,并独立验证结果。
