跳到主要内容
全部应用实验室指南使用你选择的 AI 服务
AI 与科研 · 实用指南

多模态 AI 解题器

用文本、摄像头或屏幕截图提问,并将提示词发送到你配置的视觉 AI 模型和 API 服务商。

  • 自带 AI 密钥
  • 相机 / 截屏
  • 预设提示词
打开工具

功能简介

多模态 AI 解题器将文本问题、摄像头画面或选定屏幕区域发送到你配置的 AI 服务商和模型。它包含 18 个预定义的图像分析提示词模板以及 Custom Mode(自定义模式)。默认的 Local demo(本地演示)无需网络请求即可体验界面。

Local demo 不会识别像素

Local demo 返回一个示例响应,不会识别或推理所拍摄的图像。要进行实际的摄像头或屏幕分析,请使用支持视觉的实时模型。

开始之前

  • 摄像头和屏幕捕获需要较新的浏览器、安全的 HTTPS 上下文和明确的权限授权。
  • 屏幕捕获的可用性因浏览器和设备而异,在移动设备上通常受限。
  • 实时摄像头或屏幕分析需要接受图像输入的模型。
  • 实时请求需要你自己的服务商密钥和网络访问。
  • 切勿捕获密码、私人消息、未发表数据或受监管记录,除非已授权将其发送给所选服务商。

快速流程

  1. 打开多模态 AI 解题器
  2. Input Mode(输入模式)下,选择一个工作流:
    • Camera Capture(摄像头采集):选择 Enable camera(启用摄像头),授予权限,然后选择 Capture and solve(采集并解题)。
    • Screen Capture(屏幕捕获):选择 Capture Screen(捕获屏幕),选择屏幕、窗口或标签页,调整选择框,然后选择 Analyze Selected Area(分析选定区域)。
    • Text Question(文本提问):输入文本并选择 Ask and Get Answer(提问并获取答案)。
  3. Solver model(解题模型)下,保持 Local demo 或选择服务商、模型和 API 密钥。当所选预设未标记为支持视觉时,摄像头和屏幕模式会显示警告。
  4. Prompt Settings(提示词设置)下,选择一个 PromptPreset(提示词预设)。选择 Custom Mode 以编辑 Question (for image mode)(问题——用于图像模式)。
  5. Response(响应)下阅读结果。如果服务商提供用量元数据,末尾会显示 token 计数。

控件与输出

控件或输出用途
Enable camera / Turn off camera启动或停止本地视频流。页面从不自动启动。
Capture and solve采集一帧压缩的摄像头画面,并连同当前图像提示词一起提交。
Capture Screen请求浏览器屏幕共享权限并捕获一帧。
选择框通过四个角和四条边的控制点移动或调整屏幕裁剪区域。
Analyze Selected Area仅编码并提交选定的屏幕区域。
Ask and Get Answer按输入原样发送文本字段。
Solver model选择 Local demo 或已配置的外部服务商、端点、模型和密钥。
PromptPreset为摄像头和屏幕请求选择 18 个预定义提示词之一或 Custom Mode。
Last image size报告图像准备就绪后编码的 JPEG 大小。
Response显示服务商文本和可用的最终 token 用量。

预定义提示词涵盖通用分析、数学、实验室安全、植物识别、代码审查、学术文献翻译、物理、化学、英语学习、文字提取、生物、历史、医学影像、工程图纸、财务报表、艺术、法律文档和教育材料。

当前文本预设行为

PromptPreset 指令目前仅附加到摄像头和屏幕请求。普通的 Text Question 不会附带所选预设提示词发送。

输入精确命令(如 /preset Math Problem Solver)会更改图像模式预设并返回确认消息。该命令本身不会运行分析,下一个普通文本问题仍不会附带该预设提示词发送。

工作原理

摄像头采集会将画面缩放至最长边不超过 1,280 像素,然后以 0.85 的质量编码为 JPEG。实时预览保留在设备上;编码的静态图像仅在 Capture and solve 之后创建。

屏幕模式向浏览器请求共享显示流,捕获一帧后立即停止该流。在你移动或调整选择区域时,该帧保留在本地。Analyze Selected Area 裁剪选定的源像素并以 0.85 的质量编码为 JPEG。

对于图像模式,应用将 JPEG 以 base64 格式连同当前图像提示词一起发送。文本模式仅发送输入的文本。启动新请求会中止之前由页面管理的进行中请求。

应用原样显示返回的文本。仅当服务商响应包含可识别的用量字段时才附加 token 用量。

数据、隐私与外部服务

摄像头视频和未提交的屏幕帧保留在本地。选择 Capture and solveAnalyze Selected Area 会将生成的图像和提示词发送到 Solver model 中显示的端点。选择 Ask and Get Answer 会发送输入的文本。

API 密钥仅保存在当前标签页的内存中,在切换服务商、刷新或离开页面时清除,并发送到所显示的端点。浏览器输入的凭据不像服务端密钥那样受保护。请使用受限的测试密钥;生产环境请使用你自己的已认证后端代理。

即使密钥正确,直接请求也可能因服务商 CORS 策略、地区限制、模型权限、账单或配额而失败。

需要人工验证

预设是提示词模板,不是经过验证的专家系统。医学、法律、财务、实验室安全和识别输出可能有误,不得替代合格的专业审查。

局限性

  • 没有图像文件上传、响应历史、复制按钮、下载或分享功能。
  • Local demo 不会分析图像内容。
  • 文本问题目前不会继承 PromptPreset 指令。
  • 预设可以引导模型,但不会添加专家数据库、确定性 OCR 或验证。
  • 图像质量和答案质量取决于设备、裁剪、服务商和确切模型。
  • 屏幕捕获在移动设备上可能不可用或受浏览器策略限制。
  • 自定义模型 ID 可能支持视觉,即使应用无法验证该能力。
  • token 计数仅在服务商返回时出现。

排障

  • 摄像头关闭: 选择 Enable camera 并授予权限;关闭其他使用摄像头的软件。
  • 不支持摄像头访问: 通过 HTTPS 使用较新的浏览器或切换到 Text Question。
  • 屏幕捕获不可用或已取消: 检查浏览器/设备支持并授予浏览器的共享权限。
  • 选择区域无法再缩小: 其最小尺寸为 50 个源像素,或源帧尺寸更小时以源帧为准。
  • 模型拒绝图像: 选择支持视觉的模型,或使用文本模型配合 Text Question。
  • 未找到预设命令: 使用小写 /preset 加上确切的预设 ID 或完整显示名称。
  • 401、403、404 或 429: 验证服务商、密钥、确切模型 ID、权限、账单和配额。
  • CORS 或 Failed to fetch: 服务商阻止了直接浏览器访问;使用已认证的后端代理。
  • 响应为空或不准确: 改善裁剪和提示词,用合适的模型重试,并独立验证结果。

打开多模态 AI 解题器 →

← 返回应用实验室