选模型,从你要做的事开始
← 场景指南

识图与文字提取,如何选模型?

视觉理解通常输出对图片的解释或结构化文字。OCR、图表理解和导出 Excel 需要分别设计。

接入前需要确认

  • 01核对图片格式、分辨率与张数限制。
  • 02明确希望获得文字描述、表格还是 JSON。
  • 03为文字识别结果设置人工或程序校验。
  • 04需要 Excel 时增加表格结构检查与文件生成步骤。

能够识图不意味着能够直接编辑图片或直接返回 Excel 文件。

需求示例:“识别图片里的表格,最后导出 Excel
按这个场景选型 →

已整理的相关方案

查看基础目录 →

了解资料来源与核验方法 →