Mistral发布OCR 4.1:面向复杂文档的视觉多模态模型,直接输出JSON/Markdown
thinkindev • 2026-08-14
1264 views
Mistral AI 正式发布 OCR 4.1,这是一款高度专用的视觉多模态模型,核心目标是摄取、解析并结构化复杂文档格式。该模型在复杂表格布局识别、层级文档结构理解方面表现突出,能够直接输出干净且机器可读的 JSON 或 Markdown,减少传统 OCR 后处理流程。OCR 4.1 原生支持段落级边界框提取、结构块标签和块级置信度评分,便于将非结构化文档转化为可检索、可分析的数据。此次发布进一步推动文档 AI 工作流自动化,并对云服务商及闭源模型厂商的多模态输入定价体系形成压力,可能加速行业在文档理解领域的成本优化与技术竞争。
核心要点
- OCR 4.1 是 Mistral AI 推出的专用视觉多模态文档解析模型
- 支持复杂表格、层级结构识别,并直接输出 JSON 或 Markdown
- 对云厂商及闭源模型的多模态定价体系形成竞争压力