01 一个被忽视的“低科技”痛点
在企业数字化浪潮席卷各行各业的今天,有一个环节却出奇地“原始”——纸质单据的处理。
发票、送货单、入库单、合同、报销单、对账单……每天成百上千张纸从四面八方涌进企业的财务、仓库、物流、工程等部门。传统扫描仪能做的事,就是把纸变成图片或PDF。但图片里的关键信息:单号、金额、日期、供应商等内容,还得靠人工肉眼识别、手动录入ERP系统。
财务、仓库、物流的同事每天要花几个小时对着单据抄数字,又慢又容易出错。一位工地材料管理员告诉我们,工地每天数百张材料收货单,文员逐张录入,容易出错并延迟一到两天。物流仓库更典型:扫描枪只能读条码,手写改单和破损面单仍需人工补录。
这哪里是数字化?这只是把“纸上的体力活”变成了“屏幕前的体力活”。
我们最初的产品思路也很朴素: 用OCR把图片里的文字抠出来,然后按固定模板提取字段。但很快,我们撞上了几堵墙:
- — 模板太死板。 每家客户对同一个字段的叫法不同——有人叫“单号”,有人叫“单据编号”,有人叫“NO”,固定模板匹配不上就提取失败。
- — 单据类型得人工选。 发票、送货单、入库单长得不一样,系统分不清,得用户手动告诉机器“这是哪类单据”。
- — OCR吐出来的是一堆零散文字,不是结构化数据。 用户拿到的是大段文本,还得自己拆出金额、日期、供应商,业务系统根本不认。
- — 手写体和印章文字识别不稳定。 很多送货单是手写的,或者盖了红章,OCR经常认错或直接认不出来。
这些问题不解决,产品就只是个“高级扫描仪”,离“智能”差得远。
02 一个简单的追问:能不能让科技真正“看懂”单据?
我们停下来问了自己一个看似简单的问题:人是怎么处理一张单据的?
人看到一张送货单,不会要求把全部内容都记下来。人只需要看“有用的”——供应商是谁、送了什么、多少钱、哪天送的。人还能自动判断:哦,这是一张送货单,不是发票。人还能处理“模糊信息”:手写的“张伟”和印刷的“张伟”,人能认出来是同一个名字,甚至能联想到关联“张伟”的合同上。
那机器能不能做到? 这个追问,把我们引向了大语言模型。
引入大模型之前,用户处理一单的流程是这样的:
扫描 → OCR转文字 → 按固定区域或关键词抠字段 → 字段对不上 → 手工改、复制粘贴到Excel → 再导入业务系统。平均一单 3 到 5 分钟,还容易录错。
引入大模型之后,流程变成了这样:
连续扫描一堆单据 → 系统自动纠正图像方向、去掉折痕和干扰 → AI自动判断单据类型 → 从模板库里匹配对应的提取模板 → 大模型根据客户自定义的字段要求,从OCR文字中精准提取结构化信息 → 直接输出JSON → 自动对接ERP、WMS等业务系统。每单处理仅需 20 秒,单据处理时间缩短 90%。
我们把这款产品命名为“结构眼”,原因就在于此:传统扫描仪只能采集“图像”,而我们要做的是采集“数据”——把一张张纸上杂乱无章、非结构化的原始文字信息,通过AI的语义理解和结构化抽取能力,变成可编辑、可核对、可追溯、可直接被业务系统使用的结构化数据。
03 大模型具体解决了什么?
第一,让“自定义模板”真正可用
客户可以在后台自己定义想提取什么字段,比如“我要提取‘含税总金额’对应到我系统的‘total_amount’字段”。大模型会根据客户的字段定义和说明,智能地从单据文字中把对应内容抓出来。哪怕单据上写的叫法和客户自定义的不一样(比如单据写“总价”,客户定义的是“总金额”),大模型也能通过语义理解自动配对。
第二,让机器看懂单据类型
以前需要人工选“这是发票还是送货单”,现在大模型自动判断单据类型,自动匹配对应的提取模板,用户只管扫描,不用动脑子选。
第三,让“一堆文字”变成“可直接用的数据”
传统OCR吐出来的是一堆散乱的文字,大模型能按照客户预设的JSON结构,把字段一个一个填进对应的格子里。输出结果直接是业务系统能认的结构化数据,省掉了人工拆字段、复制粘贴的环节。
第四,手写体和印章也能识别
手写送货单、盖红章的发票,OCR经常认不准。我们的方案是:OCR先提一遍,如果关键字段提取不出来或结果为空,系统自动切换OCR配置并重新调用大模型再提一次,相当于给大模型第二次机会去理解模糊的文字,大大提升了复杂场景下的提取成功率。
第五,让结果可追溯、可复核
大模型每次提取的结果都会和当时使用的模板版本绑定,生成不可变的快照。哪天客户说“这笔数据不对”,我们可以回溯到当时用的模板版本,看看到底是提取错了还是模板配错了。同时,系统支持提取结果和原始单据同屏对照,复核人员只需要重点核验AI提取的字段就行。
04 不止是扫描,是一条“从纸到数据”的流水线
有了这些能力之后,我们再回看“结构眼扫描仪S1”这款产品。它不再是一台传统意义上的扫描仪,它是一套从纸张单据到结构化数据的全自动流水线——图像进来,结构化数据出去,中间全由AI完成。
硬件上, 它支持100张自动送稿和重张检测,折痕、盖章、不同尺寸的单据都能稳定采集。软件上, 它支持任意版式单据混批进入设备——打印单、三联单、手写单一起放进去,不用分类整理。
输出方式也很灵活: 可以在管理后台实时查看识别结果和完整结构化数据;可以按时间、单据类型筛选导出Excel;可以通过Webhook主动推送给客户的业务系统;也可以通过OpenAPI让客户按需拉取数据。
更重要的是,它能做“业务上下文匹配”。系统会先接入企业已有的供应商资料、合同库和材料编码库,提取单据上的名称、抬头和明细后,给出候选匹配结果,人工只确认存疑项。这意味着输出的不是孤立的字段,而是带有业务含义的完整结构化数据——比如自动匹配到对应的采购订单号、物料编码、合同编号。
05 从纸到数据,这才是答案!
我们为什么要做“结构眼”?因为在和无数企业客户聊天的过程中,我们反复听到同一个声音:“数字化说了这么多年,为什么我的单据还在靠人抄?”,这个问题不该存在。
纸张上的内容,和业务系统里的数据,中间不应该隔着一双疲惫的眼睛和一双敲键盘的手。
大语言模型在我们产品里干的核心就一件事:把“扫出来的一堆字”变成“客户想要的、业务系统能直接用的数据”。它不是简单地做文字识别,而是理解单据上哪些文字对应客户的哪个字段,然后按客户要求的格式填出来。
这赋予了机器拥有看懂“数据结构”的眼睛,让我们的扫描仪从一个“图片生产工具”变成了“数据生产工具”,客户从“扫完还得自己录”变成了“扫完数据就自动进系统了”。
目前,结构眼扫描仪S1已在建筑工程、制造供应链、物流仓储、财务报销等多个行业落地。从“收到单据”到“得到可用数据”的时间缩短了90%,复核效率提升60%以上。每笔数据带复核人加时间戳,全链路可追溯,切实解决企业长期存在的单据录入成本高、效率低、易出错的经营痛点。