在A股市场迎来中报季的背景下,上市公司的财报披露成为投资者和市场分析师关注的焦点。特别是在巨额募资活动的背景下,财报的准确性和透明度对于投资者决策具有至关重要的影响。合合信息的文档解析技术通过辅助大模型深度解读财报,为金融行业从业者提供了强有力的工具,以应对海量财报文件的分析需求。
随着人工智能技术的深入发展,部分企业和个人开始尝试用大模型进行财务报表分析。针对大模型“理解力”薄弱,数据读取错误等问题,合合信息大模型“加速器”方案优化升级了PDF文档解析技术,将非结构化的PDF内容转换为结构化数据,提高大模型图表类数据提取准确性和版面理解能力,助力大模型实现从“泛读”到“精读”的能力跨越。
在巨额募资活动中,投资者需要对公司的财务状况、资金使用计划和未来盈利能力有清晰地了解。合合信息的PDF文档解析技术能够准确识别和解析财报中的各类复杂表格、图表和文本,确保关键信息不被丢失或误解,为投资者提供了更为精准的数据分析和决策支持。
文档解析技术是大模型理解和处理文档的前提,相关能力的缺失,会导致大模型在理解版面不同区域的内容排列顺序、要点时遇到障碍,影响大模型的“理解力”,财务报表中的关键信息可能会丢失或被误解,使得模型生成的答案不够精准,无法正确回答用户的查询。
图1:合合信息PDF文档解析技术在大模型表格解析中的效果
据了解,合合信息PDF文档解析技术具备多文档元素识别、版面分析能力,可以识别文档中的段落、公式、页眉、页脚等多种元素,并进行对应的处理。在应对财报中常见的无线表、合并单元格、不规则行距、跨段、跨页等障碍时,该技术也能做到准确还原各类表格结构。
为了让大模型像专业人士一样阅读文本,PDF文档解析技术可对各类学术文献进行版面元素的识别及阅读顺序的判定。该技术不仅能够准确定位文档中的关键信息段落,还能根据PDF文档的布局和格式,推断出人类阅读时的顺序,而非机械地判定为从左至右排序,避免把完整的段落文字“拦腰斩断”,真正做到了“所见即所得”。
图2:合合信息PDF文档解析技术对双栏论文的解析效果
合合信息技术团队成员表示,上市公司年报页数大多集中在200至300页的范围内,一个熟练的分析师可能在几天到一周的时间内完成对年报的基本分析,PDF文档解析工具最快能在1.5秒完成百页文档的解析,按8小时为一天工作时间计算,解析工具可帮助大模型在一日内对数千家企业的年报数据进行精准分析。
(编辑:王星)
凡本网注明“来源:企业观察网”的所有作品,均为《企业观察报》社有限责任公司合法拥有版权或有权使用的作品,未经本网授权不得转载、摘编或利用其它方式使用上述作品。已经本网授权使用作品的,应在授权范围内使用,并注明“来源:企业观察网”。违反上述声明者,本网将追究其相关法律责任。凡本网注明“来源:XXX(非企业观察网)”的作品,均转载自其它媒体,转载目的在于传递更多信息,并不代表本网赞同其观点和对其真实性负责。如其他媒体、网站或个人转载使用,须保留本网注明的“稿件来源”,并自负法律责任。如因作品内容、版权和其它问题需要同本网联系的,请在相关作品刊发之日起30日内进行。联系方式:010-68719660。