专业财税服务推荐

精选优质财税服务,为企业提供专业、可靠的财税解决方案,助力企业健康发展

零报税代理记账
零申报代理记账
报税做账算帐财务报表老会计做账
代理记账
咨询微信:lhy_happyday
工商营业执照年度年报年检公示
全国个体、企业、公司、合作社工商年审年报服务!
个体/10元/次 企业/20元/次
咨询微信:lhy_happyday
财税咨询服务
一对一专业财税咨询,解决企业财税难题,提供定制方案
咨询微信:lhy_happyday
财务分析服务
小规模个体报税0申报税务年报工商年报月报季报报税代理记账
咨询微信:lhy_happyday
立即咨询专业财税顾问
微信号: lhy_happyday
会计从业9年,管理多家个体工商、小规模、一般纳税人等企业的财务、税务等相关工作!。
扫码或搜索添加微信,备注"财税咨询"获取专属优惠
知方号 知方号

Python 解析财务报表中的表格数据(pdf to tables) 财报狗教你看懂财务报表pdf

解析PDF常用组件(PdfBox、iText、Tika等)都无法将表格数据解析成有规则的格式。解析后格式基本是TEXT、XHTML等导致处理表格数据变的非常复杂,基本需要全枚举+正则才能处理个70-80%。最近看到Python可以解析表格于是尝试了一下,不过要想让数据可用,还存在很多问题待解决。 PDF文件截图

Tika解析PDF文件 1、TEXT格式

Tika tika = new Tika();tika.setMaxStringLength(100 * 1024 * 1024);try (InputStream stream = new FileInputStream(new File("600060_2018_zB.pdf"))) {return tika.parseToString(stream);}

Text格式解析结果 2、XHTML格式

ContentHandler handler = new ToXMLContentHandler();AutoDetectParser parser = new AutoDetectParser();Metadata metadata = new Metadata();try (InputStream stream = new FileInputStream(new File("600060_2018_zB.pdf"))) {parser.parse(stream, handler, metadata);return handler.toString();}

XHTML格式解析结果

Python解析表格 1、前十名股东表格原始数组

2、处理过的财务指标

3、处理过单位后的快报数据 暂时还不通用存在一些问题,如换行、表头、每列占用单元格个数不统一、分页等。

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至lizi9903@foxmail.com举报,一经查实,本站将立刻删除。