Bagaimana untuk mengekstrak struktur dokumen dengan Parsers dalam Python

Bagaimana untuk mengekstrak struktur dokumen dengan Parsers dalam Python

Bagaimana untuk mengekstrak struktur dokumen dengan Parsers

Aspose.Words FOSS untuk Python menyediakan kelas parser untuk mengekstrak data berstruktur daripada dokumen DOCX. panduan ini meliputi: NumberingParser untuk nombor senarai dan StyleParser untuk dokumen gaya.

Prerequisites

Menerapkan perpustakaan :

pip install aspose-words-foss>=26.4.0

Permintaan Python 3.10 atau lebih baru.

Nombor Parser

NumberingParser membaca senarai pengiraan definisi daripada pakej DOCX.Selepas panggilan parse_numbering_part(),Anda boleh mencari senarai hartanah:

  • NumberingParser.get_list_info() - mendapatkan maklumat mengenai senarai tertentu melalui ID mereka
  • NumberingParser.is_ordered_list() - semak sama ada tahap senarai telah dipesan atau ditembak
  • NumberingParser.get_start_value() - Dapatkan nombor permulaan untuk tahap senarai
  • NumberingParser.get_delimiter() — Dapatkan string delimiter untuk tahap senarai

Gaya Pars

StyleParser Nama-nama gaya parses dalam struktur ParsedStyle objek, mengidentifikasi tajuk, kuota blok, blok kod, dan senarai perenggan:

  • StyleParser.parse() - membahagikan nama gaya kepada a ParsedStyle Objek
  • StyleParser.get_style_chain() - merangkumi rantaian nama gaya untuk gaya yang diwarisi
  • StyleParser.is_setext_heading() — semak jika gaya ialah tajuk gaya Setext
  • StyleParser.extract_all_styles() — Mengekstrak nama gaya individu daripada rantaian yang terpisah comma

Model Data Nomborasi

Data pengiraan parsed disimpan dalam objek berstruktur:

ClassProperti Utama
NumberingInfonum_id, abstract_num_id, levels
NumberingLevelformat, start, text

Kesimpulannya

ParserPurpose
NumberingParserSenarai ekstrak nombor definisi
StyleParserNama-nama gaya parse dalam maklumat berstruktur

Lihat juga

 Bahasa Melayu