Bagaimana untuk mengekstrak struktur dokumen dengan Parsers dalam Python
Bagaimana untuk mengekstrak struktur dokumen dengan Parsers dalam Python
Bagaimana untuk mengekstrak struktur dokumen dengan Parsers
Aspose.Words FOSS untuk Python menyediakan kelas parser untuk mengekstrak data berstruktur daripada dokumen DOCX. panduan ini meliputi: NumberingParser untuk nombor senarai dan StyleParser untuk dokumen gaya.
Prerequisites
Menerapkan perpustakaan :
pip install aspose-words-foss>=26.4.0Permintaan Python 3.10 atau lebih baru.
Nombor Parser
NumberingParser membaca senarai pengiraan definisi daripada pakej DOCX.Selepas panggilan parse_numbering_part(),Anda boleh mencari senarai hartanah:
NumberingParser.get_list_info()- mendapatkan maklumat mengenai senarai tertentu melalui ID merekaNumberingParser.is_ordered_list()- semak sama ada tahap senarai telah dipesan atau ditembakNumberingParser.get_start_value()- Dapatkan nombor permulaan untuk tahap senaraiNumberingParser.get_delimiter()— Dapatkan string delimiter untuk tahap senarai
Gaya Pars
StyleParser Nama-nama gaya parses dalam struktur ParsedStyle objek, mengidentifikasi tajuk, kuota blok, blok kod, dan senarai perenggan:
StyleParser.parse()- membahagikan nama gaya kepada aParsedStyleObjekStyleParser.get_style_chain()- merangkumi rantaian nama gaya untuk gaya yang diwarisiStyleParser.is_setext_heading()— semak jika gaya ialah tajuk gaya SetextStyleParser.extract_all_styles()— Mengekstrak nama gaya individu daripada rantaian yang terpisah comma
Model Data Nomborasi
Data pengiraan parsed disimpan dalam objek berstruktur:
| Class | Properti Utama |
|---|---|
NumberingInfo | num_id, abstract_num_id, levels |
NumberingLevel | format, start, text |
Kesimpulannya
| Parser | Purpose |
|---|---|
NumberingParser | Senarai ekstrak nombor definisi |
StyleParser | Nama-nama gaya parse dalam maklumat berstruktur |