Splitters
Splitters are pipeline components that divide large text content into smaller, manageable chunks. They help optimize content for processing, storage, and retrieval in AI applications by creating appropriately sized segments while preserving context and meaning.
Splitters
Splitters are pipeline components that divide large text content into smaller, manageable chunks. They help optimize content for processing, storage, and retrieval in AI applications by creating appropriately sized segments while preserving context and meaning.
Installation
All splitters are included with datapizza-ai-core and require no additional installation.
Available Splitters
Core Splitters (Included by Default)
- RecursiveSplitter - Recursively divides text using multiple splitting strategies
- TextSplitter - Basic text splitter for general-purpose chunking
- NodeSplitter - Splitter for Node objects preserving hierarchical structure
- PDFImageSplitter - Specialized splitter for PDF content with images
Common Features
- Multiple splitting strategies for different content types
- Configurable chunk sizes and overlap
- Context preservation through overlapping
- Support for structured content (nodes, PDFs, etc.)
- Metadata preservation during splitting
- Spatial layout awareness for document content
Usage Patterns
Basic Text Splitting
from datapizza.modules.splitters import RecursiveSplitter
splitter = RecursiveSplitter(chunk_size=1000, chunk_overlap=200)
chunks = splitter(long_text_content)
Document Processing Pipeline
from datapizza.modules.parsers import TextParser
from datapizza.modules.splitters import NodeSplitter
parser = TextParser()
splitter = NodeSplitter(max_char = 4000)
document = parser.parse(text_content)
structured_chunks = splitter(document)
Choosing the Right Splitter
- RecursiveSplitter: Best for general text content, articles, and most use cases
- TextSplitter: Simple splitting for basic text without complex requirements
- NodeSplitter: When working with structured Node objects from parsers
- PDFImageSplitter: Specifically for PDF content with images and complex layouts
- BBoxMerger: Utility for processing documents with spatial layout information
Related Documents
基于命题分块以增强RAG
命题分块技术(Proposition Chunking)——这是一种通过将文档分解为原子级事实陈述来实现更精准检索的先进方法。与传统仅按字符数分割文本的分块方式不同,命题分块能保持单个事实的语义完整性。
TileMap Chunk Manager
**Category:** Performance - 2D Rendering & Memory Management
🤖 n8n AI Agent Mastery Course 2025
Welcome to the most comprehensive n8n AI Agent course! Build powerful automation workflows and intelligent AI agents using n8n's visual workflow builder.
Document Chunking/Splitting in Langroid
Langroid's [`ParsingConfig`][langroid.parsing.parser.ParsingConfig]