La serie «RAG from Scratch» de Towards AI llega a su tercera entrega, enfocándose en un paso que suele pasar desapercibido pero que determina el rendimiento final de cualquier sistema de recuperación aumentada: el chunking. Aunque los modelos de lenguaje reciben toda la atención, la forma en que dividimos los documentos de origen influye directamente en la precisión, la latencia y el costo de las consultas.

El chunking consiste en fragmentar textos extensos en piezas manejables que el motor de búsqueda puede indexar y recuperar. Un fragmento demasiado grande puede diluir la señal relevante, mientras que uno demasiado pequeño genera ruido y aumenta la carga computacional. Por eso, elegir la estrategia adecuada no es una cuestión de gusto, sino de ingeniería.

Los autores presentan siete enfoques comunes: chunking de tamaño fijo, chunking basado en oraciones, chunking por párrafos, chunking semántico que usa embeddings para agrupar ideas similares, sliding window con solapamiento, chunking recursivo que aplica diferentes niveles de granularidad y el patrón padre‑hijo que mantiene una relación jerárquica entre fragmentos grandes y sus sub‑fragmentos.

Para ayudar a decidir, el artículo incluye un árbol de decisión que parte de preguntas clave: ¿Cuál es el tamaño medio de los pasajes de interés? ¿Se necesita preservar el contexto completo del documento? ¿Cuál es el presupuesto de latencia aceptable? Según las respuestas, el árbol sugiere comenzar con chunking por oraciones o párrafos y, si el rendimiento no es suficiente, probar técnicas semánticas o recursivas.

Uno de los hallazgos más interesantes es el patrón padre‑hijo, que muchos ingenieros descubren tarde. En este enfoque, cada documento se divide en fragmentos padres que representan secciones temáticas; dentro de cada padre se crean hijos más pequeños que facilitan coincidencias precisas. Este doble nivel mejora tanto la recuperación de contexto amplio como la precisión de detalle, pero su implementación requiere una capa adicional de metadatos que a menudo se pasa por alto en los primeros prototipos.

Para los profesionales hispanohablantes que trabajan en aplicaciones de IA, entender el chunking es tan vital como seleccionar el modelo de lenguaje adecuado. Un mal particionado puede llevar a respuestas irrelevantes o a un aumento innecesario de los costos de computación en la nube. Al aplicar las estrategias y el árbol de decisión descritos, los equipos pueden iterar más rápido, lograr un mejor equilibrio entre recall y precisión, y evitar el rediseño costoso que ocurre cuando se ignora este paso fundamental en el pipeline RAG.