Memory Tree
📝 Définition courte
Pattern de mémoire longue où les documents sont découpés, résumés et organisés en arbre hiérarchique afin que l’agent ne charge que les nœuds utiles dans le contexte.
📖 Définition détaillée
Un Memory Tree remplace ou complète une base vectorielle classique. Au lieu de chercher seulement des chunks proches d’une question, l’agent parcourt une hiérarchie : titres, résumés courts, sous-résumés, puis contenu exact si nécessaire.
L’intérêt est de réduire la quantité de tokens injectés et donc la pression sur la fenêtre de contexte et le KV Cache.
💡 Pourquoi c’est important en IA on-premise
Sur une machine locale, la VRAM et la bande passante mémoire sont limitées. Un Memory Tree aide à garder un contexte court, ce qui réduit le TTFT et évite de saturer le serveur avec des documents entiers.
⚠️ Pièges fréquents
- Croire qu’un Memory Tree remplace tous les usages d’une base vectorielle.
- Faire confiance à des résumés obsolètes si l’arbre n’est pas régénéré.
- Oublier de citer le document source exact après navigation dans l’arbre.
📚 Pour comprendre en profondeur
- RAG & Agents : l'approche Memory Tree
- OpenHuman (exemple de Memory Tree local-first mais hybride cloud par défaut)