NLP & ML3 min read
Recherche
La mémoire partagée a ses limites : les algorithmes acteur-critique peinent à passer l'échelle au-delà de cinq agents
Des chercheurs ont partagé des buffers de répétition entre des agents acteur-critique sur des tâches d'actions paramétrées. GAC a bondi en performance, tandis que SAC et TQC n'ont que faiblement progressé. Au-delà de cinq agents, le coût de calcul grimpe sans retour significatif. L'article propose une limite pratique pour savoir jusqu'où les méthodes d'expérience partagée peuvent s'étendre avant de plafonner.
2026-07-27