OTIMIZAÇÃO DO QLEARNING USANDO PSO NO CONTEXTO DO PROBLEMA DOS K-SERVOS
K-servos; Q-Learning; Otimização por Enxame de Partículas; Recozimento simulado; Aprendizado por Reforço.
O Problema dos k-Servos (KSP) formaliza a alocação online de recursos móveis em espaços métricos, cenário recorrente em logística urbana, despacho de emergência, gerenciamento de caches e orquestração de instâncias em nuvem, no qual cada decisão é irrevogável e tomada sem acesso a demandas futuras. As duas famílias de soluções consolidadas apresentam limitações complementares: o Work Function Algorithm (WFA), embora garanta razão competitiva (2k - 1), incorre em custo exponencial em k e torna-se inviável em tempo real a partir de poucas dezenas de localizações e mais de cinco servos; o Q-Learning tabular contorna esse gargalo, mas sua política depende criticamente da tripla de hiperparâmetros (α, γ, ε) ∈ Θ), cujos valores ´ótimos não são transferíveis entre perfis de demanda distintos. Este trabalho propõe e avalia um framework híbrido que acopla Q-Learning tabular a meta-heurística de otimização automática de hiperparâmetros, empregando Particle Swarm Optimization (PSO) como explorador global e Simulated Annealing (SA) como refinador local, com função de aptidão que penaliza conjuntamente a recompensa média e a variabilidade entre execuções. A avaliação utilizou 41 instâncias sintéticas cobrindo 14 perfis de demanda, organizados em três classes (estacionário, não-estacionário e adversarial), com escalas de até n = 300 localizações e k = 12 servos. O protocolo em três fases avaliou 108 configurações por instância em 10 repetições, reutilizando os hiperparâmetros otimizados na primeira fase para isolar a contribuição de cada componente. Os resultados indicam que a estratégia de otimização de hiperparâmetros é o fator dominante: métodos com hiperparâmetros fixos registraram gap médio entre 5,75% e 6,31%, enquanto os otimizados atingiram entre 3,15% e 4,87%, sem aumento do coeficiente de variação. O PSO Básico ofereceu o melhor equilíbrio entre qualidade e custo (gap 3,17% em 35,8 s), e o DeepSearch alcançou maior consistência (CV 0,066) a custo quatro vezes superior. O otimizador mais adequado variou conforme a classe de demanda. As contribuições residem na arquitetura PSO+SA no KSP, no benchmark de taxonomia controlada e na evidência empírica de que a otimização automática viabiliza o aprendizado tabular em escalas nas quais o WFA é inviável e a calibração manual produz qualidade inferior.