As árvores de decisão com gradient boosting são um tipo de algoritmo de boosting que utiliza gradiente descendente. Assim como outras metodologias de boosting, o gradient boosting começa com um aprendiz fraco para fazer previsões. A primeira árvore de decisão no gradient boosting é chamada de aprendiz básico. Em seguida, novas árvores são criadas de forma aditiva com base nos erros do aprendiz básico.
O algoritmo, então, calcula os resíduos das previsões de cada árvore para determinar o quanto as previsões do modelo estavam distantes da realidade. Os resíduos são a diferença entre os valores previstos e os valores reais do modelo. Em seguida, os resíduos são agregados para pontuar o modelo usando uma função de perda.
No contexto de aprendizado de máquina, funções de perda são empregadas para avaliar o desempenho de um modelo. O gradiente em árvores de decisão com gradient boosting refere-se ao gradiente descendente.
O gradiente descendente é utilizado para minimizar a perda (ou seja, para melhorar o desempenho do modelo) quando treinamos novos modelos. O gradiente descendente é um algoritmo de otimização popular utilizado para minimizar a função de perda em problemas de aprendizado de máquina. Alguns exemplos de funções de perda incluem o erro quadrático médio ou o erro absoluto médio para problemas de regressão, a perda de entropia cruzada para problemas de classificação, ou funções de perda personalizadas que podem ser desenvolvidas para um caso de uso e conjunto de dados específico.