Os seres humanos tendem a atribuir características humanas aos sistemas de IA. Atribuímos conceitos semelhantes aos humanos às suas ações, como "aprender" e "pensar". Por exemplo, alguém pode dizer, "O ChatGPT não entende meu prompt" quando o algoritmo de PLN (processamento de linguagem natural) do chatbot não consegue retornar o resultado desejado.
Conceitos familiares como "compreensão" nos ajudam a conceituar melhor como sistemas complexos de IA funcionam. Contudo, também podem levar a noções distorcidas sobre os recursos da IA. Se atribuirmos conceitos humanos aos sistemas de IA, é natural que nossas mentes humanas deduzam que eles também possuem valores e motivações humanas.
Mas essa inferência é fundamentalmente falsa. A inteligência artificial não é humana e, portanto, não pode se preocupar intrinsecamente com a razão, a lealdade, a segurança, as questões ambientais e o bem maior. O objetivo principal de uma "mente" artificial é completar a tarefa para a qual foi programada.
Portanto, cabe aos desenvolvedores de IA incorporar valores e objetivos humanos. Caso contrário, na busca pela conclusão da tarefa, os sistemas de IA podem se desalinhar dos objetivos dos programadores e causar danos, às vezes de forma catastrófica. Essa consideração é importante à medida que a automação se torna mais predominante em casos de uso de alto risco nos setores de saúde, recursos humanos, finanças, cenários militares e transporte.
Por exemplo, carros autônomos podem ser programados com o objetivo principal de ir do ponto A ao ponto B o mais rápido possível. Se esses veículos autônomos ignorarem as proteções de segurança para cumprir esse objetivo, eles poderão ferir gravemente ou até matar pedestres e outros motoristas.
Os pesquisadores Simon Zhuang e Diana Hadfield-Menell, da University of California, Berkeley, comparam o alinhamento da IA ao mito grego do Rei Midas. Em resumo, o Rei Midas tem direito a um desejo e solicita que tudo o que ele toca se transforme em ouro. Ele acaba falecendo porque a comida em que toca também se torna ouro, tornando-a não comestível.
O Rei Midas teve um fim prematuro porque seu desejo (ouro ilimitado) não refletia o que ele realmente queria (riqueza e poder). Os pesquisadores explicam que os designers de IA geralmente se encontram em uma posição semelhante, e que "o desalinhamento entre o que podemos especificar e o que queremos já causou danos significativos". 2