Uma parte integrante de qualquer configuração de aprendizado por reforço é fornecer aos agentes de RL um ambiente simulado confiável. Isso é melhor alcançado usando um software de simulação poderoso e de uso geral, com conexões rápidas, consistentes e simplificadas com algoritmos de RL. Para especialistas ou pesquisadores que desejam usar modelos AnyLogic como ambiente de treinamento para aprendizado por reforço, há duas opções disponíveis: a biblioteca Alpyne e a API do AnyLogic Cloud (para casos de uso limitados).
Uma parte integral de qualquer configuração de aprendizado de reforço é fornecer aos agentes de IA um ambiente simulado confiável. Isso é melhor realizado usando um poderoso software de simulação de propósito geral com conexões rápidas, consistentes e simplificadas com algoritmos de RL. As políticas aprendidas com treinamentos podem eventualmente ser implantadas no sistema real do qual o modelo de simulação foi construído.

Em sua essência, o processo de treinamento de aprendizado por reforço é composto por um explorador artificial que examina e escrutina todos os cantos de um ambiente de simulação. Com um esquema de recompensa apropriado, esse mecanismo pode ser usado para automatizar parcialmente alguns aspectos comumente repetitivos do processo de verificação e validação, permitindo testes mais completos da robustez e fidelidade do modelo de simulação. Embora essa abordagem ainda esteja em sua infância, ela tem o potencial de se tornar parte integrante do processo de verificação e validação para todos os tipos de modelos.

Existem repositórios de ambientes RL padronizados para pesquisadores testarem e compararem seus algoritmos em campos de jogo comparáveis. No entanto, esses ambientes amplamente usados não fornecem a variedade e a complexidade que são comuns em sistemas simulados reais. Uma plataforma de simulação de propósito geral pode fornecer ambientes de treinamento sofisticados que podem ser facilmente personalizáveis, mas também podem fornecer níveis variados de complexidades e complicações que são exclusivos para cada indústria e cenário aplicado.

Os analistas podem escolher, projetar ou curar todos os tipos de soluções baseadas em regras, algorítmicas ou heurísticas. Ter acesso a uma solução de linha de base, na forma de uma política de RL, é extremamente valioso para lançar luz sobre a eficácia de soluções curadas e moldadas manualmente – especialmente quando essas soluções são para cenários em que um ótimo absoluto é inatingível.

Os analistas podem escolher, projetar ou curar todos os tipos de soluções baseadas em regras, algorítmicas ou heurísticas. Ter acesso a uma solução de linha de base, na forma de uma política de RL, é extremamente valioso para lançar luz sobre a eficácia de soluções curadas e moldadas manualmente – especialmente quando essas soluções são para cenários em que um ótimo absoluto é inatingível.
Conecte modelos AnyLogic exportados e comunique-se com frameworks de IA em um ambiente Python local via Alpyne.
Para aqueles interessados em testar como uma configuração de RL com curadoria manual funciona com um modelo AnyLogic em uma máquina local, o Alpyne oferece uma maneira de fazer isso. Este pacote baseado em Python permite a comunicação com um modelo AnyLogic exportado do Experimento RL.

Carregue o modelo de simulação para o AnyLogic Cloud e use a API da nuvem para se comunicar com as estruturas de IA atribuídas pelo usuário.
Esta opção é para especialistas com código de treinamento de RL definido manualmente que desejam treinar usando ambientes de simulação hospedados no AnyLogic Cloud. Proprietários do AnyLogic Private Cloud têm acesso a uma API Python que executa os modelos em uma plataforma escalável baseada em servidor. Esta API suporta apenas episódios de treinamento que não exigem comunicação interativa, pois fornece a recompensa (ou feedback) ao final de cada episódio.
