Skip to content

Folders and files

NameName
Last commit message
Last commit date

Latest commit

ย 

History

15 Commits
ย 
ย 
ย 
ย 
ย 
ย 

Repository files navigation

RL-Path-Find-Simulator

Path Find Simulator using Reinforcement learning

Q๋Ÿฌ๋‹์„ ์‚ฌ์šฉํ•œ ๊ธธ์ฐพ๊ธฐ ์‹œ๋ฎฌ๋ ˆ์ดํ„ฐ ์ž…๋‹ˆ๋‹ค.

์˜์ƒ

Trailer

๋งŒ๋“  ์ด์œ 

๊ฐ•ํ™”ํ•™์Šต ๊ณต๋ถ€๋ฅผ ํ•˜๋‹ค๊ฐ€ Q๋Ÿฌ๋‹ํŒŒํŠธ๋ฅผ ๋ณด๋Š”๋ฐ,
์—ํ”ผ์†Œ๋“œ๊ฐ€ ๋๋‚˜์ง€ ์•Š์•˜์Œ์—๋„, ๊ฐ ์Šคํ…๋งˆ๋‹ค ํŒ๋‹จํ•˜์—ฌ ํ•™์Šตํ•˜๋Š” Q๋Ÿฌ๋‹์˜ ๋ฐฉ๋ฒ•์ด ์ธ์ƒ์ ์ด์—ˆ์Šต๋‹ˆ๋‹ค.
๊ทธ๋ž˜์„œ ์žฌ๋ฐŒ์–ด๋ณด์—ฌ์„œ ๋งŒ๋“ค์–ด ๋ดค์Šต๋‹ˆ๋‹ค.

์ „์ œ ์กฐ๊ฑด

  • ์ถœ๋ฐœ์ง€์ ์€ ์ขŒ์ƒ๋‹จ, ๋„์ฐฉ์ง€์ ์€ ์šฐํ•˜๋‹จ
  • ์ตœ์ ์˜ path = ์ตœ๋‹จ ๊ฑฐ๋ฆฌ path
  • ์—…๋ฐ์ดํŠธ ํ•  ๋•Œ ์‚ฌ์šฉํ•˜๋Š” ์‹
    Q(S,A) = Q(S,A) + alpha * (reward + max(Q(S',A')) - Q(S,A))
    reward = -1, alpha = 0.1

์‚ฌ์šฉ ๋ฐฉ๋ฒ•

  1. ๋งต ์‚ฌ์ด์ฆˆ๋ฅผ ์„ค์ •ํ•˜๊ณ  Create๋ฅผ ๋ˆ„๋ฆ…๋‹ˆ๋‹ค. (Default Size: 5 X 5)
  2. ๋ฒฝ์„ ์„ธ์šฐ๊ณ  ์‹ถ์€ ์œ„์น˜์˜ ๋ฒ„ํŠผ์„ ๋ˆŒ๋Ÿฌ๋‘ก๋‹ˆ๋‹ค.
    • ์ฃผ์˜ ์‚ฌํ•ญ
      • ๋„์ฐฉ ์ง€์ ๊นŒ์ง€์˜ path๊ฐ€ ์กด์žฌํ•˜์ง€ ์•Š๋Š”๋‹ค๋ฉด, step ๋‹จ์œ„๋กœ ์›€์ง์ผ๋•Œ๋Š” ์ƒ๊ด€์—†์ง€๋งŒ, ๋งŒ์•ฝ ์—ํ”ผ์†Œ๋“œ ๋‹จ์œ„๋กœ ์ง„ํ–‰ํ•˜๊ฒŒ ๋œ๋‹ค๋ฉด ๋ฌดํ•œ ๋ฃจํ”„์— ๊ฑธ๋ฆฌ๊ฒŒ ๋ฉ๋‹ˆ๋‹ค.
  3. Set ๋ฒ„ํŠผ์„ ๋ˆŒ๋Ÿฌ์„œ ๋งต์„ ์ ์šฉ์‹œํ‚ต๋‹ˆ๋‹ค.
  4. Next Step์ด๋‚˜ Play Episode๋ฅผ ๋ˆŒ๋Ÿฌ์„œ ํ•™์Šต์‹œํ‚ต๋‹ˆ๋‹ค.
    Play Episode์—์„œ ์ง„ํ–‰ํ•  ์—ํ”ผ์†Œ๋“œ์˜ ๊ฐœ์ˆ˜๋ฅผ ์„ค์ •ํ•  ์ˆ˜ ์žˆ์Šต๋‹ˆ๋‹ค. (Default: 1000)

์ถ”๊ฐ€ ์ •๋ณด

  • ๋งต ํƒ€์ผ์˜ ํ™”์‚ดํ‘œ๋Š” ์—์ด์ „ํŠธ๊ฐ€ ์ƒ๊ฐํ•˜๋Š” ๊ทธ ํƒ€์ผ์—์„œ์˜ ์ตœ์ ์˜ ๋ฐฉํ–ฅ์ž…๋‹ˆ๋‹ค.
    ํ™”์‚ดํ‘œ๋ฅผ ๋ณด๊ณ  ํ•™์Šต ์ƒํ™ฉ์„ ์•Œ ์ˆ˜ ์žˆ์Šต๋‹ˆ๋‹ค.
  • ๋žœ๋ค ํ™•๋ฅ ์„ ๊ฒฐ์ •ํ•˜๋Š” epsilon์ด ์กด์žฌํ•˜๊ธฐ ๋•Œ๋ฌธ์— ๊ผญ ์ตœ์  ๋ฐฉํ–ฅ์œผ๋กœ๋งŒ ์›€์ง์ด์ง€๋Š” ์•Š์Šต๋‹ˆ๋‹ค.
  • epsilon์€ ์ง์ ‘ ์„ค์ • ๊ฐ€๋Šฅํ•ฉ๋‹ˆ๋‹ค. (๋‹ค๋งŒ 0์—์„œ 1์‚ฌ์ด์˜ ๊ฐ’์ด์–ด์•ผ ํ•ฉ๋‹ˆ๋‹ค.)
    ํ•™์Šต์ด ์ถฉ๋ถ„์ด ๋˜์—ˆ๋‹ค ์‹ถ์œผ๋ฉด epsilon์„ 0์œผ๋กœ ๋งŒ๋“ค์–ด์„œ ์ตœ์ ์˜ ๊ธธ๋กœ ๊ฐ€๋Š” ์—์ด์ „ํŠธ๋ฅผ ํ™•์ธํ•ด๋ณผ ์ˆ˜ ์žˆ์Šต๋‹ˆ๋‹ค.
  • epsilon์„ Set ํ•œ ์ˆœ๊ฐ„ epsilon์€ resetํ•˜๊ธฐ ์ „ ๊นŒ์ง„, annealing ๋˜์ง€ ์•Š๊ณ  ๊ณ ์ •๋ฉ๋‹ˆ๋‹ค.
  • ๋ณดํ†ต 500๋ฒˆ์ด์ƒ์˜ ์—ํ”ผ์†Œ๋“œ์ •๋„ ์ง„ํ–‰ํ•ด์•ผ ์ตœ๋‹จ path๋ฅผ ์ฐพ์„ ์ •๋„๋กœ ํ•™์Šต์ด ๋ฉ๋‹ˆ๋‹ค.
  • ์—์ด์ „ํŠธ๊ฐ€ ๋งŽ์ด ๋ฐฉ๋ฌธํ•˜์ง€ ๋ชปํ•œ ํƒ€์ผ์€ ์—‰๋šฑํ•œ ๋ฐฉํ–ฅ์˜ ํ™”์‚ดํ‘œ๊ฐ€ ์žˆ์„ ์ˆ˜ ์žˆ์Šต๋‹ˆ๋‹ค.
    ๋งŽ์ด ๋ฐฉ๋ฌธํ•˜์ง€ ๋ชปํ•œ ํƒ“์— ํ•™์Šต์ด ์ œ๋Œ€๋กœ ์ด๋ฃจ์–ด์ง€์ง€ ์•Š์•„์„œ ์ƒ๊ธฐ๋Š” ํ˜„์ƒ์ž…๋‹ˆ๋‹ค.
    ๋ณดํ†ต ์ตœ๋‹จ๊ฑฐ๋ฆฌ์™€ ๊ด€๋ จ์—†๋Š” ์œ„์น˜์˜ ํƒ€์ผ๋“ค์—์„œ ์ž์ฃผ ์ผ์–ด๋‚ฉ๋‹ˆ๋‹ค.
  • epsilon ๊ฐ’์„ ๋†’๊ฒŒ ์ฃผ๊ณ  ์—ํ”ผ์†Œ๋“œ๋ฅผ ์—ฌ๋Ÿฌ๋ฒˆ ๋Œ๋ฆฌ๋ฉด ํ•™์Šต์†๋„๋Š” ๋А๋ฆฌ์ง€๋งŒ, ๊ตฌ์„ ํƒ€์ผ ๊นŒ์ง€๋„ ์ž˜ ํ•™์Šต๋˜๋Š” ๊ฒƒ์„ ๋ณผ ์ˆ˜ ์žˆ์Šต๋‹ˆ๋‹ค.

About

Path Find Simulator using Reinforcement learning

Resources

Stars

0 stars

Watchers

1 watching

Forks

Releases

Packages

Contributors

Languages