این تعهد متعلق به هیچ شعبه ای در این مخزن نیست و ممکن است متعلق به یک چنگال در خارج از مخزن باشد.
نام در حال استفاده
یک برچسب در حال حاضر با نام شاخه ارائه شده وجود دارد. بسیاری از دستورات GIT نام برچسب و شاخه را می پذیرند ، بنابراین ایجاد این شاخه ممکن است باعث رفتار غیر منتظره شود. آیا مطمئن هستید که می خواهید این شاخه را ایجاد کنید؟
با استفاده از URL وب از Git یا Checkout با SVN استفاده کنید.
با CLI رسمی ما سریع کار کنید. بیشتر بدانید.
ورود به سیستم لازم
لطفاً برای استفاده از برنامه های کد وارد سیستم شوید.
راه اندازی دسک تاپ GitHub
اگر هیچ اتفاقی نمی افتد ، دسک تاپ GitHub را بارگیری کنید و دوباره امتحان کنید.
راه اندازی دسک تاپ GitHub
اگر هیچ اتفاقی نمی افتد ، دسک تاپ GitHub را بارگیری کنید و دوباره امتحان کنید.
راه اندازی Xcode
اگر هیچ اتفاقی نمی افتد ، Xcode را بارگیری کنید و دوباره امتحان کنید.
راه اندازی کد ویژوال استودیو
فضای کد شما یک بار آماده خواهد شد.
مشکلی برای تهیه فضای کدگذاری شما وجود داشت ، لطفاً دوباره امتحان کنید.
آخرین تعهد
آمار git
فایل ها
بارگیری آخرین اطلاعات متعهد انجام نشد.
readme. md
تخصیص کانال پویا در شبکه های سلولی
این پروژه انواع زیادی از استراتژی ها را برای انجام تخصیص کانال در شبکه های سلولی پیاده سازی می کند. در شبکه های تلفن همراه ، هر ایستگاه پایه باید (از یک مجموعه محدود) را انتخاب کند که از کانال رادیویی برای هر درخواست سرویس استفاده کند. یک کانال نمی تواند در دو ایستگاه پایه مجاور و بدون ایجاد تداخل در همزمان باشد. اگر یک تماس گیرنده تلفن همراه از یک ایستگاه پایه درخواست کند اما هیچ کانال وجود ندارد که بدون تداخل قابل استفاده باشد ، باید درخواست مسدود شود. هدف سیاست تخصیص کانال (از این پس "عامل" ، یعنی تصمیم گیرنده) به حداقل رساندن احتمال مسدود کردن تماس ها است.

- یک شبکه با ارزش دولتی با عملکرد از دست دادن جدید که نتایج پیشرفته ای را ارائه می دهد.
- تظاهرات چندین تکنیک که کد نمونه در زمان نوشتن وجود ندارد ، به عنوان مثالZAP-Q ، TDC ، TDC برای شبکه های غیرخطی و اکتشاف Boltzma-Gumbel.
- شبکه های همبستگی با عمق و جدا از هم جدا شده است.
- یک رویکرد مانند بررسی درخت برای تغییر مجدد کانال ها در تماس.
- یک الگوریتم افزایشی برای محاسبه بازنمایی ویژگی شبکه ، که پیچیدگی محاسباتی را از O (NK) به زمان ثابت O (1) با توجه به سلول های شبکه N و کانال های K کاهش می دهد.
شبیه ساز شبکه سلولی ، همراه با بهترین عملکرد ، به Rust و Haskell منتقل شده است.
نماینده ارائه شده در تورستین سورنس 2018: مشارکت در عوامل تخصیص کانال پویا متمرکز (PDF) ، نتایج پیشرفته ای را برای شبکه های سلولی با یک عامل متمرکز ارائه می دهد. از شیب های TDC با یک شبکه عصبی خطی با ارزش دولتی با بازده دیفرانسیل (یعنی بهینه سازی برای پاداش متوسط) و نگاه دستی (HLA) استفاده می کند. برای اجرای آن ، با 10 ارلانگ ارزش ترافیک تماس و 15 ٪ احتمال دستیابی به آن:
python3 main. py tftdcsinghne t-hoff_lookahea d-erlangs 1 0-p_handoff 0. 15
python3 main. p y-long_option_nam e-short_option_name
برای دیدن گزینه های مورد استفاده برای توطئه ها در پایان نامه فوق ، به Plotscript. sh مراجعه کنید.
ذکر شده در زیر برخی از ویژگی ها و پیاده سازی های عامل. Python3 Main. py - -Help را برای یک لیست جامع و گزینه های پیش فرض اجرا کنید.
برای اجرای آن به FixiftStrats. py مراجعه کنید.
- تکلیف ثابت (نام عامل: ثابت)
- اختصاص تصادفی (RandomAssign)
- ترجیح کانال ثابت ، تصادفی اگر هیچ یک در دسترس باشد (fixistrandomassign)
عامل RL گزینه های زیادی را ارائه می دهد ، 20+ مقاله را در دامنه تخصیص RL و کانال پوشش می دهد و انتخابی را ارائه می دهد:
- تعریف پاداش
- اهداف (یعنی آنچه می خواهیم در دامنه حداکثر یا به حداقل برسانیم)
- توابع ضرر (که در RL چندین مورد از پاداش ثابت و تعریف هدف وجود دارد) ،
- استراتژی های اکتشافی
- روشهای دولتی و دولتی
- معماری شبکه عصبی (شبکه های عصبی Convolutional ، Dueling Q-Networks ، +++)
ویژگی ها و پیاده سازی ها
- میانگین پاداش MDP (پارامتر شده با میانگین نرخ یادگیری پاداش) (به عنوان مثا ل-براج AV G-WBETA 0. 01) (به عنوان مثال Tadepalli 2017: تقویت کننده یادگیری متوسط) مراجعه کنید)
- پاداش تخفیف MDP (به عنوان مثا ل-تخفیف هد ف-Gamma 0. 8)
- پاداش تخفیف SMDP (به عنوان مثا ل-تخفیف در تاری خ-BDIS C-BETA 4 0-RTYPE SMDP_CALLCOUNT) (به عنوان مثال GOSAVI 2017: یک آموزش برای یادگیری تقویت یا Bradtke و همکاران 1996: روش های یادگیری تقویت برای مشکلات تصمیم گیری مارکوف به موقع)
- rsmart (-target avg_rsmart)
- (1) در تماس های پذیرفته شده و (-1) در تماس های مسدود شده (-Rtype new_block)
- تعداد تماس (-Rtype callCount)
- تعداد تماس با گذشت زمان یکپارچه شده است (-Rtype smdp_callcount)
دو قدم نگاه در دست (-hla)
استراتژی های اکتشاف (exp_policies. py):
- حریص (-epol حریص)
- Epsilo n-Greedy (به عنوان مثا ل-epol EPS_GREED Y-EPS 0. 5)
- Boltzma (به عنوان مثا ل-epol boltzman n-eps 2)
- Boltzma-Gumbel (-epol Bgumbel) (به Cesa-Bianchi 2017 et. al مراجعه کنید: اکتشافات بولتزمن درست انجام شده است)
- ترجیح کانال اسمی ثابت (-Epol nom_fixed_greedy)
- اولویت کانال اسمی حریص (-epol nom_greedy)
- Boltzma با اولویت کانال اسمی (-epol nom_boltzma)
رویکردهای ارزش دولتی
همه شبکه های عصبی از همان رویکردی که در Singh و Bertsekas 1997 استفاده می کنند استفاده می کنند: یادگیری تقویت برای تخصیص کانال پویا در سیستم های تلفن همراه ، که در آن ورودی به شبکه عصبی شبکه نیست بلکه یک ویژگی از آن است.
شبکه های ارزش حالت دارای یک خروجی مقیاس واحد - مقدار وضعیت ورودی - بر خلاف شبکه های اکشن دولت هستند که برای هر عمل یک مقدار را تولید می کنند. رویکرد قبلی همیشه به دلیل کمتر وزن شبکه عصبی ، کارآمدتر از داده ها است ، اما همیشه قابل تحقق نیست زیرا دانش عملکرد پاداش و (دانش جزئی از) عملکرد انتقال حالت در صورت تمایل به انتخاب اقدامات با استفاده از شبکه ضروری است. بشردر این دامنه ، این رویکرد با توجه به شبکه و رویداد فعلی ، پاداش و انتقال شبکه قطعی است.
- True Online td lambda (tdlsinghnet ، singh_tdl. py)
- GTD2 (GTD2SingHnet ، Singh_gtd2. py)
- TDC-TD0 با تصحیح شیب (tdcsinghnet برای Singh_tdc. py ، یا tftdcsinghnet برای SingH_TDC_TF. Py که یک نسخه معادل است که در تمام Tensorflow اجرا شده است) (به Sutton et al. 2009 مراجعه کنید: روش های شیب سریع برای یادگیری با استفاده از خط مشی با عملکرد خطی. تقریب)
- TDC-NL-TD0 با تصحیح شیب برای تقریب عملکرد غیر خطی ، یعنی شبکه های عصبی چند لایه (SingH_TDC_NL. Py) (به Maei و همکاران 2009 مراجعه کنید: یادگیری دفاعی همگرا با عملکرد صاف خودسرانه)
- شیب باقی مانده ساده لوح - (Singh_resid. py) (به Baird 1995 مراجعه کنید: الگوریتم های باقیمانده: یادگیری تقویت با تقریب عملکرد)
- LSTD - حداقل مربعات تفاوت زمانی (Singh_lstd. py)
نمایندگی های ویژگی (به gridfuncs_numba. py مراجعه کنید):
- همانطور که در Singh97 (-type وانیل)
- مانند Singh97 ، اما همچنین شامل تعداد کانال های استفاده شده با Dist 3 یا کمتر (-ftype Big)
- ویژگی های جداگانه برای تعداد CHS استفاده شده با Dist 4 ، با Dist 3 ، .. (-ftype big2)
شبکه های ارزش اکشن
- Q-Leaing (Qleanet)
- سارسا (سارسانت)
- بروزرسانی به سمت حداکثر اقدام واجد شرایط (QLeaeligiblenet)
- به جای پیش فرض که در آن سلول به شبکه وارد می شود و خروجی از اندازه N_Chaels_ است ، از N_Chaels x N_Cells استفاده کنید.
- Dueling Q-Net (-duel) (به وانگ و همکاران 2016 مراجعه کنید: معماری های شبکه دوئل برای یادگیری عمیق)
- Double Q-Net (به عنوان مثال-net_copy_iter 50-net_creep_tau 0. 1) (به Hasselt et al. 2016 مراجعه کنید: یادگیری تقویت عمیق با یادگیری دوتایی)
- پخش مجدد تجربه (به عنوان مثال-batch_size 10-buffer_size 5000) (به Mnih و همکاران 2015 مراجعه کنید: کنترل سطح انسان از طریق یادگیری تقویت عمیق)
- بازگشت N-Step (به عنوان مثال nqleanet-n_step 4)
- GAE (برآوردگر مزیت عمومی) بازده (Gaeqleanet)
- نمایندگی ویژگی به عنوان ورودی شبکه (شبکه خام به طور پیش فرض است) ( -qnet_freps یا --qnet_freps_only)
- ++
جستجو در جدول Action Action
برای اجرای Table_RL. py مراجعه کنید
- Lilith Sarsa (Sarsa) (به عنوان مثال Lilith et al. 2004: SARSA کاهش یافته با تغییر مجدد کانال برای تخصیص کانال پویا در تلفن همراه تلفن همراه)
- میز لیلیث سارسا (TT_SARSA)
- لیلیث سارسا (RS_SARSA)-SARSA (RS_SARSA)
- همه موارد فوق ، با بازگشت لامبدا (به عنوان مثال RS_SARSA - -Lambda 0. 8)
- Zap-Q Leaing با ویژگی RS-Sarsa Rep.(ZAPQ) (هشدار: _ بسیار کند!)
داربست گسترده برای آزمایش Hyperparameter با استفاده از DLIB (به DLIB_RUNNER. PY مراجعه کنید) یا HyperOpt (به HOPT_RUNNER. PY مراجعه کنید)
متوسط بیش از چندین اجرا (به عنوان مثال Python3 rs_sars a-avg_runs 8 ، به دونده ها/avg_ruer. py مراجعه کنید)
مقایسه های اکتشافی (به عنوان مثال Python3 rs_sarsa --exp_policy_cmp n ، به دونده ها/exp_pol_ruer. py مراجعه کنید)
- استراتژی های مختلف اکتشافی را با یکدیگر مقایسه کنید ، هر کدام با استفاده از طیف وسیعی از پارامترهای اکتشافی (به عنوان مثال اپسیلون)
- برای هر استراتژی اکتشافی و انتخاب پارامتر ، اگر تمام اجراها تاکنون بلوک داشته باشند ، به طور متوسط تا N اجرا می شود. احتمالاًکمتر از آستانه (به عنوان مثا ل-breakout_thresh 0. 15)
اگر سؤال ، مشارکت یا مشکلات دارید ، مسئله جدیدی را باز کنید.
در باره
تخصیص کانال پویا در شبکه های سلولی با یادگیری تقویت
فارکس وکسب درامد...
ما را در سایت فارکس وکسب درامد دنبال می کنید
برچسب :
نویسنده : آرش اصل زاد
بازدید : <-PostHit->
تاريخ : سه
شنبه
30 خرداد
1402 ساعت: 13:52