آیا پردازش عمیق و پردازش زبان طبیعی از پیش بینی مالی فراتر می رود؟بررسی از طریق لنزهای فرایند تحلیلی خبری

ساخت وبلاگ

این مطالعه سعی دارد با استفاده از تکنیک های پردازش زبان طبیعی (NLP) و مدل مکرر یادگیری عمیق به نام حافظه کوتاه مدت (LSTM) ، پازل پیش بینی بازار سهام را با استفاده از تحلیلی متنی با کمک تکنیک های پردازش زبان طبیعی (NLP) باز کند. این مطالعه به جای استفاده از روشهای شاخص سنتی احساسات سنتی مبتنی بر شمارش ، از مکانیسم شاخص SENTIMENT SANTENT و مربوط به اهمیت خود استفاده می کند. از داده های قیمت ساعتی در این تحقیق استفاده شده است زیرا داده های روزانه خیلی دیر است و داده های دقیقه برای دریافت اثر انحصاری احساسات خیلی زود است. به طور معمول ، داده های ساعتی برای مدیریت و تجزیه و تحلیل بسیار پرهزینه و دشوار است. داده های ساعتی به ندرت در انواع مشابه تحقیقات استفاده می شود. برای ایجاد شاخص احساسات ساخته شده ، اطلاعات تحلیلی متن تجزیه و تحلیل شده است ، اطلاعات متنی که مربوط به سهام منتخب است ، جمع آوری ، جمع آوری ، طبقه بندی و تصفیه شده با NLP و در نهایت به صورت علمی به شاخص احساسات ساعتی تبدیل می شود. منابع تحلیلی خبری شامل رسانه های اصلی ، رسانه های چاپی ، رسانه های اجتماعی ، فیدهای خبری ، وبلاگ ها ، پورتال های مشاوره سرمایه گذاران ، نظرات کارشناسان ، به روزرسانی کارگزاران ، اطلاعات مبتنی بر وب ، اخبار داخلی شرکت و اطلاعیه های عمومی در مورد سیاست ها و اصلاحات است. نتایج مطالعه نشان می دهد که احساسات به طور قابل توجهی بر جهت سهام تأثیر می گذارد ، به طور متوسط پس از 3-4 ساعت. ده شرکت برتر از بخش های پیشرفته ، مالی ، پزشکی ، خودرو انتخاب شده اند و شش مدل LSTM ، سه مورد برای استفاده از متن-تحلیلی و سایر موارد بدون تحلیلی استفاده می شود. هر مدل شامل 1 ، 3 و 6 ساعت به عقب است. برای همه بخش ها ، یک مدل مبتنی بر مراحل 6 ساعته از سایر مدل ها به دلیل تخصص LSTM در حفظ حافظه طولانی مدت بهتر است. دقت جمعی مدل های تحلیلی متنی نسبت به مدلهای تحلیلی غیر متنی بالاتر است.

روی نسخه خطی کار می کنید؟

معرفی

پیش بینی دقیق بازده برای سرمایه گذاران انفرادی ، بانک های سرمایه گذاری و مدیران سرمایه گذاری شرکت ها بسیار مهم است. همچنین برای سرمایه گذاران نیز به همان اندازه مهم است که بازده را به طور دقیق پیش بینی کنند و استراتژی های سرمایه گذاری یا معاملات را در نظر بگیرند که همه جنبه های مربوط به پیش بینی را در نظر بگیرند. سالهاست که مطالعات پیش بینی بازار سهام بر مدل های نوسانات تأکید کرده است. تعداد کمی از مطالعات نقش پیش بینی تکنولوژیکی یعنی هوش مصنوعی را نشان می دهد. فرضیه بازار کارآمد (EMH) توسط FAMA (1998) پیشنهاد شده است ، زیرا مدل پیشنهادی برخلاف مفهوم امور مالی رفتاری است (Kahneman & Tversky ، 1979 ؛ Kahneman ، 2003 ؛ Shefrin ، 2008). بسیار مورد بحث قرار گرفته است و به عنوان محدودیت EMH در نظر گرفته شده است که این مدل نقش احساسات سرمایه گذار و جنبه رفتاری آنها را در نظر نمی گیرد. پیشرفت های فن آوری و اختراعات مدل جدید مبتنی بر هوش مصنوعی در حال تغییر شکل روش پیش بینی است (وانگ و همکاران ، 2018 ؛ کوو و هوانگ ، 2018 ؛ ماکیداکیس و همکاران ، 2018). به طور معمول ، مدل مبتنی بر هوش مصنوعی قیمت سهام قبلی و متغیرهای دیگر را در نظر می گیرد اما توجه تحلیلی خبری کمتر مورد بررسی قرار می گیرد. در این زمینه خاص ، خبرهای تحلیلی در مراحل اولیه قرار دارند و برای پیش بینی بهتر و کارآیی سیستم های تجاری هوشمند نیاز به پیشرفت دارند. در دهه گذشته ، روش ها و تکنیک های محاسبات نرم به سرعت رشد کرده اند که محققان را به کشف تکنیک های پیشرفته تر برای پیش بینی های بازار سهام و سری زمانی تبدیل می کنند. مدل سازی مالی سری زمانی دارای سابقه طولانی است و داده های سری زمانی با روابط پنهان ، عدم اطمینان زیاد و طبیعت بدون ساختار مشخص می شود. برای برآورد رفتار سری زمانی مالی ، دو نوع مدل در دسترس است. مدل خطی و مدل های غیر خطی. در حالی که ، مدل های خطی تحت تأثیر تکنیک هایی مانند جعبه های جعبه جنکینز و کالمن ، رگرسیون قطعه قطعه و هموار سازی نمایی براون قرار دارند. همه این تئوری ها داده ها را به توابع خطی تبدیل می کنند. با این حال ، شواهد اخیر نشان می دهد که بازارهای مالی با روشی غیرخطی رفتار می کنند. علاوه بر این مشکلات ، عوامل دیگری نیز وجود دارد که با بازارهای مالی مانند ، شرایط اقتصادی عمومی ، رویدادهای سیاسی ، اخبار و روانشناسی سرمایه گذار دست نخورده است که پیش بینی بازار سهام را بسیار دشوار می کند (چنگ و چان ، 2018 ؛ هوانگ و همکاران ، 2007). برای پرداختن به این مسائل ،

figure 1

هوش مصنوعی به دلیل یادگیری ، تعمیم و رفتار غیرخطی برای غلبه بر این مشکلات و پیش بینی بهتر ، به عنوان یک تکنیک بسیار خوب تکامل یافته است (Makridakis et al. ، 2018 ؛ Li & Ma ، 2010). در این ارتباط ، مهمترین تکنیک ها هستند ؛شبکه های عصبی مکرر ، شبکه های عصبی ، منطق فازی و الگوریتم ژنتیکی (Hiransha و همکاران ، 2018 ؛ Ergen et al. ، 2017 ؛ Nelson et al. ، 2017 ؛ Alfalahi et al. ، 2014). مدل شبکه های عصبی مصنوعی با انعطاف پذیری و سازگاری برای یادگیری از تغییرات و روند قبلی در مجموعه مشخصی از ورودی بسیار مناسب هستند و روند مبتنی بر آموزش شبکه را پیش بینی می کنند. شواهد عادلانه ای وجود دارد که در ادبیات وجود دارد که مدل هایی که بر اساس شبکه های عصبی مصنوعی از مدل سری سنتی بهتر عمل می کنند ، به عنوان مثال ، به Adebiyi (2012) ، Alfalahi و همکاران مراجعه کنید.(2014) ، Trippi and Desieno (1992) ، Correa و همکاران.(2009) و هانسون (2017). بسیاری از تکنیک های رایانه ای نرم در زیر چتر هوش مصنوعی موجود است اما یافتن تکنیک های مناسب برای به دست آوردن نتایج پیش بینی دقیق بسیار مهم است. مطالعه لی و همکاران.(2018) و Atsalakis و Valavanis (2009) را می توان در اینجا ارجاع داد ، هر کدام بیش از 100 مقاله توسط محققانی که از منطق فازی ، الگوریتم های ژنتیکی و شبکه های عصبی و شبکه عصبی مکرر به عنوان تکنیک های مدل سازی در مطالعات خود استفاده کرده اند ، بررسی کرده است. از این مقالات بدیهی است که بیشتر محقق از شبکه های عصبی خوراک به جلو (FFNN) استفاده کرده است ، در حال حاضر ، برخی از مطالعات از شبکه های عصبی مکرر (RNN) Perceptron (MLP) برای پیش بینی بازارهای سهام استفاده می کنند (Arora et al. ، 2019 ؛ Pawar ؛و همکاران ، 2019). این مطالعه نظرسنجی همچنین میزان اهمیت ابزارهای غیر متعارف برای پیش بینی بازار سهام را نشان می دهد. برای فرآیند پیش بینی بازار سهام ، ما نمی توانیم به قیمت سهام گذشته و متغیر دیگری اعتماد کنیم اما برای دستیابی به حداکثر دقت باید تأثیر اخبار بازار را تعبیه کنیم. در فرآیند پیش بینی ، این می تواند برای مدیران بسیار خسته کننده باشد که بر هر خبری که تازه ظاهر می شود تمرکز کنند و استراتژی های سرمایه گذاری آنها را تراز کنند. یک انسان می تواند اطلاعات زیادی را از دست بدهد و حتی اطلاعات نیز می تواند از دسترس او نیز خارج شود. بنابراین ، در اینجا تکنیک های پردازش زبان طبیعی (NLP) بازی می شوند. بنابراین،

نیاز فوری برای خودکارسازی فرایند تجزیه و تحلیل اخبار بر اساس تکنیک NLP وجود دارد تا مدیر سرمایه گذاری و شرکت ها بتوانند از آن بهره مند شوند و همچنین مدل های پیش بینی مبتنی بر هوش مصنوعی به جای فقط قیمت های گذشته ، می توانند با اطلاعات مرتبط تر تهیه شوند. پردازش زبان طبیعی زیرزمینی از هوش مصنوعی است که در آن الگوها و مدل یادگیری عمیق سعی می کنند رایانه ها زبان را به طور شهودی در نزدیکی سطح انسان درک کنند (نادکارنی و همکاران ، 2011). یک انسان از آموزش هزاران سال تا درک احساسات و احساس زبان های زبان تکامل یافته است اما رایانه ها با کمک یادگیری عمیق و مدلهای مبتنی بر هوش مصنوعی دست و پنجه نرم می کنند. در این مطالعه ، ما از مدل NLP استفاده کرده ایم (شکل 1 را ببینید) با طبقه بندی کننده Have Bayes برای پردازش اطلاعات خام که از بسیاری از منابع جدا شده است. این منابع شامل رسانه های اصلی ، رسانه های چاپی ، فیدهای اخبار رسانه های اجتماعی ، وبلاگ ها ، پورتال های مشاوره سرمایه گذاران ، نظرات متخصص ، به روزرسانی کارگزاران ، اطلاعات مبتنی بر وب ، اخبار داخلی شرکت و اطلاعیه های عمومی در مورد سیاست ها و اصلاحات است. جزئیات تجزیه و تحلیل اخبار و تجزیه و تحلیل احساسات را می توان در فرقه مشاهده کرد. 3. 1. 2. بسیاری از مطالعات تکنیک های محاسباتی نرم را برای بهتر ارائه می دهند و بیشتر تحقیقات بر مقایسه مدل های پیش بینی سهام سری سنتی و مدلهای شبکه تعبیه شده عصبی مصنوعی متمرکز شده اند. این مطالعه به روشهای زیر به بدن دانش موجود کمک می کند: به طور معمول ، مطالعات از اطلاعات خبری و داده های قیمت سهام برای شاخص ها استفاده می کنند. جدا از سایر انگیزه ها برای انتخاب شاخص ها برای فرآیند پیش بینی ، یک مزیت این است که جمع آوری داده ها و تجمع به دلیل در دسترس بودن آماده آن نسبتاً آسان تر است. با این حال ، جمع آوری اطلاعات خبری برای هر شرکت به صورت جداگانه و ایجاد احساسات معنی دار برای آن سهام چالش برانگیز است. با این حال ، این مطالعه بر روی سهام و اطلاعات خبری در سطح فردی متمرکز شده است که این مطالعه را کمی به چالش می کشد ، زیرا نه تنها اخبار از همه منابع ممکن نیاز به جمع آوری بلکه اخبار داخلی شرکت نیز دارند. به عنوان مثال ، این شرکت به هر دلیلی ، ECHELON برتر را تغییر می دهد یا تصمیم می گیرد سطح سود سهام را تغییر دهد ، هرگونه تفسیری در مورد "هشتگ" توسط منابع برجسته رسانه ای پوشانده نمی شود بلکه هنوز هم بر پیش بینی تأثیر می گذارد. ثانیاً ، این مطالعه بر تکنیک های NLP و نحوه استفاده از متن خبری خام برای فرآیندهای ساختمانی تأکید می شود. بنابراین ، مدل های مبتنی بر NLP در استخراج احساسات ، احساسات ، کارآمد هستند

و احساسات خارج از متن خام. سوم ، این مطالعه با استفاده از شبکه های عصبی ساده برای فرآیند پیش بینی بلکه مدل حافظه کوتاه مدت کوتاه مدت (LSTM) مبتنی بر عملکرد تازه توسعه یافته و بسیار اثبات شده در زمینه های مختلف. مدل های LSTM به طور خاص برای یادآوری وابستگی های طولانی مدت طراحی شده اند. نکته ای که باعث متفاوت شدن آن می شود بیشتر ، مدل LSTM با قیمت سهام گذشته به عنوان ورودی برای پیش بینی قیمت آینده سهام تهیه می شود ، با این حال ، این مطالعه از احساسات ، استخراج شده با کمک تکنیک های NLP ، برای پیش بینی قیمت سهام و پیش بینی شده است. از نتایج بدیهی است که مدل با احساسات به طور قابل توجهی دقت مدل را افزایش داده است. این مطالعه برای کلیه سرمایه گذاران نهادی و فردی ، انواع معامله گران ، مدیران نمونه کارها و به طور خاص برای سرمایه گذاران کوتاه مدت و بلند مدت که در بازار سهام ، علائم آینده ، بازار مشتق و بازار سرمایه گذاری می کنند ، بسیار سودمند خواهد بود.

مدل پردازش زبان طبیعی

بقیه مقاله به بخش های زیر تقسیم می شود. بررسی ادبیات ، بخش روش شناسی که در مورد فرآیندهای جمع آوری داده ها ، فرآیند توسعه شاخص احساسات ، تکنیک های NLP و اجرای مدل مطالعه بحث می کند. سپس نتایج و تفسیرهای آنها و سرانجام نتیجه گیری از مطالعه می آید.

بررسی ادبیات

در مراحل اولیه توسعه برای پیش بینی مالی با استفاده از ANN ها ، محقق و متخصصان بر مقایسه مدل های سنتی سری و ANN ها تأکید می کنند تا دقت بهتر در فرآیند پیش بینی را برای یک فوری مشاهده کنید ، به سوانسون و وایت (1997) ، یون و همکاران.(1993) ، Kaastra and Boyd (1996) ، لارنس (1997) و Kryzanowski و همکاران.(1993). ANNس 72 درصد دقت در پیش بینی بازده بورس و همچنین قادر به پیش بینی دقیق بازده مثبت و منفی با آموزش و اعتبارسنجی شبکه های عصبی است (Kryzanowski et al. ، 1993).

در مورد روشهای شبکه های عصبی مصنوعی مربوط به تحقیقات از روشهای مختلفی برای تقلید از شبکه های عصبی مغز انسان استفاده شده است.

تلاش های زیادی برای حل مسئله خطی انجام شده است ، به عنوان مثال ، روش کرنام توسط چانگ و لیو (2008) ، بوچاچیا و بوچاچیا (2008) و فریگولا و راسموسن (2013) استفاده شده است. مدل مبتنی بر یادگیری که قادر به ضبط روابط اساسی غیرخطی نیستند. داده های بازار سهام همیشه از نظر ماهیت تصادفی و پر سر و صدا است ، بنابراین ، LSTM مناسب تر است. به طور معمول ، از مدل های آماری و متاماتیک برای پیش بینی مالی استفاده می شود و این مدل با توجه به مشاهده دست ساز و تراز می شوند و در نتیجه دقت به خطر می افتند (Tsantekidis و همکاران ، 2017). فیشر و کراوس (2018) اظهار داشتند که LSTM در مقایسه با پیش بینی تصادفی ، شبکه عصبی عمیق و طبقه بندی لجستیک عملکرد خوبی دارد. مدل شبکه عصبی مکرر (RNN) به دلیل انعطاف پذیری استفاده و مقابله با مشکل خطی در سری زمانی محبوبیت پیدا کرد (Rumelhart et al. ، 1986 ؛ Werbos ، 1990 ؛ Elman ، 1991).

سیستم خبره مبتنی بر هوش مصنوعی همچنین نیازهای حسابرسی ، بخش بانکی ، مدیریت ریسک اعتباری را تأمین می کند ، اما در کنار آن مزایای بی تطاب یافته ، طرف تاریک این سیستم های خبره پرهزینه است. Omoteso (2012) تجزیه و تحلیل هزینه و سود یک سیستم هوشمند را مطالعه کرده است که می تواند جهت آینده و توسعه نرم افزارها را در این زمینه پیش بینی کند. نتیجه گرفته می شود که در سازمان کوچک و متوسط ممکن است با استفاده از هزینه های سنگین ، از چنین سیستمی برای دستیابی به منافع حاشیه ای مناسب نباشد. اورسکی و همکاران.(2012) از شبکه های عصبی برای کاهش ابعاد داده با مقابله با داده های اضافی و از بین بردن عوامل بی ربط برای افزایش توانایی پیش بینی الگوریتم ژنتیکی استفاده کنید. به همین ترتیب ، لوپز Iturriaga و Sanz (2015) مدل مبتنی بر شبکه عصبی مصنوعی را طراحی کردند که 3 سال قبل از وقوع ورشکستگی ، پریشانی مالی بانک ایالات متحده را پیش بینی کرده است.

به تازگی ، پردازش زبان طبیعی (NLP) به دلیل توانایی خود در گرفتن احساسات و احساس در متن به روش ظریف تر ، به عنوان تکنیک های قدرتمندی برای بسیاری از زمینه ها رشد کرده است. بسیاری از برنامه ها شروع به اتخاذ تکنیک های NLP کرده اند تا کاربران خود را بهتر تجربه کنند (Xing et al. ، 2018). اگرچه دریافت اخبار خارجی با کمک بسیاری از منابع نسبتاً آسان است اما دسترسی و جدا کردن داده ها از طریق صورتهای مالی شرکت دشوار است. بنابراین ، توسعه محتوای اطلاعات از شرکتهای صورتهای مالی خسته کننده و دشوار است. در اینجا اطلاعات به معنای اطلاعات داوطلبانه فاش شده توسط بنگاه است که طبق قانون واجب نیست که برای ذینفعان فاش شود (Xing et al. ، 2018). این مقاله با کمک پایگاه داده ها شامل انواع اطلاعات داخلی خواه به رسانه های خارجی می رسد یا نه و همچنین اخبار و اطلاعات خارجی.< SPAN> اخیراً ، پردازش زبان طبیعی (NLP) به دلیل توانایی آن در گرفتن احساسات و احساس در متن به روش ظریف تر ، به عنوان تکنیک های قدرتمندی برای بسیاری از زمینه ها رشد کرده است. بسیاری از برنامه ها شروع به اتخاذ تکنیک های NLP کرده اند تا کاربران خود را بهتر تجربه کنند (Xing et al. ، 2018). اگرچه دریافت اخبار خارجی با کمک بسیاری از منابع نسبتاً آسان است اما دسترسی و جدا کردن داده ها از طریق صورتهای مالی شرکت دشوار است. بنابراین ، توسعه محتوای اطلاعات از شرکتهای صورتهای مالی خسته کننده و دشوار است. در اینجا اطلاعات به معنای اطلاعات داوطلبانه فاش شده توسط بنگاه است که طبق قانون واجب نیست که برای ذینفعان فاش شود (Xing et al. ، 2018). این مقاله با کمک پایگاه داده ها شامل همه نوع اطلاعات داخلی است که آیا به رسانه های خارجی می رسد یا نه و همچنین اخبار و اطلاعات خارجی. به طور دقیق ، پردازش زبان طبیعی (NLP) به دلیل توانایی آن به عنوان تکنیک های قدرتمندی برای بسیاری از زمینه ها رشد کرده استاحساسات و احساس را به روش ظریف تر وارد کنید. بسیاری از برنامه ها شروع به اتخاذ تکنیک های NLP کرده اند تا کاربران خود را بهتر تجربه کنند (Xing et al. ، 2018). اگرچه دریافت اخبار خارجی با کمک بسیاری از منابع نسبتاً آسان است اما دسترسی و جدا کردن داده ها از طریق صورتهای مالی شرکت دشوار است. بنابراین ، توسعه محتوای اطلاعات از شرکتهای صورتهای مالی خسته کننده و دشوار است. در اینجا اطلاعات به معنای اطلاعات داوطلبانه فاش شده توسط بنگاه است که طبق قانون واجب نیست که برای ذینفعان فاش شود (Xing et al. ، 2018). این مقاله با کمک پایگاه داده ها شامل انواع اطلاعات داخلی خواه به رسانه های خارجی می رسد یا نه و همچنین اخبار و اطلاعات خارجی.

استخراج اطلاعات متنی و مقاله های خبری که ریشه در سال 1934 دارد (بولر ، 1934 ؛ چامسکی ، 1956). دو دهه قبلی مردم به کمک کلمات و فرکانس های متوقف شده ، به کیف رویکرد کلمه توجه زیادی می کردند تا به دنبال احساسات متن باشند. نقطه ضعف این مدل این است که آنها قادر به ضبط متن جمله نیستند. به عنوان مثال ، شرکت A در حال کسب مزیت نسبت به شرکت B است یا شرکت B در حال کسب مزیت در یک دو احساسات مخالف است اما متعلق به همان کیف است. پیشرفت های اخیر مانند ، Word to Vector Repeation ، Word Word و LSTM این مشکلات را به خوبی مورد بررسی قرار داده است. تجزیه و تحلیل احساسات پدیده های بسیار مهمی برای بازار سهام و پیش بینی مالی است (پوریا و همکاران ، 2016). با استفاده بیشتر از استانداردهای Web. 2. 0 (Cooke & Buckley ، 2008) کاربران دسترسی آسان و راه هایی برای به اشتراک گذاری اطلاعات در سیستم عامل مانند فیس بوک ، توییتر و غیره دارند ، بنابراین احساسات بازار برای بازار مالی اهمیت می یابد. مشاغلی که در محصولات و خدمات مالی فعالیت می کنند و رویکرد خود را تغییر می دهند تا برنامه خود را آگاه تر و پیشرفته تر کند تا بتواند رقابتی رقابتی نسبت به رقبا کسب کند. تکنیک های NEW NLP آنها را برای لبه مورد نیاز خود قول می دهند. تکنیک احساسات موجود را می توان به طور گسترده ای به سه حوزه طبقه بندی کرد. یعنی رویکرد ترکیبی ، دانش و دانش آماری (پوریا و همکاران ، 2017). تجزیه و تحلیل احساسات مبتنی بر دانش مبتنی بر لیست کلمات و فرکانس های آن- یک رویکرد نسبتاً قدیمی است که متن را به دسته های مختلف طبقه بندی می کند و سپس فرکانس ها را با واژگان مقایسه می کند. دوم روش آماری است ، این رویکرد نه تنها در لیست کلمات متمرکز است بلکه از مدل آماری نیز برای طبقه بندی متن با کمک احتمالات استفاده می کند. دسته سوم ترکیبی از این دو لنات است (لنات و همکاران ، 1990 ؛ لیو و سینگ ، 2004 ؛ فلباوم ، 1998). در این مطالعه از رویکرد ترکیبی با کمک تکنیک های مدرن NLP موجود استفاده شده است که از محیط های زبانهای برنامه نویسی نیز پشتیبانی می کند.

روش شناسی

داده های پیش پردازش

در این بخش خلاصه ای از رویکردها و روشهایی که برای پردازش داده ها از متن خام به داده های قابل خواندن با دستگاه استفاده شده است. پیش پردازش داده ها به چهار بخش اصلی تقسیم شده است ، یعنی ؛بازده سهام ساعتی ، پیش پردازش تجزیه و تحلیل اخبار ، طبقه بندی کننده ساده لوح Bayes و توسعه شاخص احساسات. هر سه بخش عکس فوری از پیش پردازش داده ها را نشان می دهد. بیایید به طور خلاصه یک به یک را شرح دهیم.

داده های سهام ساعتی

بازده سهام ساعتی با کمک افتتاح و بسته شدن قیمت هر 10 شرکت محاسبه می شود. داده های سهام ساعتی از پورتال داده Thoumson به دست می آید. فرمول ساده برای محاسبه بازده سهام به شرح زیر است:

در حالی که (r_ ) (j_ ) سهام در ساعت (i_ ) ساعت است ، (بسته شدن_ ) در حال بسته شدن قیمت سهام (j_ ) در ساعت (i_ ) است ، باز کردن IJ قیمت باز است (j_ ) سهام در ساعت (i_ ).

پردازش تحلیلی اخبار

منابع زیادی وجود دارد که از طریق آن اطلاعات در بورس اوراق بهادار مربوط به یک سهام خاص جریان می یابد. منابع اخبار و اطلاعاتی که در این مقاله مورد استفاده قرار گرفته اند عبارتند از: رسانه های اصلی ، رسانه های چاپی ، فیدهای اخبار رسانه های اجتماعی ، وبلاگ ها ، درگاه های مشاوره سرمایه گذاران ، نظرات کارشناسان ، به روزرسانی کارگزاران ، اطلاعات مبتنی بر وب ، اخبار داخلی شرکت و اعلامیه های عمومی در موردسیاست ها و اصلاحات. ما اخبار را از یک پایگاه داده بسیار شناخته شده و قابل اعتماد ، نامگذاری کرده ایم. تامسون برمی گردد. با استفاده از API تامسون رویترز ، اگر این داستان ها مربوط به هر یک از ده سهام باشد که ما برای تجزیه و تحلیل انتخاب کرده ایم ، توانستیم داستان های جدیدی را جمع آوری کنیم. دلیل انتخاب سهام فردی به جای بورس اوراق بهادار است ؛بورس سهام به اطلاعات سطح جمعی جذب می شود و واکنش نشان می دهد و بنابراین ، به طور خاص اطلاعات سطح رویداد از هم جدا می شوند. هر خبری با توجه به GMT و دقیق در سطح میلی ثانیه ، زمانبندی خود را دارد. چارچوب زمانی برای جمع آوری اخبار 10 سال است ، بنابراین ، جمع آوری هر خبری منجر به داشتن متن متن بسیار بزرگ می شود. جدول زمانی برای اخبار کاملاً با زمان افتتاح و بسته شدن بورس اوراق بهادار مطابقت دارد. اگرچه ، ما از اطلاعات خبری کامل جمع آوری شده در خارج از پنجره باز و بسته شدن بورس اوراق بهادار استفاده زیادی کرده ایم. با این حال ، لازم بود تا تأثیر تجزیه و تحلیل اخبار در حرکت قیمت سهام را ارزیابی کنیم.

طبقه بندی کننده ساده لوح

پس از استخراج متن خام در مورد اخبار از منابع ، متن به روشی که می توان از آن در مدل طبقه بندی Navie Bayes استفاده کرد ، تصفیه می شود. در اصل متن به شکل "HTML" با اطلاعات غیر ضروری زیادی بود ، اما با کمک تجزیه و تحلیل و برخی از خطوط برنامه نویسی ، متن مبتنی بر HTML "تصفیه شده و به شکل" LXML "فیلتر می شود."XML" شکل متن به طور دقیق و به سرعت توسط دستگاه ها قابل خواندن است. از مدل طبقه بندی ساده لوح برای محاسبه احساسات خارج از متن اخبار استفاده شده است. شکل 1 نشان می دهد که چگونه اطلاعات مربوط به منابع خام به نمره احساسات فیلت می کنند. ستون سمت چپ نمودار نشان می دهد که متن خام ، که شامل اطلاعات "HTML" در آن است. اولین قدم تقسیم جملات کامل در لیستی از کلمات منحصر به فرد است ، این روند به نام Tokenizing نامیده می شود. بعد می آید ، ایجاد یک فیلتر از کلمات متوقف ، این کلمات متوقف بیشتر مربوط به ضمایر هستند. در مرحله بعدی ، متن از لینک ها و اطلاعات غیر ضروری فیلتر می شود. در مرحله بعدی ، Lemmatization برای پرداختن به اشتباهات املایی اعمال می شود. لیست همه کلمات با بخشی از گفتار برچسب گذاری شده است. سپس ، داده ها برای دیدن هرگونه افزونگی کمی تصفیه شده است. به عنوان یک مرحله بعدی ، با کمک پایگاه داده NLTK که در حال حاضر در دسترس است ، هر کلمه با برچسب های منفی یا مثبت اختصاص داده شده است. در دو مرحله بعدی داده ها برای مجموعه داده های آزمایش و قطار آماده شده است - آماده تغذیه به مدل "ساده لوح" برای آموزش. پس از اتمام روند آموزش ، هر جمله برای بدست آوردن نمرات احساسات از آن آزمایش می شود. نتیجه مدل NLP در ساخت شاخص احساسات و داده های LSTM در مراحل بعدی استفاده می شود.<x08egin +1&<>شاخص احساسات<>متغیرهای زیر هنگام ساختن شاخص احساسات در نظر گرفته می شوند: "پنجره زمان احساسات" ، "ارزش نمره" ، "کلاس نمره احساسات" ، "اهمیت" نمره به سمت سهام زیربنایی. پنجره زمان به این معنی است که چند بار اخبار/اطلاعات ، مربوط به سهام انتخاب شده در مدت زمان 1 ساعت ظاهر می شود. منطق نگه داشتن پنجره زمان تا 1 ساعت این است که بورس اوراق بهادار برای جذب اطلاعات مربوط به سهام فردی به کمی زمان نیاز دارد. ثانیا ، تجزیه و تحلیل سطح دقیقه خیلی زود است و تجزیه و تحلیل سطح روز خیلی دیر است. عامل بعدی "ارزش نمره" است. مقدار درد نتیجه یک مدل NLP آموزش دیده است ، این روند در شکل 1 آورده شده است. مقادیر نمره احساسات بر اساس نمرات آنها به سه دسته طبقه بندی می شوند. مثبت ، منفی و خنثی. تمام نمره منفی دارای علائم منفی است و احساسات عصبی برابر با صفر است. نمرات برای هر سه نوع کلاس از 0 تا 1 است. بنابراین "مقدار نمره" در طول پنجره 1 ساعت خلاصه می شود ، اگر مجموع نمره منفی و بیشتر از 0. 10 باشد ، به عنوان نمره منفی برچسب گذاری می شود، اگر مبلغ بین 0. 10 و 0. 10 باشد ، به عنوان نمره عصبی در نظر گرفته می شود و از 0. 10 تا 0. 90 ، "مقدار نمره" مثبت است. در مرحله بعد ، نتیجه نمره احساسات سرانجام با توجه به امتیاز "اهمیت" متغیر برای وزن گیری با توجه به نمره ارتباط آن ضرب می شود."نمره ارتباط" تعداد درصد ، محاسبه شده است. تعداد دفعات خبرنامه ، نام سهام تقسیم شده با تعداد کل کلمات موجود در خبر را ذکر کرده است. بیان ریاضی شاخص احساسات مانند:<>در حالی که من = ویندوزهای زمان برای هر (i_ ) و (j_ ) سهام. (e = max big (pos_ ، neg_ ، neut_ big) وجود دارد ) ، (c_ = سمت چپ

argmax big (pos_ ، neg_ ، neut_ big) = 1 \ 0 &

$$x08egin P ( mathbf argmax big (pos_ ، neg_ ، neut_ big) = 3 \ -1 &argmax big (pos_ ، neg_ ، neut_ big) = 2 \ end درست.) (r_ = ارتباط ).<1>در حالی که (w_ ) یک کلاس خاص (به عنوان مثال منفی یا مثبت) است و (x_ ) یک ویژگی خاص است ، (p (x_ | w_) ) نامیده می شود خلفی یا در کلمه دیگر احتمال ویژگی (x_ ) متعلق به کلاس (w_ ) ، (p (w _) ) احتمال کلاس خود با توجه به نمونه کل است که همچنین به آن قبلی و در آخر گفته می شود ، (p (x _) ) به عنوان احتمال حاشیه ای نامیده می شود یاشواهد و مدارک. براساس قضیه بیز فوقانی ، احتمال کلاس مشروط معادله را می توان به شرح زیر محاسبه کرد:| امگا _<2>در حالی که (w_ ) یک کلاس خاص (به عنوان مثال منفی یا مثبت) است و (x_ ) یک ویژگی خاص است ، (p (x_ | w_) ) نامیده می شود خلفی یا در کلمه دیگر احتمال ویژگی (x_ ) متعلق به کلاس (w_ ) ، (p (w _) ) احتمال کلاس خود با توجه به نمونه کل است که همچنین به آن قبلی و در آخر گفته می شود ، (p (x _) ) به عنوان احتمال حاشیه ای نامیده می شود یاشواهد و مدارک. براساس قضیه بیز فوقانی ، احتمال کلاس مشروط معادله را می توان به شرح زیر محاسبه کرد:| امگا _در حالی که (w_ ) یک کلاس خاص (به عنوان مثال منفی یا مثبت) است و (x_ ) یک ویژگی خاص است ، (p (x_ | w_) ) نامیده می شود خلفی یا در کلمه دیگر احتمال ویژگی (x_ ) متعلق به کلاس (w_ ) ، (p (w _) ) احتمال کلاس خود با توجه به نمونه کل است که همچنین به آن قبلی و در آخر گفته می شود ، (p (x _) ) به عنوان احتمال حاشیه ای نامیده می شود یاشواهد و مدارک. براساس قضیه بیز فوقانی ، احتمال کلاس مشروط معادله را می توان به شرح زیر محاسبه کرد: ight) end$$

| امگا _

راست) cdot cdots cdot p سمت چپ (x _

| امگا _

احتمالات خلفی را می توان با بیان زیر محاسبه کرد:

بنابراین ، احتمال کلاس را می توان با این عبارت محاسبه کرد:

معادله مدل

مدلهای مبتنی بر هوش مصنوعی تقریباً در همه حوزه های زندگی و حوزه اقتصاد و امور مالی از اهمیت و کارآیی خود اثبات کرده اند. مدل ما می تواند به روشهای مختلفی از آنها استفاده شود. به عنوان مثال ، سیستم های خبره تجارت آنلاین مجبور به ادغام راه های پیشرفته برای روند پیش بینی می شوند. مدل فعلی می تواند به طور خاص برای سیستم معاملاتی بسیار مهم باشد تا روند پیش بینی را تغییر شکل دهد و تلاش برای سازماندهی و جستجوی اطلاعات مربوط به بازار را از طریق میلیون ها سوابق متنی با تلاش انسانی یا رویکردهای سنتی فیلتر متن کاهش دهد. این مدل در حال حاضر از تکنیک های پیشرفته NLP استفاده می کند تا اطلاعات بازار مبتنی بر احساساتی را در مدل قرار دهد. به عنوان مثال ، ساختن شاخص مربوط به اطلاعات بسیار مهم است. این نکته را در معرض دید خود نگه دارید ، ما یک شاخص احساساتی سفارشی ایجاد کرده ایم که اطلاعات بازار را در یک دقیقه جمع آوری می کند و آن را برای یک پنجره 1 ساعته جمع می کند. از یک طرف ، این مدل LSMT را قادر می سازد تا دقت سطح بالایی را ضبط کند و از طرف دیگر ، بر محدودیت تکیه به اطلاعات روزانه مبتنی بر بازار غلبه می کند. بسیاری از مدل های سنتی وجود دارد که سعی می کنند با استفاده از داده های اقتصادی ، یعنی رگرسیون ساده ، میانگین حرکت و مدلهای مبتنی بر خودجوش ، به پیش بینی دقیق دست یابند (نگاه کنید به: آرما ، Arima ، Arch Garch) ، رگرسیون ساده و یک دسته دیگر از مدل های پیش بینی سری دیگر. مشکل جهانی برای همه این مدلها محدودیت برای رسیدگی به فرض توزیع خطی ، رسیدگی به تاخیر طولانی گذشته و معیارهای بسیار دقیق ساختار داده است. این محدودیت ها از نظر کارآیی و دقت با سازش های زیادی همراه است. مدل مبتنی بر شبکه عصبی مصنوعی و به طور خاص ، LSTM در رسیدگی به وابستگی های طولانی مدت بسیار خوب است ، یعنی می توانید بدون از دست دادن اطلاعاتی که در اختیار دارد ، داده های گذشته را ردیابی کنید. علاوه بر این ، با کمک توابع مختلف فعال سازی و رویکردهای خاص مدل به طور انعطاف پذیر کار می کند بدون اینکه فرضیات زیادی را تنظیم کنیم ، اجازه می دهیم نحوه عملکرد این مدل را توضیح دهیم.

مدل فعلی براساس انتشارات علمی اصلی ساخته شده توسط Hochreiter و Schmidhuber (1997) است. این تحقیق به دلیل توانایی کار بر روی وابستگی های طولانی مدت و توانایی به خاطر سپردن اطلاعات مهم در مراحل قبلی توسط جامعه تحقیقاتی بسیار مورد توجه قرار می گیرد. مواردی که وابستگی به اطلاعات اهمیتی چندانی ندارد ، مدل های شبکه عصبی ساده خوب کار می کنند ، اما این یک وضعیت ایده آل در دنیای تجارت عملی نیست. پیش بینی بازار سهام ، پردازش زبان طبیعی ، تجزیه و تحلیل احساساتی و ترجمه زبان نمونه ای است که در آن اطلاعات مدل بسیار وابسته است و زمینه بسیار مهم است بنابراین مدل شبکه عصبی مکرر گزینه های خوبی از شبکه های عصبی ساده است. در اینجا توضیحات کوتاهی در مورد چگونگی نصب مدل این مطالعه آورده شده است.

عملکرد حالت پنهان را می توان به روش زیر نوشت:

بنابراین ، حالت پنهان مدل LSTM با کمک معادله زیر نوشته شده است.

ماتریس وزن ابتدا با ورودی فعلی ضرب می شود. مراحل زمان مخفی یک به یک با ماتریس وزن برای حالت پنهان ضرب می شوند. سرانجام ، TANH پس از افزودن هر دو ، ورودی فعلی و مراحل زمانی قبلی پنهان ، در نتیجه اعمال شده است. اکنون لایه خروجی مدل LSTM مانند موارد زیر است:

در حالی که W ماتریس وزن برای لایه خروجی است و (H_ ) ما در Eq محاسبه کرده ایم. 5

معادلات 5 و 6 به سادگی نشان می دهد که چگونه لایه های مخفی و خروجی مدل LSTM فرموله شده است اما این فرمول تفاوت چندانی با مدل های شبکه عصبی ساده ندارد. راز واقعی مدل LSTM در روش منحصر به فرد خود برای توسعه سلول و حالت حافظه با کمک مکانیسم دروازه قرار دارد.

سیگنالینگ و دروازه

دروازه ها اساساً شبکه های تغذیه ای کاملاً متصل هستند که اطلاعات را دریافت می کنند ، توابع را اعمال می کنند ، معمولاً توابع فعال سازی سیگموئید و عملیات عاقلانه انجام می دهند و سپس خروجی ها را باز می گردانند. بنابراین ، ما در اینجا از عملکرد فعال سازی سیگموئید استفاده کرده ایم که بین دامنه 0 تا 1 می رسد. بنابراین ، تمام مقادیر خروجی نزدیک به 0 بی اهمیت در نظر گرفته می شوند و سلول آنها را حذف می کند ، از طرف دیگر ، تمام اطلاعات نزدیک به 1 استبرای فرآیند پیش بینی مهم است و بنابراین در حالت سلول به روز می شود. در این بخش توضیح خواهیم داد که چگونه سیگنال ها و دروازه های کار LSTM. همه اطلاعات موجود در حالت سلولی برای دانستن فرآیند پیش بینی و سرریز اطلاعات غیر ضروری به معنای عدم اطلاعات مهم نیست. در درجه اول سه دروازه LSTM وجود دارد ، یعنی: دروازه ، دروازه های ورودی و دروازه خروجی را فراموش کنید.

گیتس را فراموش کنید

GATE اطلاعاتی را از ورودی فعلی و ورودی لایه پنهان قبلی دریافت می کند ، عملکرد سیگموئید را روی این شماره اعمال می کند و آن را با حالت سلول قبلی ضرب می کند. این تصمیم می گیرد که آیا ما می خواهیم اطلاعات در حالت سلول قبلی با توجه به اطلاعات جدید و (T-1 ) اطلاعات در حالت (C_ ) داشته باشیم. معادله ریاضی گیت فراموش شده در زیر است:

Similar to input gate new candidate is multiplication of hidden state’s current input with weighted matrix of new candidate denoted with symbol ( ilde>) with combination of (i_) new candidate will decide with how much information model wants to write on new cell state. Mathematical equation of ( ilde>دروازه ورودی

این بخش دوم فرآیند سیگنالینگ است. در بخش اول ، ما تصمیم گرفته ایم که وضعیت سلول قبلی واردات برای نگه داشتن یا خیر باشد. اکنون زمان آن رسیده است که اطلاعات ضروری جدید را در مورد Cell State ذخیره کنیم ، که بعداً با فراموش کردن دروازه با توجه به اهمیت آن برای فرایند یادگیری مدل ، دوباره مورد قضاوت قرار می گیرد. دروازه ورودی ضرب از حالت پنهان T - 1 و ورودی T توسط ماتریس وزن ورودی است که بعداً در نامزد جدید ادغام می شود. عملکرد فعال سازی دروازه ورودی سیگموئید است. معادله ریاضی (i_ ) به شرح زیر است:

نامزد جدید

) مانند:

اکنون Cell Sate با کمک دروازه ورودی به روز می شود و نامزد جدید معادله به شرح زیر است:

لایه خروجی ضرب ماتریس وزن لایه خروجی توسط حالت پنهان و ورودی فعلی است.

سرانجام خروجی (H_ ) محصول لایه خروجی است و حالت پنهان و بیان ریاضی (H_ ) به شرح زیر است:

مدل بهینه سازی

به عنوان یک عملکرد بهینه سازی مدل نزول شیب تصادفی (SGD) در این مطالعه استفاده شده است. همانطور که قرار نیست مدل ما خطی باشد ، بنابراین شیب خطای غیر لاینر بین دو نقطه را می توان با کمک مشتق مانند زیر محاسبه کرد:

هزینه مدل همیشه نتیجه عملکرد خاص است. در مدل مدل ما تفاوت بین قیمت واقعی نهاد - قیمت پیش بینی شده از نهاد و بر اساس میانگین خطاهای مربع است. دو پارامتر اصلی وجود دارد که برای رسیدن به حداقل سطح خطای جهانی باید تنظیم شوند.

همانطور که در عملکرد هزینه ما وجود دارد ، دو پارامتر درگیر هستند ، یعنی ( alpha ) و ( beta ). از آنجا که دو پارامتر وجود دارد ، ما به اشتقاق جزئی نیاز داریم ( Delta ).

در جهت شیب می توانیم تمام مشتقات جزئی ممکن را محاسبه کنیم و آنها را بر روی یک بردار نقشه کنیم و می توان آن را بردار شیب نامید. بیان ریاضی مانند موارد زیر است:< ext> ( theta ) نکته ای برای شیب برای دستیابی به حداقل جهانی و ( دلتا f ) در عملکرد به دلیل تغییر در شیب است. بنابراین ، از این طریق ، ما می توانیم یک وکتور از همه مشتقات جزئی ممکن را برای پایین آمدن به هیل درست کنیم.< ext>بنابراین ، قانون به روزرسانی نزول شیب مانند موارد زیر است:< heta>در حالی که ( تتا _

) پارامتر به روز شده ( theta _

) پارامتر قدیمی است-"علامت به این معنی است که ما می خواهیم به سمت پایین برویم ( eta ) اندازه مرحله ای است که مدل باید خط شیب را برای پایین آمدن از تپه بگیرد ، ( nabla _

) با توجه به پارامترها شیب دارد.

rms prop

برای سرعت بخشیدن به یادگیری مدل و کاهش خطا ، از الگوریتم RSMProp در مدل استفاده شده است. ایده این ALGO این است که شیب مناسب را به دو بخش تقسیم کنید ، یک گرادیان که در عمودی و شیب هایی حرکت می کند که در یک جهت افقی حرکت می کند. حرکت عمودی نوسان نامیده می شود که برای کاهش خطا بسیار مفید نیست. بنابراین ، این الگوریتم برای دستیابی به حداقل جهانی بر حرکت افقی تمرکز دارد.

figure 2

در حالی که (S_ ) در جهت افقی شیب دارد و (S_ ) در جهت عمودی شیب دارد. ( alpha ) نرخ یادگیری است و ( beta ) به سادگی پارامتر برای حرکت متوسط است که برای (s_ ) و (s_ ) جداگانه است. در حالی که ، ((S _)^2 ) مربع شیب گذشته. ( varepsilon ) برای جلوگیری از تقسیم صفر از ارزش بسیار کمی است. میانگین متوسط در این آلگو مؤثر است زیرا وزن بیشتری را به مقدار جریان شیب و وزن کمتری به مربع شیب گذشته می دهد.

شماتیک کلی مدل مطالعه به شرح زیر است.

اکنون ، بخش بعدی را شروع خواهیم کرد که نتایج مدل خود را توصیف کرده ایم (شکل 2).

فارکس وکسب درامد...
ما را در سایت فارکس وکسب درامد دنبال می کنید

برچسب : نویسنده : آرش اصل زاد بازدید : <-PostHit-> تاريخ : دوشنبه 25 ارديبهشت 1402 ساعت: 16:11