آمار در پزشکی برای توضیحات داده و استنباط استفاده می شود. از آمار استنباطی برای پاسخ به سؤالات مربوط به داده ها ، برای آزمایش فرضیه ها (تدوین فرضیه های جایگزین یا تهی) ، برای تولید یک اندازه گیری اثر ، به طور معمول نسبت نرخ یا خطرات ، برای توصیف ارتباطات (همبستگی) یا مدل سازی روابط (رگرسیون استفاده می شود.) در داخل داده ها و در بسیاری از کارکردهای دیگر. معمولاً برآوردهای نقطه اقدامات مربوط به ارتباطات یا بزرگی اثرات است. اشتباهات ، خطاهای اندازه گیری ، تعصب انتخاب و خطاهای تصادفی بعید به نظر می رسد که تخمین نقطه برای برابر با موارد واقعی باشد. در فرآیند تخمین ، خطای تصادفی قابل اجتناب نیست. یکی از راه های حساب برای محاسبه مقادیر p برای طیف وسیعی از مقادیر پارامتر ممکن (از جمله تهی) است. دامنه مقادیر ، که ارزش آن از سطح آلفا مشخص شده (به طور معمول 0. 05) فاصله دارد ، فاصله اطمینان نامیده می شود. یک روش تخمین فاصله ، در 95 ٪ از تکرارها (مطالعات یکسان از همه جهات به جز خطای تصادفی) ، محدودیتی را تولید می کند که حاوی پارامترهای واقعی است. استدلال می شود که اگر جفت محدودیت های تولید شده از یک مطالعه شامل پارامتر واقعی باشد ، نمی توان با نظریه معمولی (مکرر) فواصل اطمینان 1 پاسخ داد. رویکردهای مکرر با استفاده از احتمالات داده (یا مقادیر p یا احتمال) به عنوان اقدامات سازگاری بین داده ها و فرضیه ها ، یا به عنوان اقدامات پشتیبانی نسبی که داده ها فرضیه ها را ارائه می دهند ، تخمین می زنند. رویکرد دیگر ، بیزی ، از داده ها برای بهبود برآوردهای موجود (قبلی) با توجه به داده های جدید استفاده می کند. استفاده صحیح از هر رویکرد مستلزم تفسیر دقیق آمار 1 ، 2 است.
هدف در هر تحلیل داده استخراج تخمین دقیق از اطلاعات خام است. یکی از مهم ترین و متداول ترین سؤالات این است که آیا بین متغیر پاسخ (Y) و متغیرهای توضیحی (Xi) رابطه آماری وجود دارد یا خیر. گزینه ای برای پاسخ به این سوال استفاده از تحلیل رگرسیون به منظور مدل سازی رابطه آن است. انواع مختلفی از تحلیل رگرسیون وجود دارد. نوع مدل رگرسیون به نوع توزیع Y بستگی دارد. اگر پیوسته و تقریباً نرمال باشد از مدل رگرسیون خطی استفاده می کنیم. اگر دوگانه باشد، از رگرسیون لجستیک استفاده می کنیم. اگر پواسون یا چندجمله ای از تحلیل لگ خطی استفاده می کنیم. اگر داده های زمان تا رویداد در حضور موارد سانسور شده (نوع بقا) از رگرسیون کاکس به عنوان روشی برای مدل سازی استفاده می کنیم. با مدل سازی سعی می کنیم نتیجه (Y) را بر اساس مقادیر مجموعه ای از متغیرهای پیش بینی کننده (Xi) پیش بینی کنیم. این روش ها به ما اجازه می دهند تا تأثیر متغیرهای متعدد (متغیرهای کمکی و عوامل) را در یک مدل 3، 4 ارزیابی کنیم.
در این مقاله بر روی رگرسیون خطی تمرکز می کنیم. رگرسیون خطی روشی است که ضرایب معادله خطی را تخمین می زند که شامل یک یا چند متغیر مستقل است که به بهترین وجه مقدار متغیر وابسته را که باید کمی باشد، پیش بینی می کند. رگرسیون لجستیک شبیه به رگرسیون خطی است اما برای مدل هایی مناسب است که متغیر وابسته دوگانه است. از ضرایب رگرسیون لجستیک می توان برای تخمین نسبت شانس برای هر یک از متغیرهای مستقل در مدل استفاده کرد.
معادله خطی
در اکثر بسته های آماری ، یک روش تخمین منحنی آمار رگرسیون تخمین منحنی و توطئه های مرتبط را برای بسیاری از مدلهای مختلف تولید می کند (خطی ، لگاریتمی ، معکوس ، درجه دوم ، مکعب ، قدرت ، S-Curve ، Litistic ، نمایی و غیره). ترسیم داده ها به منظور تعیین اینکه کدام مدل برای هر متغیر متبحر استفاده می شود ، ضروری است. اگر به نظر می رسد متغیرها به صورت خطی مرتبط هستند ، می توان از یک مدل رگرسیون خطی ساده استفاده کرد اما در صورتی که متغیرها به صورت خطی مرتبط نباشند ، ممکن است تبدیل داده ها کمک کند. اگر تحول کمکی نکند ، ممکن است یک مدل پیچیده تر مورد نیاز باشد. به شدت توصیه می شود که یک پراکندگی اولیه از داده های خود را مشاهده کنید. اگر طرح شبیه به یک عملکرد ریاضی است که شما تشخیص می دهید ، داده ها را با آن نوع مدل قرار دهید. به عنوان مثال ، اگر داده ها شبیه به یک عملکرد نمایی باشند ، از یک مدل نمایی استفاده می شود. از طرف دیگر ، اگر مشخص نیست کدام مدل به بهترین وجه داده می شود ، گزینه ای است که چندین مدل را امتحان کرده و بین آنها انتخاب کنید. به منظور تعیین چگونگی ارتباط متغیرهای مستقل و وابسته (به صورت خطی ، نمایی و غیره) 4 - 6 به شدت توصیه می شود که داده ها را به صورت گرافیکی (به عنوان مثال توسط یک پراکنده) غربالگری کنید.
مناسب ترین مدل می تواند یک خط مستقیم ، یک چند جمله ای درجه بالاتر ، یک لگاریتمی یا نمایی باشد. استراتژی های یافتن یک مدل مناسب شامل روش رو به جلو است که در آن با فرض مدل بسیار ساده یعنی یک خط مستقیم (y = a + bx یا y = b شروع می کنیم.0 + b1ایکس ). سپس بهترین تخمین مدل فرضی را می یابیم. اگر این مدل متناسب با داده ها رضایت بخش نباشد ، ما یک مدل پیچیده تر را به عنوان مثال فرض می کنیم. چند جمله ای درجه 2 (y = a+bx+cx 2) و غیره. در یک روش عقب مانده ، ما یک مدل پیچیده را به عنوان مثال فرض می کنیم. چند جمله ای درجه بالا ، ما مدل را متناسب می کنیم و سعی می کنیم آن را ساده کنیم. ما همچنین ممکن است از مدلی که توسط تئوری یا تجربه پیشنهاد شده است استفاده کنیم. غالباً یک رابطه خط مستقیم متناسب با داده ها رضایت بخش است و این مورد رگرسیون خطی ساده است. ساده ترین مورد تجزیه و تحلیل رگرسیون خطی این است که با یک متغیر پیش بینی کننده 6 ، 7.
معادله رگرسیون خطی
هدف از رگرسیون پیش بینی Y بر اساس x یا توصیف چگونگی بستگی به x (خط رگرسیون یا منحنی) است

XI (x1, X2, , Xk) به عنوان متغیر "پیش بینی کننده" ، "توضیحی" یا "مستقل" تعریف می شود ، در حالی که y به عنوان متغیر "وابسته" ، "پاسخ" یا "نتیجه" تعریف می شود.
با فرض رابطه خطی در جمعیت ، میانگین Y برای x برابر با α+βx یعنی "خط رگرسیون جمعیت" برابر است.
اگر y = a + bx خط تخمین زده شده باشد ، سپس نصب شده است
ŷi = a + bxi مقدار متناسب (یا پیش بینی شده) نامیده می شود ، و yi ŷi باقیمانده نامیده می شود.
خط رگرسیون تخمین زده شده به گونه ای تعیین می شود که (باقیمانده) 2 حداقل به عنوان مثال انحراف استاندارد باقیمانده ها به حداقل می رسد (باقیمانده ها به طور متوسط صفر هستند). این روش "حداقل مربعات" نامیده می شود. در معادله

B شیب است (میانگین افزایش نتیجه در واحد افزایش پیش بینی کننده)
A رهگیری است (اغلب معنای عملی مستقیم ندارد)
خط معادله رگرسیون دقیق تر (دقت بالاتر از تخمین های A و B) نیز می تواند به عنوان نوشته شود

استنباط بیشتر در مورد خط رگرسیون می تواند با برآورد فاصله اطمینان (95 ٪ CI برای شیب B) انجام شود. محاسبه بر اساس خطای استاندارد B است:

بنابراین ، 95 ٪ CI برای β B ± T0. 975*SE (B) است [T-Distr. با df = n-2]
و آزمون برای H0: β = 0 ، t = b / se (b) است [p-value مشتق شده از t-dister. با df = n-2].
اگر مقدار p بالاتر از 0. 05 باشد ، فرضیه تهی رد نمی شود ، به این معنی که یک مدل خط مستقیم در x به پیش بینی Y کمک نمی کند. این احتمال وجود دارد که مدل خط مستقیم نگه داشته شود (شیب = 0) یا یک رابطه منحنی وجود داردبا مؤلفه خطی صفر. از طرف دیگر ، اگر فرضیه تهی یا مدل خط مستقیم یا در یک رابطه منحنی رد شود ، مدل خط مستقیم کمک می کند ، اما بهترین مدل نیست. البته امکان خطای نوع II یا نوع I به ترتیب در گزینه اول و دوم وجود دارد. انحراف استاندارد باقیمانده (σسر) توسط تخمین زده می شود

انحراف استاندارد باقیمانده (σسر) تنوع اطراف خط رگرسیون را توصیف می کند ، یعنی σ کوچکترسر، تناسب بهتردارای درجه ای از آزادی است. این عدد برای تقسیم به منظور تخمین بی طرفانه از واریانس است. در این حالت df = n-2 ، زیرا دو پارامتر ، α و β ، 7 تخمین زده می شوند.
تجزیه و تحلیل رگرسیون خطی چندگانه
به عنوان نمونه در نمونه ای از 50 نفر که اندازه گیری کردیم: y = غلظت قرار گرفتن در معرض شخصی تولوئن (هیدروکربن معطر گسترده). x1 = ساعت های صرف شده در خارج از منزل ؛x2 = سرعت باد (m/sec) ؛x3 = سطح خانه تولوئن. y متغیر پاسخ مداوم ("وابسته") است در حالی که x1 ، x2 ، xp به عنوان متغیرهای پیش بینی کننده ("مستقل") [7]. معمولاً سؤالات مورد علاقه این است که چگونه می توان Y را بر اساس X پیش بینی کرد و تأثیر "مستقل" سرعت باد ، یعنی اصلاح شده برای سطح خانه و سایر متغیرهای مرتبط چیست؟این سؤالات در اصل می تواند با تجزیه و تحلیل رگرسیون خطی متعدد پاسخ داده شود.
در مدل رگرسیون خطی چندگانه ، Y توزیع طبیعی با میانگین دارد

پارامترهای مدل β0 + β1 + +βρو σ باید از داده ها تخمین زده شود.
β1 βρ= ضرایب رگرسیون
σ = σسر= انحراف استاندارد باقیمانده
تفسیر ضرایب رگرسیون
در معادله y = β0 + β11+ + βρxρ
β1برابر است با میانگین افزایش Y در واحد افزایش در XI ، در حالی که سایر XI ثابت نگه داشته می شوند. به عبارت دیگر ، βi تأثیر XI اصلاح شده (تنظیم شده) برای سایر X است. روش تخمین از کمترین معیار مربع پیروی می کند.
اگر ب0, b1، ، Bρ تخمین β است0, β1، ، βρ سپس مقدار "متناسب" y است


B0 ، B1 ،.، B به گونه ای محاسبه می شود که حداقل باشد. از آنجا که y - yfit به عنوان باقیمانده نامیده می شود. همچنین می توان گفت که مجموع باقیمانده های مربع به حداقل می رسد.
در مثال ما ، بسته های آماری تخمین ها یا ضرایب رگرسیون (BI) و خطاهای استاندارد (SE) را برای سطح قرار گرفتن در معرض شخصی تولوئن ارائه می دهند.

سپس معادله رگرسیون برای سطح قرار گرفتن در معرض شخصی تولوئن:

ضریب تخمین زده شده برای زمان صرف شده در خارج از منزل (0. 582) به این معنی است که افزایش میانگین تخمین زده شده در سطح شخصی تولوئن 0. 582 گرم در متر 3 است اگر زمان در خارج از منزل 1 ساعت افزایش یابد ، در حالی که سطح خانه و سرعت باد ثابت است. به طور دقیق تر می توان گفت افراد با یک ساعت در زمان صرف شده در خارج از منزل متفاوت هستند ، اما داشتن همان مقادیر در پیش بینی کننده های دیگر ، تفاوت متوسط در سطح xPosure تولوئن برابر با 0. 582 میکروگرم بر متر 3 8 خواهد داشت.
توجه داشته باشید که این تفسیر به معنای رابطه علّی نیست.
فاصله اطمینان (CI) و آزمون ضرایب رگرسیون
95 ٪ CI برای I توسط BI ± T0. 975*SE (BI) برای DF = N-1-P (DF: درجه آزادی) داده می شود
در مثال ما این بدان معنی است که CI 95 ٪ برای ضریب زمان صرف شده در خارج از منزل 95 ٪ CI است: - 0. 19 تا 0. 49

همانطور که در مثال اگر رطوبت H0: β = 0 را آزمایش کنیم و P = 0. 40 را پیدا کنیم ، که معنی دار نیست ، فرض کردیم که ارتباط بین قرار گرفتن در معرض شخصی تولوئن و رطوبت می تواند با همبستگی بین رطوبت و سرعت باد 8 توضیح داده شود.
به منظور برآورد انحراف استاندارد باقیمانده (YFIT) ، یعنی انحراف معیار تخمین زده شده از مجموعه ای از مقادیر متغیر در یک نمونه جمعیت ، باید تخمین بزنیم σ

تعداد درجه آزادی df = n (p + 1) است ، زیرا پارامترهای P + 1 تخمین زده می شود.
جدول ANOVA تنوع کل در Y را نشان می دهد که به دلیل رگرسیون و بخشی از آن به دلیل تنوع باقیمانده می تواند در بخشی تقسیم شود:

با درجه آزادی (N 1) = P + (N P 1)
در بسته های آماری جدول ANOVA که در آن به پارتیشن داده می شود معمولاً دارای فرمت زیر است [6]:

SS: "مبالغ مربع" ؛DF: درجه آزادی ؛MS: "میانگین مربع" (SS/DFS) ؛F: F STATISTICS (به تصویر زیر مراجعه کنید)
به عنوان یک اندازه گیری از استحکام رابطه خطی ، می توان از R. R استفاده کرد ، ضریب همبستگی متعدد بین Y ، پیش بینی کننده ها (X1 ، XP) و YFIT و R Square نسبت تنوع کل توضیح داده شده توسط رگرسیون است (R 2 = SSREG/ SSTOT).
تست روی مدل کلی یا کاهش یافته

در مثال ما tpers = β0 + β1زمان در فضای باز + β2Thome +β3سرعت باد + باقیمانده
فرضیه تهی (ح0) این است که هیچ رگرسیون به طور کلی یعنی β وجود ندارد1= β2=+βρ = 0
این آزمون بر اساس نسبت SS توضیح داده شده توسط رگرسیون نسبت به SS باقیمانده است. آمار آزمون (f = msreg / msres) دارای توزیع f با df1 = p و df2 = n p 1 (جدول توزیع F-) است. در مثال ما f = 5. 49 (p<0.01)
اگر اکنون می خواهیم فرضیه HO را آزمایش کنیم: β1= β2= β5= 0 (k = 3)
به طور کلی k از ضرایب رگرسیون P تحت H0 صفر قرار می گیرد. مدلی که اگر ساعت معتبر باشد0= 0 درست است "مدل کاهش یافته" نامیده می شود. ایده این است که تنوع توضیح داده شده مدل مورد نظر را با مدل کاهش یافته مقایسه کنیم.
آمار آزمون (F):

توزیع F با DF را دنبال می کند1= K و DF2= N P 1.
اگر یک یا دو متغیر کنار گذاشته شود و ما SS Reg را محاسبه کنیم (بسته آماری انجام می دهد) و می فهمیم که آمار آزمون برای F بین 0. 05 نهفته است
فرض
اگر از یک مدل خطی استفاده شود ، باید فرضیات زیر رعایت شود. برای هر مقدار از متغیر مستقل ، توزیع متغیر وابسته باید طبیعی باشد. واریانس توزیع متغیر وابسته باید برای تمام مقادیر متغیر مستقل ثابت باشد. رابطه بین متغیر وابسته و متغیرهای مستقل باید خطی باشد و تمام مشاهدات باید مستقل باشند. بنابراین فرضیات عبارتند از: استقلال ؛خطی بودن ؛عادی بودن ؛واریانس همسانی. به عبارت دیگر ، باقیمانده های یک مدل خوب باید به طور عادی و به طور تصادفی توزیع شوند ، یعنی ناشناخته به x ("homoscedasticity") بستگی ندارد 2 ، 4 ، 6 ، 9.
بررسی نقض فرضیات مدل
برای بررسی فرضیات مدل از تجزیه و تحلیل باقیمانده استفاده کردیم. انواع مختلفی از باقیمانده ها وجود دارد که معمولاً مورد استفاده قرار می گیرد ، باقیمانده های استاندارد (ZRESID) و باقیمانده های دانشجویی (SRESID) هستند [6]. اگر مدل صحیح باشد ، باقیمانده ها باید توزیع عادی با میانگین صفر و SD ثابت داشته باشند (یعنی بسته به x). برای بررسی این موضوع می توانیم باقیمانده ها را در برابر X ترسیم کنیم. ما همچنین می توانیم از آزمون دوربین واتسون برای همبستگی سریال باقیمانده ها و تشخیص های موردی برای مواردی که معیار انتخاب را برآورده می کند ، استفاده کنیم. باقیمانده ها (میانگین صفر) مستقل هستند ، که به طور معمول با انحراف استاندارد ثابت (همگن واریانس) 4 ، 6 توزیع می شوند.
برای کشف انحرافات ، خطی بودن و همگن بودن متغیرها را می توانیم باقیمانده ها را در برابر هر پیش بینی کننده یا در برابر مقادیر پیش بینی شده ترسیم کنیم. از طرف دیگر با استفاده از طرح جزئی می توانیم خطی بودن یک متغیر پیش بینی کننده را ارزیابی کنیم. طرح جزئی برای پیش بینی کننده x1نقشه ای از باقیمانده های y رگرسیون در سایر XS و در برابر باقیمانده های XI رگرسیون در سایر X است. طرح باید خطی باشد. برای بررسی عادی بودن باقیمانده ها می توانیم از هیستوگرام (با منحنی طبیعی) یا یک قطعه احتمال طبیعی 6 ، 7 استفاده کنیم.
خوب بودن برازش مدل با مطالعه رفتار باقیمانده ها، جستجوی "مشاهدات / افراد خاص" مانند نقاط پرت، مشاهدات با "اهرم" بالا و نقاط تاثیرگذار ارزیابی می شود. مشاهداتی که مستحق توجه بیشتر هستند، موارد پرت هستند، یعنی مشاهداتی با باقیمانده غیرمعمول بزرگ. نقاط اهرمی بالا: الگوی x غیر معمول، یعنی نقاط پرت در فضای پیش بینی. نقاط تأثیرگذار: افرادی که تأثیر زیادی در برآورد یا خطای استاندارد یک یا چند β دارند. یک مشاهده می تواند هر سه باشد. توصیه می شود افراد با باقیمانده های بزرگ را از نظر موارد دور از دسترس بازرسی کنید. استفاده از فواصل برای نقاط اهرمی بالا، یعنی اقداماتی برای شناسایی موارد با ترکیب غیرمعمول مقادیر برای متغیرهای مستقل و مواردی که ممکن است تأثیر زیادی بر مدل رگرسیون داشته باشد. برای نقاط تأثیرگذار از آمار تأثیر استفاده کنید، یعنی تغییر در ضرایب رگرسیون (DfBeta(s)) و مقادیر پیش بینی شده (DfFit) که از حذف یک مورد خاص ناشی می شود. معیار کلی برای تأثیر روی همه βها به طور مشترک «فاصله کوک» (COOK) است. به طور مشابه برای خطاهای استاندارد، اندازه گیری کلی COVRATIO 6 است.
انحراف از مفروضات مدل
ما می توانیم از نکاتی برای اصلاح برخی انحرافات از مفروضات مدل استفاده کنیم. در صورت وجود انحنای خطی در یک یا چند نمودار، می توانیم عبارت(های) درجه دوم را اضافه کنیم. در صورت عدم همگنی sd باقیمانده، می توانیم تغییری را امتحان کنیم: اگر Sres متناسب با Y پیش بینی شده باشد، log Y را امتحان کنیم. جذر Y اگر توزیع Y پواسون باشد. 1/Y اگر Sres 2 با Y پیش بینی شده متناسب باشد. Y 2 اگر Sres 2 با Y کاهش یابد. اگر خطی بودن و همگنی حفظ شود، اگر اندازه نمونه به اندازه کافی بزرگ باشد (n≥50-100) غیر نرمال بودن مهم نیست. اگر خطی بودن اما نه همگنی وجود داشته باشد، تخمین β ها درست است، اما خطاهای استاندارد نیست. آنها را می توان با محاسبه se's "محکم" (ساندویچ، تخمین هوبر) 4، 6، 9 تصحیح کرد.
روش های انتخاب برای مدل سازی رگرسیون خطی
به منظور مشخص کردن چگونگی ورود متغیرهای مستقل در تجزیه و تحلیل ، روشهای انتخابی مختلفی برای مدل سازی رگرسیون خطی وجود دارد. با استفاده از روش های مختلف ، انواع مدل های رگرسیون از همان مجموعه متغیرها می توانند ساخته شوند. انتخاب متغیر رو به جلو ، بر اساس معیارهای ورود ، متغیرهای موجود در بلوک را وارد می کند. حذف متغیر عقب در یک مرحله واحد ، تمام متغیرهای موجود در بلوک را وارد کرده و بر اساس معیارهای حذف ، آنها را یک بار حذف می کند. ورود و حذف متغیر گام به گام متغیرهای موجود در بلوک را در هر مرحله برای ورود یا حذف بررسی می کند. همه متغیرها باید بدون توجه به روش ورود مشخص شده ، معیار تحمل را که باید در معادله وارد شود ، عبور دهند. متغیر وارد نمی شود اگر باعث تحمل متغیر دیگری در مدل شود که زیر معیار تحمل 6 پایین بیاید. در یک مدل متناسب با متغیرهای وارد شده و از مدل خارج شده و آمار مختلف مناسب و مناسب مانند R2 ، تغییر مربع R ، خطای استاندارد تخمین و جدول تجزیه و تحلیل واریانس نمایش داده می شود.
مسائل نسبی
مدلهای رگرسیون لجستیک باینری با استفاده از روش رگرسیون لجستیک یا روش رگرسیون لجستیک چندمجمی می توانند نصب شوند. یک تمایز مهم نظری این است که روش رگرسیون لجستیک تمام آمار و آزمایشات را با استفاده از داده ها در موارد فردی تولید می کند در حالی که روش رگرسیون لجستیک چندمجمی مواردی را درج می کند تا مواردی را با الگوهای متغیر یکسان برای پیش بینی کننده ها بر اساس این زیرمجموعه ها تشکیل دهد. اگر همه پیش بینی کننده ها طبقه بندی شوند یا هر پیش بینی کننده مداوم فقط تعداد محدودی از مقادیر را در نظر بگیرد ، روش mutinomial ترجیح داده می شود. همانطور که قبلاً نیز گفته شد ، از روش ScatterPlot برای نمایش داده ها برای چند قطبی بودن استفاده کنید. مانند سایر اشکال رگرسیون ، چند خطی بودن در بین پیش بینی کننده ها می تواند منجر به برآوردهای مغرضانه و خطاهای استاندارد باد شود. اگر تمام متغیرهای پیش بینی کننده شما طبقه بندی شده باشند ، می توانید از روش loglinear نیز استفاده کنید.
به منظور بررسی همبستگی بین متغیرها ، همبستگی پیرسون یا اسپیرمن برای یک جفت متغیرهای R (XI ، XJ) استفاده می شود. برای هر جفت متغیر (XI ، XJ) ضریب همبستگی پیرسون (R) قابل محاسبه است. Pearsons R (XI ؛ XJ) اندازه گیری ارتباط خطی بین دو متغیر (به طور عادی توزیع شده) است. R 2 نسبت تنوع کل مورد توضیح داده شده توسط دیگری (R 2 = B * SX/SY) است که با رگرسیون یکسان است. هر ضریب همبستگی برای ارتباط بین دو متغیر بدون در نظر گرفتن متغیرهای دیگر ، اندازه گیری می کند. اما چندین مفهوم همبستگی مفید وجود دارد که شامل متغیرهای بیشتر است. ضریب همبستگی جزئی بین XI و XJ ، برای سایر X تنظیم شده است. R (x1 ؛ x2 / x3). ضریب همبستگی جزئی را می توان به عنوان تعدیل همبستگی ساده با در نظر گرفتن تأثیر یک متغیر کنترل مشاهده کرد: R (x ؛ y / z) یعنی همبستگی بین x و y کنترل شده برای Z. ضریب همبستگی چندگانه بین یک x وچند X دیگر به عنوان مثالR (x1 ؛ x2 ، x3 ، x4) اندازه گیری ارتباط بین یک متغیر و چندین متغیر دیگر r (y ؛ x1 ، x2 ، xk) است. ضریب همبستگی متعدد بین y و x1 ، x2 ، xk به عنوان ضریب همبستگی پیرسون R (y ؛ yfit) بین y و مقدار مناسب آن در مدل رگرسیون تعریف شده است: y = β0 + β1x1 + βKXK + باقیمانده. مربع r (y ؛ x1 ، xk) به عنوان نسبت تنوع در y تفسیر می شود که می تواند توسط x1 ، xk توضیح داده شود. فرضیه تهی [ساعت0: ρ (: x1 ، ، xk) = 0] با آزمایش F برای رگرسیون کلی آزمایش می شود همانطور که در مدل رگرسیون چند متغیره است (به بالا مراجعه کنید) 6 ، 7. ضریب همبستگی چند نفری بین یک x و چند X دیگر تنظیم شده برای برخی دیگر از X به عنوان مثال. R (x1 ؛ x2 ، x3 ، x4 / x5 ، x6). ضریب همبستگی جزئی چند برابر برابر با افزایش نسبی در ٪ با اضافه کردن x1 ، xk به مدلی که در حال حاضر حاوی Z1 ، Zρ به عنوان پیش بینی کننده 6 ، 7 است ، توضیح داد.
سایر موارد جالب تجزیه و تحلیل رگرسیون خطی متعدد عبارتند از: مقایسه دو گروه. به عنوان مثال ، اگر می خواهیم به این سؤال پاسخ دهیم اگر میانگین ارتفاع بین زن و مرد متفاوت باشد؟در مدل رگرسیون خطی ساده:

آزمایش β1 = 0 با آزمایش معادل است
قدمردانsub>= قدزنانبا استفاده از آزمون t دانشجویی
مدل رگرسیون خطی توزیع طبیعی ارتفاع در هر دو گروه را با مساوی فرض می کند. این دقیقاً مدل آزمون T دو نمونه ای است. در مورد مقایسه چندین گروه گروه ، ما می خواهیم به این سؤال پاسخ دهیم که آیا میانگین ارتفاع بین کلاسهای مختلف SES متفاوت است؟
SES: 1 (کم) ؛2 (میانه) و 3 (بالا) (وضعیت اقتصادی اقتصادی)
ما می توانیم از مدل رگرسیون خطی زیر استفاده کنیم:

سپس β1و β2تفسیر می شوند:
β1= تفاوت در میانگین ارتفاع بین طبقه پایین و بالا
β2= اختلاف در میانگین ارتفاع بین طبقه متوسط و بالا
آزمایش β1 = β2= 0 با تجزیه و تحلیل یک طرفه از آزمون واریانس F معادل است. مدل آماری در هر دو مورد در واقع همان 4 ، 6 ، 7 ، 9 است.
تجزیه و تحلیل کواریانس (ANCOVA)
اگر مایل به مقایسه متغیر مداوم Y (به عنوان مثال ارتفاع) بین گروه ها (به عنوان مثال زن و مرد) اصلاح شده (تنظیم شده یا کنترل شده) برای یک یا چند متغیر متغیر x (مخدوش کننده) (به عنوان مثال x = سن یا وزن) هستیم ، این سوال تدوین می شود:آیا وسایل قد مردان و زنان متفاوت است ، اگر مردان و زنان با وزن برابر مقایسه شوند؟توجه داشته باشید که اگر بین وسایل قد برای زنان و مردان تفاوت وجود داشته باشد ، این سؤال با این مسئله متفاوت است؟و پاسخ ها می توانند کاملاً متفاوت باشند! در صورت اصلاح ، تفاوت بین زن و مرد می تواند برعکس ، بزرگتر یا کوچکتر از خام باشد. به منظور برآورد تفاوت اصلاح شده از مدل رگرسیون چندگانه زیر استفاده می شود:

که در آن y: متغیر پاسخ (به عنوان مثال ارتفاع) ؛Z: متغیر گروه بندی (به عنوان مثال z = 0 برای مردان و z = 1 برای زنان) ؛X: متغیرهای متغیر (مخدوش) (به عنوان مثال وزن).
بنابراین ، برای مردان خط رگرسیون y = β است0 + β2و برای زنان y = (β0 + β1) + β2.
این مدل فرض می کند که خطوط رگرسیون موازی هستند. بنابراین β1تفاوت عمودی است و می تواند به عنوان: برای تفاوت x اصلاح شده بین میانگین پاسخ y گروه ها تفسیر شود. اگر خطوط رگرسیون موازی نباشند ، تفاوت در میانگین y به مقدار x بستگی دارد. این به "تعامل" یا "اصلاح اثر" گفته می شود.
یک مدل پیچیده تر ، که در آن تعامل پذیرفته شده است ،:

مردان خط رگرسیون: y = β0 + β2
فرضیه عدم وجود "اصلاح اثر" توسط H آزمایش می شود0: 3 = 0
به عنوان نمونه ، ما علاقه مندیم که پاسخ دهیم - اصلاح شده برای وزن بدن - تفاوت در قد بین مردان و زنان در یک نمونه جمعیت؟
ما مدل را با تعامل بررسی می کنیم:

با آزمایش β3= 0 ، مقدار p بسیار بزرگتر از 0. 05 محاسبه شد. بنابراین فرض می کنیم که هیچ تعامل وجود ندارد ، یعنی خطوط رگرسیون موازی هستند. تجزیه و تحلیل بیشتر از کواریانس برای گروه های 3 پوند می تواند در صورت درخواست تفاوت در میانگین ارتفاع بین افراد با سطح مختلف آموزش (ابتدایی ، متوسط ، زیاد) ، اصلاح شده برای وزن بدن استفاده شود. در مدلی که ممکن است سه خط موازی نباشد ، باید تعامل را بررسی کنیم. آزمایش فرضیه H0: β1 = β2= 0 ، یعنی هیچ تفاوتی بین سطح تحصیلات در هنگام اصلاح وزن ، نتیجه متناسب با مدل را نشان می دهد ، که مقادیر p برای z1و Z2به انتخاب گروه مرجع بستگی دارد. اهداف ANCOVA تصحیح برای اشتباه و افزایش دقت یک تفاوت تخمینی است.
در یک مدل عمومی ANCOVA به عنوان:

که در آن متغیر پاسخ ؛گروه های K (متغیرهای ساختگی z1, Z2, , Zk-1) و x1, , Xpمخفف
یک پسوند ساده برای تعداد خودسرانه گروه ها و متغیرهای متغیر وجود دارد.
برنامه نویسی پیش بینی کننده های طبقه بندی در رگرسیون
همیشه باید بفهمید که از کدام روش کدگذاری عوامل طبقه بندی استفاده می شود تا بتواند تخمین پارامتر را تفسیر کند. در برنامه نویسی "سلول مرجع" ، یکی از دسته ها نقش دسته مرجع ("سلول مرجع") را ایفا می کند ، در حالی که دسته های دیگر توسط متغیرهای ساختگی نشان داده شده اند. β مربوط به آدمک هایی است که به عنوان تفاوت دسته مربوطه با دسته مرجع تعبیر می شوند. در "تفاوت با میانگین کلی" کدگذاری در مدل مثال قبلی: [y = β0 + β11+ β22++ باقیمانده] ، β0به عنوان میانگین کلی سه سطح آموزش در حالی که β تفسیر می شود1و β2به ترتیب به عنوان انحراف میانگین اولیه و متوسط از میانگین کلی تعبیر می شود. انحراف میانگین سطح بالا از میانگین کلی توسط (- β داده می شود1 - β2). در "سلول به معنای" کدگذاری در مدل قبلی (بدون رهگیری): [y = β0 + β11+ β22 + β33+ باقیمانده] ، β1میانگین اولیه ، β است2وسط و β3از آموزش سطح بالا 6 ، 7 ، 9.
نتیجه گیری
برای هرکسی که امروز ادبیات پزشکی را می خواند ، آشکار است که برخی از دانش در مورد زیست شناسی و اپیدمیولوژی یک ضرورت است. هدف در هر تجزیه و تحلیل داده ها استخراج از اطلاعات خام تخمین دقیق است. اما قبل از هرگونه آزمایش یا تخمین ، ویرایش دقیق داده ها ، برای بررسی خطاها ضروری است و به دنبال آن جمع بندی داده ها انجام می شود. یکی از مهمترین و متداول ترین سؤال این است که آیا رابطه آماری بین متغیر پاسخ (Y) و متغیرهای توضیحی (XI) وجود دارد. گزینه ای برای پاسخ به این سوال استفاده از تحلیل رگرسیون است. انواع مختلفی از تحلیل رگرسیون وجود دارد. همه این روشها به ما امکان می دهند تا تأثیر متغیرهای متعدد بر متغیر پاسخ را ارزیابی کنیم.
منابع
2. Altman DG. آمار عملی برای تحقیقات پزشکی. چاپمن و هال/CRC ؛1991.[Google Scholar]
4. Draper NR ، Smith H. تجزیه و تحلیل رگرسیون کاربردی. سری ویلی در احتمال و آمار ؛1998. تجزیه و تحلیل رگرسیون کاربردی.[Google Scholar]
5. Munro BH. روشهای آماری برای تحقیقات مراقبت های بهداشتی. ویرایش 5لیپینکوت ویلیامز و ویلکینز ؛2005. [Google Scholar]
7. Stijnen T ، Mulder PGH. روشهای کلاسیک برای تجزیه و تحلیل داده ها. روتردام: برنامه NIHES ؛1999. [Google Scholar]
8. Alexopoulos EC ، Chatzis C ، Linos A. تجزیه و تحلیل عوامل مؤثر بر قرار گرفتن در معرض تولوئن و زایلن در ساکنان آتن ، یونان. بهداشت عمومی BMC. 2006 ؛6: 50.[مقاله رایگان PMC] [PubMed] [Google Scholar]
9. Shedecor GW ، Cochran WG. روشهای استیستی. هشتم ویرایش. انتشارات دانشگاه آیووا ؛1989. [Google Scholar]
فارکس وکسب درامد...
ما را در سایت فارکس وکسب درامد دنبال می کنید
برچسب :
نویسنده : آرش اصل زاد
بازدید : <-PostHit->
تاريخ : سه
شنبه
30 خرداد
1402 ساعت: 21:01