تفاوت بین مدل های خطی تعمیم یافته و مدل های مختلط خطی تعمیم یافته

ساخت وبلاگ

من تعجب می کنم که چه تفاوت هایی بین GLM های مختلط و غیر مخلوط وجود دارد. به عنوان مثال، در SPSS منوی کشویی به کاربران این امکان را می دهد که یکی از موارد زیر را در نظر بگیرند:

  • analyze-> generalized linear models->مدل های خطی تعمیم یافته و
  • analyze-> mixed models->خطی تعمیم یافته

آیا آنها با ارزش های از دست رفته متفاوت برخورد می کنند؟

متغیر وابسته من باینری است و چندین متغیر مستقل طبقه بندی و پیوسته دارم.

3 پاسخ 3

ظهور مدل های خطی تعمیم یافته به ما این امکان را می دهد تا زمانی که توزیع متغیر پاسخ غیرعادی است - به عنوان مثال، زمانی که DV شما باینری است، مدل های رگرسیونی از داده ها بسازیم.(اگر می خواهید کمی بیشتر در مورد GLiM بدانید، من یک پاسخ نسبتاً گسترده در اینجا نوشتم که ممکن است مفید باشد اگرچه زمینه متفاوت است.) با این حال، یک GLiM، به عنوان مثال. یک مدل رگرسیون لجستیک، فرض می کند که داده های شما مستقل هستند. به عنوان مثال، مطالعه ای را تصور کنید که به بررسی این موضوع می پردازد که آیا یک کودک به آسم مبتلا شده است یا خیر. هر کودک یک نقطه داده را به مطالعه کمک می کند - آنها یا آسم دارند یا ندارند. اگرچه گاهی اوقات داده ها مستقل نیستند. مطالعه دیگری را در نظر بگیرید که به این موضوع می پردازد که آیا کودک در مقاطع مختلف در طول سال تحصیلی سرما می خورد یا خیر. در این مورد، هر کودک نقاط داده بسیاری را ارائه می دهد. یک زمانی ممکن است کودک سرما بخورد، بعداً ممکن است سرما نخورد و بعداً ممکن است سرماخوردگی دیگری داشته باشد. این داده ها مستقل نیستند زیرا از یک کودک آمده اند. برای تجزیه و تحلیل مناسب این داده ها، باید به نحوی این عدم استقلال را در نظر بگیریم. دو راه وجود دارد: یک راه استفاده از معادلات تخمین تعمیم یافته است (که شما به آنها اشاره نمی کنید، بنابراین ما از آن صرف نظر می کنیم). راه دیگر استفاده از یک مدل ترکیبی خطی تعمیم یافته است. GLiMM ها می توانند عدم استقلال را با افزودن جلوه های تصادفی (همانطور که @MichaelCheick یادداشت می کند) توضیح دهند. بنابراین، پاسخ این است که گزینه دوم شما برای داده های تکراری غیر عادی (یا در غیر این صورت غیر مستقل) است.(باید ذکر کنم، با توجه به نظر @Macro، که مدل های ترکیبی خطی تعمیم یافته شامل مدل های خطی به عنوان یک مورد خاص می شوند و بنابراین می توانند با داده های توزیع شده معمولی استفاده شوند. با این حال، در استفاده معمولی این اصطلاح به داده های غیر عادی دلالت می کند.)

به روز رسانی: (OP در مورد GEE نیز سوال کرده است، بنابراین من کمی در مورد چگونگی ارتباط هر سه با یکدیگر خواهم نوشت.)

در اینجا یک مرور کلی وجود دارد:

  • یک GLiM معمولی (من از رگرسیون لجستیک به عنوان نمونه اولیه استفاده خواهم کرد) به شما امکان می دهد یک پاسخ باینری مستقل را به عنوان تابعی از متغیرهای کمکی مدل کنید.
  • GLMM به شما امکان می دهد یک پاسخ باینری غیر مستقل (یا خوشه ای) مشروط بر ویژگی های هر خوشه جداگانه به عنوان تابعی از متغیرهای متغیر باشد.
  • GEE به شما امکان می دهد میانگین پاسخ جمعیت داده های باینری غیر مستقل به عنوان تابعی از متغیرهای متغیر

از آنجا که برای هر شرکت کننده چندین آزمایش دارید ، داده های شما مستقل نیستند. همانطور که به درستی توجه داشتید ، "احتمالاً ریاض ها در یک شرکت کننده بیشتر از مقایسه با کل گروه مشابه هستند". بنابراین ، شما باید از GLMM یا GEE استفاده کنید.

بنابراین ، مسئله این است که چگونه GLMM یا GEE برای وضعیت شما مناسب تر باشند. پاسخ این سؤال به موضوع تحقیقات شما بستگی دارد-به طور خاص ، هدف استنتاج هایی که امیدوارید انجام دهید. همانطور که در بالا بیان کردم ، با GLMM ، Betas با توجه به ویژگی های فردی آنها ، در مورد تأثیر تغییر یک واحد در متغیرهای خود بر روی یک شرکت کننده خاص به شما می گوید. از طرف دیگر با GEE ، بتاها در مورد تأثیر تغییر یک واحد در متغیرهای متغیر به طور متوسط پاسخ های کل جمعیت مورد نظر به شما می گویند. این یک تمایز دشوار برای درک است ، به خصوص به این دلیل که چنین تمایزی با مدل های خطی وجود ندارد (در این صورت این دو همان چیز هستند).

enter image description here

یکی از راه های تلاش برای پیچاندن سر خود در این زمینه این است که تصور کنید که به طور متوسط بیش از جمعیت خود را در هر دو طرف علامت برابر در مدل خود قرار دهید. به عنوان مثال ، این ممکن است یک مدل باشد: $ $ text (p_i) = beta _+ beta_x_1+b_i $ $ که در آن: $ $ text (p) = ln سمت چپ ( frac

درست) ، $~~&$$bsimmathcal N(0,sigma^2_b) $$ پارامتری وجود دارد که بر توزیع پاسخ ($p$، احتمال، با داده های باینری) در سمت چپ برای هر شرکت کننده حاکم است. در سمت راست، ضرایبی برای تأثیر متغیرهای کمکی و سطح پایه زمانی که متغیرهای کمکی برابر با 0 باشد، وجود دارد. اولین چیزی که باید توجه داشت این است که رهگیری واقعی برای هر فرد خاصی $x08eta_0 نیست.$، بلکه $(x08eta_0+b_i)$. اما پس چی؟اگر فرض کنیم که $b_i$ (اثر تصادفی) معمولاً با میانگین 0 توزیع می شود (همانطور که انجام دادیم)، مطمئناً می توانیم بدون مشکل از آنها میانگین بگیریم (فقط $x08eta_0$ خواهد بود). علاوه بر این، در این مورد، ما یک اثر تصادفی متناظر برای شیب ها نداریم و بنابراین میانگین آنها فقط $x08eta_1$ است. بنابراین میانگین فاصله ها به اضافه میانگین شیب ها باید برابر با تبدیل لجیت میانگین $p_i$ در سمت چپ باشد، اینطور نیست؟متاسفانه نه . مشکل این است که در بین این دو، $ ext$ قرار دارد که یک تبدیل غیرخطی است.(اگر تبدیل خطی بود، آنها معادل خواهند بود، به همین دلیل است که این مشکل برای مدل های خطی رخ نمی دهد.) نمودار زیر این را روشن می کند: تصور کنید که این نمودار فرآیند تولید داده های زیربنایی را برای احتمال یک کلاس کوچک نشان می دهد. دانش آموزان می توانند آزمونی را در مورد برخی از موضوعات با تعداد ساعت آموزش معین در آن موضوع بگذرانند. هر یک از منحنی های خاکستری نشان دهنده احتمال قبولی در آزمون با مقادیر مختلف آموزش برای یکی از دانش آموزان است. منحنی پررنگ میانگین کل کلاس است. در این حالت، تأثیر یک ساعت آموزش اضافی مشروط بر ویژگی های دانش آموز $x08eta_1$--برای هر دانش آموز یکسان است (یعنی شیب تصادفی وجود ندارد). البته توجه داشته باشید که توانایی پایه دانش آموزان در بین آنها متفاوت است - احتمالاً به دلیل تفاوت در مواردی مانند IQ (یعنی یک رهگیری تصادفی وجود دارد). با این حال، میانگین احتمال برای کلاس به عنوان یک کل، از مشخصات متفاوتی نسبت به دانش آموزان پیروی می کند. نتیجه کاملاً غیر شهودی این است: یک ساعت آموزشی اضافی می تواند تأثیر قابل توجهی بر احتمال موفقیت هر دانش آموز در آزمون داشته باشد، اما تأثیر نسبتاً کمی بر نسبت احتمالی کل دانش آموزانی که موفق می شوند. این به این دلیل است که برخی از دانش آموزان ممکن است قبلاً شانس زیادی برای قبولی داشته باشند در حالی که برخی دیگر ممکن است هنوز شانس کمی داشته باشند.

این سوال که آیا شما باید از GLMM استفاده کنید یا GEE این سوال است که کدام یک از این توابع را می خواهید تخمین بزنید. اگر می خواهید در مورد احتمال قبولی دانش آموز معین (مثلاً اگر دانش آموز یا والدین دانش آموز بودید) بدانید، می خواهید از GLMM استفاده کنید. از طرف دیگر، اگر می خواهید در مورد تأثیر آن بر جمعیت بدانید (مثلاً اگر معلم یا مدیر بودید)، می خواهید از GEE استفاده کنید.

برای بحث ریاضی دیگری درباره این مطالب، به این پاسخ توسط @Macro مراجعه کنید.

التداول المالي...
ما را در سایت التداول المالي دنبال می کنید

برچسب : نویسنده : سیروس ابراهیم‌زاده بازدید : <-PostHit-> تاريخ : پنجشنبه 25 اسفند 1401 ساعت: 17:22