آشنایی با ساختار مبادله

ساخت وبلاگ

مفاهیم خاصی وجود دارد که برای درک داده ها و نحوه ساخت داده ها برای تجزیه و تحلیل اساسی است. داده ها را می توان تولید ، ضبط و ذخیره در انواع سرگیجه از قالب ها ، اما وقتی صحبت از تجزیه و تحلیل می شود ، همه قالب های داده به طور برابر ایجاد نمی شوند.

آماده سازی داده ها فرایند دریافت داده های به خوبی در یک جدول واحد یا جدول های مرتبط با آن است تا بتواند در Tableau مورد تجزیه و تحلیل قرار گیرد. این شامل ساختار ، یعنی ردیف ها و ستون ها ، و همچنین جنبه های پاکیزگی داده ها ، چنین نوع داده های صحیح و مقادیر صحیح داده ها است.

نکته: ممکن است با یک مجموعه داده مورد نظر خود به موضوع زیر کمک کند. اگر از قبل مجموعه داده ای ندارید که می توانید از آن استفاده کنید ، نکات ما را برای یافتن مجموعه داده های خوب مشاهده کنید (پیوند در یک پنجره جدید باز می شود).

چگونه ساختار بر تجزیه و تحلیل تأثیر می گذارد

ساختار داده های شما ممکن است چیزی نباشد که بتوانید کنترل کنید. بقیه این موضوع فرض می کند که شما به داده های خام و ابزارهای مورد نیاز برای شکل دادن به آن دسترسی دارید ، مانند Tableau Prep Builder. با این وجود ، ممکن است شرایطی وجود داشته باشد که نتوانید داده های خود را به دلخواه محور یا جمع کنید. انجام تجزیه و تحلیل اغلب ممکن است اما ممکن است نیاز به تغییر محاسبات خود یا نحوه نزدیک شدن به داده ها داشته باشید. برای نمونه ای از نحوه انجام تجزیه و تحلیل یکسان با ساختار داده های مختلف ، به Tableau Prep Day در سناریوهای زندگی مراجعه کنید: تجزیه و تحلیل با تاریخ دوم در دسک تاپ Tableau (پیوند در یک پنجره جدید باز می شود). اما اگر بتوانید ساختار داده را بهینه کنید ، احتمالاً تجزیه و تحلیل شما را بسیار ساده تر می کند.

ساختار داده ها

دسک تاپ Tableau با داده هایی که در جداول مانند صفحه گسترده قالب بندی شده است ، بهترین کار را می کند. یعنی داده های ذخیره شده در ردیف ها و ستون ها ، با عنوان های ستون در ردیف اول. بنابراین یک ردیف یا ستون چه باید باشد؟

یک ردیف چیست؟

یک ردیف یا ضبط می تواند از اطلاعات مربوط به معامله در یک فروشگاه خرده فروشی ، تا اندازه گیری آب و هوا در یک مکان خاص یا آمار مربوط به یک پست رسانه های اجتماعی باشد.

این مهم است که بدانید یک رکورد (ردیف) در داده ها نشان می دهد. این دانه بندی داده ها است.

نکته: بهترین روش داشتن یک شناسه منحصر به فرد (UID) است ، مقداری که هر ردیف را به عنوان یک قطعه منحصر به فرد از داده ها مشخص می کند. مانند شماره تأمین اجتماعی یا URL هر رکورد به آن فکر کنید. در سوپراستور ، این Row ID خواهد بود. توجه داشته باشید که همه مجموعه داده ها دارای یک UID نیستند اما داشتن یک مورد به آن آسیب نمی رساند.

سعی کنید مطمئن شوید که می توانید به این سؤال پاسخ دهید "یک ردیف در مجموعه داده ها چه چیزی را نشان می دهد؟". این همان پاسخ دادن به "زمینه TableName (Count) چیست؟" است. اگر نمی توانید آن را بیان کنید ، داده ها ممکن است برای تجزیه و تحلیل ضعیف ساخته شوند.

مفهومی مربوط به آنچه یک ردیف را تشکیل می دهد ، ایده تجمع و دانه بندی است که مخالف انتهای یک طیف است.

اشاره به چگونگی جمع آوری مقادیر مختلف داده به یک مقدار واحد ، مانند شمارش تمام جستجوهای گوگل برای ادویه کدو تنبل یا گرفتن میانگین تمام خواندن دما در اطراف سیاتل در یک روز معین.

به طور پیش فرض ، اقدامات در Tableau همیشه جمع می شوند. جمع پیش فرض جمع است. شما می توانید تجمع را به گزینه هایی مانند میانگین ، متوسط ، تعداد متمایز ، حداقل و غیره تغییر دهید.

اشاره به چگونگی تفصیل داده ها دارد. یک ردیف یا ضبط در مجموعه داده ها چه چیزی را نشان می دهد؟شخصی با مالاریا؟کل موارد استان های مالاریا برای ماه؟این دانه بندی است.

دانستن دانه بندی داده ها برای کار با بیان سطح جزئیات (LOD) بسیار مهم است.

درک تجمع و دانه بندی به دلایل زیادی یک مفهوم مهم است. این موارد بر چیزهایی مانند یافتن مجموعه داده های مفید ، ایجاد تجسم مورد نظر ، ارتباط صحیح یا پیوستن به داده ها و استفاده از عبارات LOD تأثیر می گذارد.

نکته: برای اطلاعات بیشتر ، در کمک به کمک های تجمع ویدیویی و تجمع داده ها یا تجمع داده ها در Tableau مراجعه کنید

فیلد یا ستون چیست؟

ستونی از داده های موجود در یک جدول به عنوان یک زمینه در صفحه داده وارد دسک تاپ Tableau می شود ، اما آنها اساساً اصطلاحات قابل تعویض هستند.(ما اصطلاح ستون را در دسک تاپ Tableau برای استفاده در ستون ها و قفسه های ردیف ذخیره می کنیم و برای توصیف برخی تجسمات.) یک زمینه از داده ها باید شامل مواردی باشد که می توانند در یک رابطه بزرگتر قرار بگیرند. این موارد به خودی خود مقادیر یا اعضا گفته می شود (فقط ابعاد گسسته حاوی اعضا هستند).

چه مقادیری در یک قسمت معین مجاز است توسط دامنه قسمت تعیین می شود (به یادداشت زیر مراجعه کنید). به عنوان مثال ، ستونی برای "ادارات فروشگاه های مواد غذایی" ممکن است شامل اعضای "دلی" "نانوایی" ، "تولید" و غیره باشد ، اما این شامل "نان" یا "سالامی" نمی شود زیرا این موارد هستند ، نه بخش. به روش دیگری ، دامنه بخش بخش فقط به بخش های احتمالی فروشگاه های مواد غذایی محدود می شود.

علاوه بر این ، یک مجموعه داده به خوبی ساختار یافته می تواند یک ستون برای "فروش" و یک ستون برای "سود" داشته باشد ، نه یک ستون واحد برای "پول" ، زیرا سود یک مفهوم جداگانه از فروش است.

دامنه میدان فروش مقادیر ≥ 0 خواهد بود ، زیرا فروش نمی تواند منفی باشد.

با این حال ، دامنه حوزه سود همه ارزش ها خواهد بود ، زیرا سود می تواند منفی باشد.

توجه: دامنه همچنین می تواند به معنای مقادیر موجود در داده ها باشد. اگر ستون "بخش فروشگاه های مواد غذایی" به اشتباه "سالامی" داشته باشد ، با این تعریف ، این مقدار در دامنه ستون خواهد بود. تعاریف کمی متناقض است. یکی مقادیری است که می تواند یا باید در آنجا باشد ، دیگری مقادیری است که در واقع آنجا هستند

طبقه بندی زمینه ها

هر ستون در جدول داده ها به عنوان یک قسمت در دسک تاپ Tableau قرار می گیرد که در صفحه داده ظاهر می شود. زمینه های موجود در دسک تاپ Tableau باید یک ابعاد یا اندازه گیری باشد (با یک خط در جداول در صفحه داده جدا شده است) و یا گسسته یا مداوم (کدگذاری شده رنگ: زمینه های آبی گسسته هستند و زمینه های سبز مداوم هستند).

ابعاد کیفی هستند ، به این معنی که آنها نمی توانند اندازه گیری شوند اما در عوض توصیف می شوند. ابعاد اغلب مواردی مانند شهر یا کشور ، رنگ چشم ، دسته ، نام تیم و غیره است. ابعاد معمولاً گسسته است.

اقدامات کمی است ، به این معنی که می توان آنها را با اعداد اندازه گیری و ثبت کرد. اقدامات می تواند مواردی مانند فروش ، ارتفاع ، کلیک و غیره در دسک تاپ Tableau باشد ، اقدامات به طور خودکار جمع می شوند. جمع پیش فرض جمع است. اقدامات معمولاً مداوم است.

گسسته به معنای جداگانه جدا یا مجزا است. تویوتا از مزدا متمایز است. در دسک تاپ Tableau ، مقادیر گسسته به عنوان یک برچسب وارد نمایش می شوند و آنها را ایجاد می کنند.

پیوسته به معنای تشکیل یک کل ناگسستنی و مداوم است. 7 توسط 8 دنبال می شود و پس از آن همان فاصله تا 9 و 7. 5 در وسط 7 تا 8 قرار می گیرد. در دسک تاپ Tableau ، مقادیر مداوم به عنوان یک محور وارد نمای می شوند.

ابعاد معمولاً گسسته است و اقدامات معمولاً مداوم است. اما همیشه هم به این صورت نیست. تاریخ ها می توانند گسسته یا مداوم باشند.

تاریخ ها ابعاد هستند و به طور خودکار به عنوان گسسته به نمایش می آیند (قطعات تاریخ با نام "اوت" ، که ماه اوت را بدون در نظر گرفتن اطلاعات دیگر مانند سال در نظر می گیرد). یک خط روند اعمال شده برای یک جدول زمانی با تاریخ های گسسته به خطوط چند روند ، یکی در هر صفحه تقسیم می شود.

ما می توانیم در صورت تمایل از تاریخ های مداوم استفاده کنیم (کوتاه تاریخ ، مانند "اوت 2024" ، که متفاوت از "اوت 2025" است). یک خط روند اعمال شده برای یک جدول زمانی با تاریخ های مداوم ، یک خط روند واحد برای کل محور تاریخ خواهد داشت.

نکته: برای اطلاعات بیشتر، فیلم آموزشی درک انواع یا ابعاد و اندازه های قرص، آبی و سبز در راهنما را ببینید.

در Tableau Prep هیچ تمایزی برای ابعاد یا اندازه ها قائل نمی شود. با این حال، درک مفاهیم پشت گسسته یا پیوسته برای مواردی مانند درک جزئیات در مقابل ارائه خلاصه داده ها در صفحه نمایه مهم است.

جزئیات: نمای جزئیات هر عنصر دامنه را به عنوان یک برچسب مجزا نشان می دهد و دارای یک نوار اسکرول بصری برای ارائه یک نمای کلی بصری از تمام داده ها است.

خلاصه: نمای خلاصه مقادیر را در یک محور پیوسته به صورت هیستوگرام نشان می دهد.

Biing و Histograms

رشته ای مانند سن یا حقوق مستمر در نظر گرفته می شود. بین سن 34 و 35 سال رابطه وجود دارد و 34 با 35 فاصله دارد همانطور که 35 از 36 سالگی فاصله دارد. با این حال، زمانی که از 10 سالگی یا بیشتر می گذریم، معمولاً از گفتن جملاتی مانند "9 و نیم" خودداری می کنیم." یا "7 و ¾". ما در حال حاضر سن خود را با افزایش های منظم به اندازه یک سال تنظیم می کنیم. شخصی که 12850 روز سن دارد از کسی که 12790 روز دارد بزرگتر است، اما ما یک خط می کشیم و می گوییم که هر دو 35 سال هستند. به طور مشابه، گروه بندی سنی اغلب به جای سن واقعی استفاده می شود. قیمت بلیط های سینما برای کودکان ممکن است برای کودکان ۱۲ سال و کمتر باشد، یا ممکن است در نظرسنجی از شما بخواهد گروه سنی خود را انتخاب کنید، مانند ۲۰ تا ۲۴، ۲۵ تا ۳۰ سال و غیره.

هیستوگرام برای تجسم توزیع داده های عددی با استفاده از biing استفاده می شود. یک هیستوگرام شبیه به نمودار میله ای است، اما به جای اینکه مقوله های مجزا در هر میله باشد، مستطیل هایی که هیستوگرام را تشکیل می دهند، یک سطل از یک محور پیوسته، مانند محدوده تعداد شکوفه ها (0-4، 5-9، 10) را تشکیل می دهند.-14 و غیره). ارتفاع مستطیل ها با فرکانس یا تعداد آن مقادیر تعیین می شود. در اینجا، محور y تعداد گیاهانی است که در هر سطل قرار می گیرند. هفت گیاه دارای 0-4 شکوفه، دو گیاه دارای 5-9 شکوفه و 43 گیاه دارای 20-24 شکوفه هستند.

Histogram of number of blossoms by number of plants

در Tableau Prep، نمای خلاصه یک هیستوگرام از مقادیر bied است. نمای جزئیات فرکانس هر مقدار را نشان می دهد و یک نوار پیمایش بصری در کناره دارد که توزیع کلی داده ها را نشان می دهد.

 

نمای خلاصه نمایش جزئیات
screenshot of the summary view in Tableau Prep screenshot of the detail view in Tableau Prep

توزیع ها و نقاط پرت

مشاهده توزیع یک مجموعه داده می تواند به تشخیص موارد پرت کمک کند.

توزیع: شکل داده ها در یک هیستوگرام ، اگرچه این بستگی به اندازه سطل ها دارد. قادر به دیدن تمام داده های خود در یک نمای هیستوگرام می تواند به شناسایی صحیح و کامل بودن داده ها کمک کند. شکل توزیع فقط در صورت اطلاع از داده ها مورد استفاده قرار می گیرد و می توانید تفسیر کنید که آیا توزیع معنی دارد یا خیر.

به عنوان مثال ، اگر بخواهیم از سال 1940-2017 به مجموعه داده ای از تعداد خانه های اینترنت باند پهن نگاه کنیم ، انتظار داریم توزیع بسیار ناچیزی را مشاهده کنیم. با این حال ، اگر ما از ژانویه 2017 تا دسامبر 2017 به تعداد خانه هایی با اینترنت باند پهن نگاه می کردیم ، انتظار داریم توزیع نسبتاً یکنواخت داشته باشیم.

اگر بخواهیم به مجموعه داده های Google برای "کدو تنبل ادویه Latte" نگاه کنیم ، انتظار داریم در پاییز اوج نسبتاً تیز ببینیم ، در حالی که جستجو برای "تبدیل سالیوس به فارنهایت" احتمالاً نسبتاً پایدار خواهد بود.

Outlier: مقداری که در مقایسه با سایر مقادیر شدید است. Outriers ممکن است مقادیر صحیح باشد یا ممکن است نشانگر خطا باشد.

برخی از فضای باز درست است و ناهنجاری های واقعی را نشان می دهد. اینها نباید حذف یا اصلاح شوند.

برخی از مسافت های خارج از کشور با پاکیزگی داده ها ، مانند حقوق 50 دلار به جای 50،000 دلار نشان می دهند زیرا یک دوره به جای کاما تایپ می شد.

اگر قرار بود لیستی از این دست را ببینید:

در نگاه اول عجیب به نظر نمی رسد. اما اگر به جای لیستی از برچسب ها ، این در یک محور با بنفش مداوم ترسیم شود ، به این شکل به نظر می رسد:

و بسیار واضح تر است که آخرین مشاهدات از اول دورتر است و ممکن است به دلیل خطا ، یک چیز مهمتر باشد.

انواع داده ها

پایگاه داده ها ، بر خلاف صفحات گسترده ، معمولاً قوانین سختگیرانه ای را در مورد انواع داده ها اعمال می کنند. انواع داده ها داده ها را در یک قسمت معین طبقه بندی می کنند و اطلاعاتی در مورد نحوه قالب بندی ، تفسیر داده ها ، و چه عملیاتی را می توان برای آن داده ها انجام داد. به عنوان مثال ، زمینه های عددی می توانند عملیات ریاضی را برای آنها اعمال کنند و زمینه های جغرافیایی را می توان نقشه برداری کرد.

دسک تاپ Tableau اختصاص می دهد که آیا یک زمینه ابعاد یا اندازه گیری است ، اما زمینه ها ویژگی های دیگری دارند که به نوع داده آنها بستگی دارد. اینها توسط نمادی که هر قسمت از آن وجود دارد نشان داده شده است (هرچند برخی از انواع نماد را به اشتراک می گذارند). Tableau Prep از همان نوع داده ها استفاده می کند. اگر نوع داده روی یک ستون اجرا شود و یک مقدار موجود با نوع داده اختصاص داده شده آن مطابقت ندارد ، ممکن است به صورت تهی نمایش داده شود (زیرا "بنفش" به معنای چیزی نیست).

برخی از توابع به انواع داده های خاص نیاز دارند. به عنوان مثال ، شما نمی توانید از یک زمینه عددی استفاده کنید. توابع نوع برای تغییر نوع داده یک فیلد استفاده می شود. به عنوان مثال ، DateParse می تواند یک تاریخ متن را در یک قالب خاص بگیرد و آن را به یک تاریخ تبدیل کند ، بنابراین مواردی مانند Drill Automatic Drill را در نمای فراهم می کند.

 

آیکون نوع داده
مقادیر متن (رشته)
مقادیر تاریخ
مقادیر تاریخ و زمان
مقادیر عددی
مقادیر بولی (فقط رابطه)
  مقادیر جغرافیایی (با نقشه ها استفاده می شود)

نکته: برای اطلاعات بیشتر ، به مقاله راهنما در مورد انواع داده ها مراجعه کنید.

داده های محوری و بی نظیر

داده های دوستانه مردم اغلب با یک قالب گسترده ضبط و ضبط می شوند و ستون های زیادی دارند. داده های قابل خواندن با دستگاه ، مانند Tableau ترجیح می دهند ، در قالب بلند ، با ستون های کمتری و ردیف های بیشتری بهتر است.

توجه: به طور سنتی ، داده های محوری به معنای رفتن از بلند به گسترده (ردیف ها به ستون ها) و عدم علاقه به معنای رفتن از گسترده به بلند (ستون ها به ردیف ها) است. با این حال ، Tableau با تبدیل ستون ها به ردیف ، از کلمه محوری به معنای رفتن از گسترده (دوستانه مردم) به بلند (قابل خواندن با ماشین) استفاده می کند. در این سند ، Pivot به Sense Tableau of Word مراجعه می شود. برای وضوح ، می تواند به مشخص کردن "ستون های محوری به ردیف ها" یا "ردیف های محوری به ستون ها" کمک کند.

برای اطلاعات بیشتر ، به مقالات راهنما داده ها و نکات خود را برای کار با داده های خود مراجعه کنید.

داده های گسترده

در مجموعه داده های مالاریا ، ستونی برای کشور وجود دارد ، سپس یک ستون در سال. هر سلول تعداد موارد مالاریا را برای آن کشور و سال نشان می دهد. در این قالب 108 ردیف و 16 ستون داریم.

Wide format of malaria data

خواندن و درک این قالب برای شخص آسان است. با این حال ، اگر بخواهیم این داده ها را به دسک تاپ Tableau وارد کنیم ، در هر ستون یک زمینه دریافت می کنیم. ما یک زمینه برای 2000 ، زمینه ای برای سال 2001 ، زمینه ای برای 2002 و غیره داریم.

Screenshot of wide formatted malaria data in Tableau Desktop

برای فکر کردن در مورد آن ، 15 زمینه وجود دارد که همه آنها یک چیز اساسی را نشان می دهند - تعداد موارد گزارش شده مالاریا - و هیچ زمینه ای برای زمان وجود ندارد. این امر باعث می شود تجزیه و تحلیل در طول زمان بسیار سخت باشد زیرا داده ها در زمینه های جداگانه ذخیره می شوند.

س: چگونه می توانیم نقشه ای ایجاد کنیم که تعداد کل پرونده های مالاریا در هر کشور را از سال 2000 تا 2014 نشان دهد؟

پاسخ: یک قسمت محاسبه شده برای جمع بندی تمام سالها ایجاد کنید.

توجه: این تصویر به روز نشده است تا منعکس کننده جدیدترین UI باشد. صفحه داده دیگر ابعاد و اقدامات را به عنوان برچسب نشان نمی دهد.

نشانه دیگری از اینکه این قالب برای تجزیه و تحلیل ایده آل نیست را می توان در این واقعیت مشاهده کرد که در هیچ کجا اطلاعاتی در مورد معنای مقادیر واقعی نداریم. برای الجزایر در سال 2012، ما مقدار 55 را داریم. پنجاه و پنج چیست؟از ساختار داده ها مشخص نیست.

اگر نام ستون، مقادیر را توصیف نمی کند، بلکه اطلاعات بیشتری را می رساند، این نشانه ای است که داده ها باید محور شوند.

داده های بلند

اگر داده ها را چرخش کنیم، داده ها را از پهن به بلند تغییر شکل می دهیم. اکنون، به جای داشتن یک ستون برای هر سال، ما یک ستون واحد، سال، و یک ستون جدید، موارد گزارش شده داریم. در این قالب 1606 سطر و 3 ستون داریم. این قالب داده بلندتر است تا عریض تر.

اکنون در Tableau Desktop، یک فیلد برای سال و یک فیلد برای موارد گزارش شده و همچنین فیلد اصلی کشور داریم. انجام تجزیه و تحلیل بسیار ساده تر است زیرا هر فیلد یک کیفیت منحصر به فرد را در مورد مجموعه داده ها نشان می دهد - مکان، زمان و ارزش.

توجه: این تصویر به روز نشده است تا منعکس کننده جدیدترین UI باشد. صفحه داده دیگر ابعاد و اقدامات را به عنوان برچسب نشان نمی دهد.

س: چگونه می توانیم نقشه ای ایجاد کنیم که تعداد کل پرونده های مالاریا در هر کشور را از سال 2000 تا 2014 نشان دهد؟

پاسخ: از قسمت موارد گزارش شده استفاده کنید.

توجه: این تصویر به روز نشده است تا منعکس کننده جدیدترین UI باشد. صفحه داده دیگر ابعاد و اقدامات را به عنوان برچسب نشان نمی دهد.

اکنون به راحتی می توان فهمید که برای الجزایر در سال 2012، 55 به تعداد موارد گزارش شده اشاره دارد (زیرا می توانیم این ستون جدید را برچسب گذاری کنیم).

توجه: در این مثال، داده های گسترده از یک رکورد در هر کشور تشکیل شده است. با فرمت داده های بلند، اکنون 15 ردیف برای هر کشور (یک ردیف برای هر 15 سال در داده ها) وجود دارد. مهم است که به خاطر داشته باشید که اکنون چندین ردیف در هر کشور وجود دارد.

اگر ستونی برای Land Area وجود داشته باشد، آن مقدار برای هر یک از 15 ردیف برای هر کشور در یک ساختار داده بلند تکرار می شود. اگر نمودار میله ای را با آوردن کشور به سطرها و Land Area به ستون ایجاد کرده اید، به طور پیش فرض، نما مساحت زمین را برای تمام 15 ردیف در هر کشور جمع می کند.

برای برخی از فیلدها ممکن است لازم باشد مقادیر شمارش مضاعف با جمع کردن با میانگین یا حداقل به جای مجموع یا فیلتر کردن، جبران شود.

عادی سازی

پایگاه داده های رابطه ای از جدول های مختلفی تشکیل شده اند که می توانند به نوعی با هم مرتبط یا با هم مرتبط باشند. هر جدول شامل یک شناسه منحصر به فرد یا کلید در هر رکورد است. با ارتباط یا پیوستن به کلیدها ، سوابق را می توان برای ارائه اطلاعات بیشتر از آنچه در یک جدول واحد موجود است ، مرتبط کرد. آنچه در هر جدول اطلاعاتی وجود دارد به مدل داده مورد استفاده بستگی دارد ، اما اصل کلی در مورد کاهش تکثیر است.

به عنوان مثال ، برنامه ریزی رویداد را برای رویدادی مانند عروسی در نظر بگیرید. ما باید اطلاعات را در سطح گروه ها (مانند خانواده ها یا زوج ها) و همچنین سطح افراد پیگیری کنیم.

می توان یک جدول ایجاد کرد که تمام اطلاعات را با هم ترکیب می کند:

با این حال ، اگر یک آدرس نادرست باشد و باید برطرف شود ، باید در چندین ردیف ثابت شود ، که به طور بالقوه منجر به خطا یا درگیری می شود. ساختار بهتر ایجاد دو جدول است ، یکی برای اطلاعات مربوط به گروه (مانند آدرس و در صورت ارسال دعوت) و دیگری برای اطلاعات مربوط به افراد (برای مواردی مانند تکالیف صندلی و محدودیت های رژیم غذایی).

 

جدول گروهی جدول

ردیابی و تجزیه و تحلیل اطلاعات سطح گروه در جدول گروه و اطلاعات سطح فردی در جدول فردی بسیار ساده تر است. به عنوان مثال ، تعداد صندلی های مورد نیاز را می توان از تعداد شرکت کنندگان = بله سوابق موجود در جدول جداگانه بدست آورد و تعداد تمبرهای مورد نیاز برای تشکر را می توان از تعداد سوابق موجود در جدول گروهی که در آن هدیه ISN نیست ، بدست آورد. t تهی

فرآیند تقسیم تمام داده ها در جدول های مختلف - و مشخص کردن کدام جدول شامل کدام ستون ها است - عادی سازی نامیده می شود. عادی سازی به کاهش داده های اضافی کمک می کند و سازمان پایگاه داده را ساده می کند.

با این حال ، ممکن است مواقعی وجود داشته باشد که اطلاعات لازم باشد که دارای چندین جدول باشد. به عنوان مثال ، اگر بخواهیم ترتیب صندلی ها (افراد) را به گونه ای تعادل دهیم که گروه هایی از طرف عروس با گروه هایی از طرف داماد در هم آمیخته شوند؟(وابستگی پل یا داماد در سطح گروه ردیابی می شود.) برای دستیابی به این هدف ، ما باید جداول را به هم برگردانیم تا افراد با اطلاعات مربوط به گروه خود در ارتباط باشند. عادی سازی مناسب فقط جداول نیست ، بلکه نیاز به حضور یک زمینه مشترک ، مرتبط یا شناسه منحصر به فرد از آنچه می تواند برای ترکیب دوباره داده ها دوباره با هم استفاده شود ، نیاز دارد. در اینجا ، آن قسمت مرتبط گروهی است. این قسمت در هر دو جدول وجود دارد ، بنابراین ما می توانیم در این قسمت بپیوندیم و به قالب اصلی جدول اصلی خود برگردیم. این یک ساختار بی نظیر است.

پس چرا ما فقط جدول اصلی را حفظ نکردیم؟نگهداری از آن سخت تر است و اطلاعات اضافی را ذخیره می کرد. در مقیاس ، سطح تکثیر داده ها می تواند گسترده باشد. ذخیره کردن همان اطلاعات بارها و بارها کارآمد نیست.

جداول نرمال شده دارای چند ویژگی کلیدی هستند:

هر ردیف به یک شناسه منحصر به فرد نیاز دارد

هر جدول به یک ستون یا ستون نیاز دارد که می تواند برای اتصال آن به جداول دیگر (کلید) استفاده شود.

این ستون های مشترک (کلید) برای ارتباط یا پیوستن به جداول به هم استفاده می شوند. برای داده های ما ، بند رابطه یا پیوستن در هر جدول در قسمت گروه قرار دارد.

به انواع بپیوندید

اگرچه روش پیش فرض برای شانه کردن داده ها در دسک تاپ Tableau در ارتباط است ، مواردی وجود دارد که ممکن است بخواهید در میزهای دسک تاپ Tableau یا Tableau Prep Builder بپیوندید. برای یک مرور کلی از پیوندها و پیوستن به انواع ، به داده های خود بپیوندید.

داده های "مرتب"

هادلی ویکام مقاله ای را در سال 2014 در مجله نرم افزار آماری به نام "داده های مرتب" منتشر کرد (آگوست 2014 ، دوره 59 ، شماره 10). در این مقاله یک کار عالی برای ارائه چارچوبی برای داده هایی انجام می شود که برای تجزیه و تحلیل به خوبی ساختار یافته است. این مقاله را می توان در اینجا (نمونه کارها دانشگاهی هادلی ویکام) (لینک در یک پنجره جدید باز می کند) یا اینجا (میزبان r-project. org) (لینک در یک پنجره جدید باز می شود) یافت.

توجه: مقاله در وب سایت های خارجی میزبانی شده است. Tableau نمی تواند مسئولیت صحت یا طراوت صفحات نگهداری شده توسط ارائه دهندگان خارجی را به عهده بگیرد. اگر در مورد محتوای آنها سؤالی دارید با صاحبان تماس بگیرید.

فارکس وکسب درامد...
ما را در سایت فارکس وکسب درامد دنبال می کنید

برچسب : نویسنده : آرش اصل زاد بازدید : <-PostHit-> تاريخ : دوشنبه 25 ارديبهشت 1402 ساعت: 16:13