Начало / Член / Детайли

Как работеха методите на Фишър за обработка на липсващи данни?

Методите на Фишър за обработка на липсващи данни са крайъгълен камък в областта на статистическия анализ, предлагащи стабилни решения както за изследователи, така и за анализатори на данни. Като горд доставчик на продукти на Fisher, включителноФишър I2P-100иКонтролер на Fisher DLC3010, Станах свидетел от първа ръка въздействието на иновативния подход на Фишър към управлението на данните. В тази публикация в блога ще се задълбоча в тънкостите на методите на Фишър за обработка на липсващи данни, изследвайки как работят тези техники и тяхното значение при съвременния анализ на данни.

Разбиране на липсващи данни

Преди да се потопим в методите на Фишър, е важно да разберем естеството на липсващите данни. Липсващи данни могат да възникнат по различни причини, като грешки в въвеждане на данни, не -отговор при проучвания или неизправности в оборудването. Има три основни типа липсващи данни: липсващи напълно на случаен принцип (MCAR), липсващи на случаен принцип (MAR) и липсват не на случаен принцип (MNAR).

MCAR предполага, че вероятността да липсва точка от данни не е свързана както с наблюдаваните, така и с незабелязаните данни. MAR означава, че вероятността да липсва точка от данни зависи само от наблюдаваните данни. MNAR, от друга страна, възниква, когато вероятността да липсва точка от данни е свързана със самите незабелязани данни.

Максималната оценка на вероятността на Фишър

Един от ключовите методи, разработен за риболов за обработка на липсващи данни, е максималната оценка на вероятността (MLE). MLE е статистически метод, който намира стойностите на параметрите, които увеличават максимално функцията на вероятността, което е мярка за това колко добре статистическият модел отговаря на набор от данни.

Когато се занимава с липсващи данни, MLE подходът на Fisher предполага, че данните следват конкретно разпределение на вероятността. Например, при нормално разпределение функцията на вероятността се основава на средната стойност и дисперсията на данните. Целта е да се намерят стойностите на тези параметри, които правят наблюдаваните данни най -вероятно да са възникнали.

За да внедри MLE с липсващи данни, Фишър предложи итеративен процес. Първо се прави първоначално предположение за стойностите на параметрите. Тогава функцията на вероятността се изчислява въз основа на наблюдаваните данни и предполагаемото разпределение на вероятността. След това стойностите на параметрите се актуализират, за да се увеличи максимално функцията на вероятността. Този процес се повтаря, докато стойностите на параметрите се сближат, което означава, че те вече не се променят значително между итерациите.

ЕМ алгоритъмът

Друг важен принос от Фишър е алгоритъмът за очакване - максимизиране (EM), който е тясно свързан с MLE. ЕМ алгоритъмът е мощен инструмент за намиране на максимални оценки на вероятността при наличие на липсващи данни.

Алгоритъмът на ЕМ се състои от две стъпки: Е - стъпка (стъпка на очакване) и стъпка M - (стъпка на максимизиране). В етап E - алгоритъмът оценява липсващите данни въз основа на текущите стойности на параметрите. Това става чрез изчисляване на очакваните стойности на липсващите данни, дадени на наблюдаваните данни и оценките на текущите параметри.

В стъпката на M - алгоритъмът актуализира стойностите на параметрите, като увеличи максимално вероятността функцията, използвайки прогнозните липсващи данни от E - стъпката. След това алгоритъмът се редува между E -стъпката и M - стъпка до конвергенция.

ЕМ алгоритъмът е особено полезен, тъй като е гарантирано да се сближи до локален максимум от функцията на вероятността. Освен това е сравнително лесен за изпълнение и може да се приложи към широк спектър от статистически модели, включително линейна регресия, логистична регресия и факторна анализ.

Множество импутации

Идеите на Фишър също поставиха основата на концепцията за множествено импутация. Множеството импутация е метод, който създава множество правдоподобни стойности за всяка липсваща точка от данни. Вместо да използват една оценка за липсващите данни, множество импутации вземат предвид несигурността, свързана с липсващите стойности.

Процесът на множество импутации включва три основни стъпки. Първо, за генериране на множество набори от данни се използва статистически модел. Всеки импулсиран набор от данни е пълен набор от данни с липсващите стойности, заменени с правдоподобни стойности. Второ, анализът на интерес се извършва на всеки импултен набор от данни. И накрая, резултатите от множеството анализи се комбинират с помощта на конкретни правила за отчитане на несигурността, въведена от процеса на импутация.

I2P-100

Множеството импутация има няколко предимства. Той предоставя по -точни оценки от методите на единични импутации, тъй като отчита променливостта в липсващите данни. Той също така позволява използването на стандартни статистически методи за импровизирани набори от данни, което улеснява извършването на сложни анализи.

Значение при съвременния анализ на данните

В днешния свят - задвижван свят, методите на Фишър за обработка на липсващи данни са по -подходящи от всякога. С нарастващия обем и сложността на данните липсващите данни са често срещан проблем в много области, включително здравни грижи, финанси и социални науки.

Техниките на Фишър предоставят надеждни начини за справяне с липсващи данни, като гарантират, че статистическите анализи са валидни и точни. Например, в клинични изпитвания могат да се появят липсващи данни поради отпадане на пациента или непълно събиране на данни. Използвайки методите на Фишър, изследователите могат да анализират данните по -ефективно, намалявайки пристрастията и увеличавайки силата на изследването.

В контекста на нашите продукти за рибар, катоI2P-100, Тези методи могат да бъдат приложени за анализ на данните, събрани от устройството. Независимо дали става въпрос за наблюдение на индустриалните процеси или провеждането на научни експерименти, обработката на липсващи данни е от решаващо значение за вземане на информирани решения въз основа на данните.

Fisher I2P-100

Контакт за поръчки

Ако се интересувате да научите повече за продуктите на Fisher и как те могат да ви помогнат в анализа на вашите данни, включително да обработвате липсващи данни, ви каним да се свържете с нас за дискусия за обществени поръчки. Екипът ни от експерти е готов да ви помогне да намерите правилните решения за вашите специфични нужди.

ЛИТЕРАТУРА

  • Little, RJA, & Rubin, DB (2019). Статистически анализ с липсващи данни. Уайли.
  • McLachlan, GJ, & Krishnan, T. (2007). ЕМ алгоритъмът и разширенията. Уайли.
  • Rubin, DB (1987). Множество импутация за неотговаряне в проучванията. Уайли.

Изпрати запитване