Центральная Научная Библиотека  
Главная
 
Новости
 
Разделы
 
Работы
 
Контакты
 
E-mail
 
  Главная    

 

  Поиск:  

Меню 

· Главная
· Биология
· Геология
· Зоология
· Коммуникации и связь
· Бухучет управленчучет
· Водоснабжение   водоотведение
· Детали машин
· Инновационный   менеджмент
· Качество упр-е   качеством
· Маркетинг
· Математика
· Мировая экономика МЭО
· Политология
· Реклама и PR
· САПР
· Биология и химия
· Животные
· Литература   языковедение
· Менеджмент
· Не Российское   законодательство
· Нотариат
· Информатика
· Исторические личности
· Кибернетика
· Коммуникация и связь
· Косметология
· Криминалистика
· Криминология
· Наука и техника
· Кулинария
· Культурология
· Логика
· Логистика
· Международное   публичное право
· Международное частное   право
· Международные   отношения
· Культура и искусства
· Металлургия
· Муниципальноое право
· Налогообложение
· Оккультизм и уфология
· Педагогика


Дипломная работа: Регресійний аналіз інтервальних даних

Дипломная работа: Регресійний аналіз інтервальних даних

МІНІСТЕРСТВО ОСВІТИ І НАУКИ УКРАЇНИ

ДНІПРОПЕТРОВСЬКИЙ НАЦІОНАЛЬНИЙ УНІВЕРСИТЕТ


ДИПЛОМНА РОБОТА

Регресійний аналіз інтервальних даних

Виконала: студентка групи МС-03-1

Припутень Ю.А.

Дніпропетровськ

2008


Реферат

Об’єкт дослідження: алгоритми регресійного аналізу пристосовані для обробки інтервальних даних.

Мета роботи: розробити програму, яка здійснює знаходження нтервалів для коефіцієнтів регресії. Програма повинна дозволяти подавати результати у вигляді зручному для користувачів, мати інтерфейс та бути зручною у користуванні.

Одержані висновки та їх новизна: в роботі був створений алгоритм для знаходження інтервальних оцінок коефіцієнтів та розроблено програмне середовище, що дозволяє досліджувати роботу цього алгоритму.

Результати дослідження можуть бути застосовані для обробки статистичної інформації.

Перелік ключових слів: лінійна регресія, метод найменших квадратів, інтервальні дані.


Зміст

Вступ

Розділ І. Лінійна багатовимірна регресія

Розділ ІІ. Довірч нтервали регресії. Похибка прогнозу

Розділ ІІІ. Лінійний регресійний аналіз інтервальних даних

3.1 Метод найменших квадратів для інтервальних даних

3.2 Метод найменших квадратів для лінійної моделі

3.3 Парна регресія

Розділ IV. Програмний продукт «Інтервальне значення параметрів»

4.1 Текст програми

4.2 Опис програми

4.3 Результати роботи програми

Висновки

Список використаних джерел

 


Вступ

 

Перспективний і швидко прогресуючий напрямок останніх років математична статистика інтервальних даних. Мова йде про розвиток методів математичної статистики в ситуації, коли статистичні дані - не числа, а нтервали, породжені накладенням помилок виміру на значення випадкових величин.

Дана дипломна робота складається з чотирьох розділів. Перш три розділі мають реферативний характер. В першому розділі викладені деяк поняття класичної теорії регресійного аналізу. В другому розділі розглянут довірчі інтервали для коефіцієнтів регресії. В третьому розділі наведені іде підходи лінійного регресійного аналізу інтервальніх даних. В четвертому розділ викладені результати дипломної роботи. Тут наведено алгоритм, текст та опис розроблених програм, які здійснюють знаходження нотни та оцінок коефіцієнтів регресії в класичному вигляді та в інтервальних даних.

За допомогою розроблених програм в цьому ж розділі наведено результати експериментального дослідження залежності величин інтервалів, як накривають коефіцієнти регресії в залежності від об’єму вибірки та величин нтервалів в яких знаходяться значення координат вибірки.

Програми створені за допомогою середовища Maple, так як воно по всім параметрам (швидкість, надійність, простота у використанні) підходить для написання цих програм.

Постановка задачі. В робот необхідно розв’язати такі задачі:

1. Розробити програму. Програма повинна працювати з вибірками довільної вимірності і довільними векторами найбільших похибок для кожної координати.

2. Провести чисельно дослідження залежності верхньої та нижньої меж інтервалів, що накривають коефіцієнти регресії, в залежності від об’єму вибірки і векторів найбільших похибок для кожної координати.


Розділ І. Лінійна багатовимірна регресія

Нехай- деяка випадкова величина, флуктує навколо деякого невідомого значення параметра , тобто , де- флуктуація або похибка. Наприклад, похибка може бути властива самому експерименту, або похибка може виникати при вимірювані невідомого параметра .

Припустимо тепер, що  можна представити у вигляді

де - відомі постійні величини, а  – невідом параметри, які потрібно оцінити.

Якщо величина  змінюється і при цьому змінна набуває значень , тобто можна записати

  (1.1)

У матричному вигляді, отримаємо:

Або


 (1.2)

де .

Означення: Матриця  розміру  називається регресійною матрицею. При цьому її елементи  обираються таким чином, щоб , тобто число лінійних незалежних стовпців дорівнювало , також матрицю  називають матрицею повного рангу.

Але в деяких випадках  приймає лише два значення 0, 1, тоді можливі випадки коли в матриці  деякі рядки або стовпц збігаються, тобто є лінійно – залежними. В цьому випадку  називають матрицею плану. Змінні  називають регресорами (j=1,…,p-1), або предикторними змінними, а  - називають відкликом.

Модель (1) або (2) лінійна відносно невідомих параметрів. Тому її називають лінійною моделлю.

Перед тим як оцінювати вектор , замітимо, що вся теорія будується для моделі (2).

Для оцінки невідомих параметрів  використовують метод найменших квадратів (МНК), який полягає в мінімізації суми квадратів залишків. Необхідно мінімізувати величину:

 (1.3)

за параметрами . Вираз (1.3) запишеться так:


 (1.4)

Шукаємо градієнт :

Розв’язуємо рівняння:

Таким чином

 (1.5)

Необхідно перевірити, що знайдена стаціонарна точка є точкою мінімуму функції . Справедлива така тотожність

Перевіримо цю рівність:


Ліва частина тотожності мінімальна якщо .

Регресію будемо позначати .

Залишок

Мінімальне значення суми квадратів залишків  називають залишковою сумою квадратів (RSS).

Застосуємо формулу (2.1), RSS перепишеться:

Якщо застосувати формулу (2.2), отримаємо:


.

Оцінки та єдині.


Розділ ІІ. Довірчі інтервали регресії. Похибка прогнозу

Нехай прогнозоване значення  визначається по рівнянню регрес з оціненими параметрами

 (2.1)

В силу того, що - незміщені оцінки деяких невідомих параметрів відповідного взаємозв'язку,  - одне з можливих значень прогнозованої величини при заданих значеннях , точніше - це оцінка середнього значення . Оскільки  випадкова величина, то і оцінка  також випадкова і має дисперсію. Визначимо її значення.

Використавши теорему про дисперсії суми залежних величин, одержимо:

Перепишемо у вигляді:

де - вектор заданих значень незалежних змінних. Звідки одержимо:


Оскільки значення  нам відомо, то введемо в останню формулу її оцінку , звідки дисперсія  буде:

 (2.2)

Таким чином, середнє значення лежить у межах:

 (2.3)


Розділ ІІІ. Лінійний регресійний аналіз інтервальних даних

Перейдемо до багатомірного статистичного аналізу. Спочатку з позиції асимптотичної математичної статистики інтервальних даних розглянемо оцінки методу найменших квадратів (МНК).

Статистичне дослідження залежностей - одне з найбільш важливих задач, які виникають у різних галузях науки й техніки. Під словами "дослідження залежностей" мається на увазі виявлення і опис існуючого зв'язку між досліджуваними змінами на підставі результатів статистичних спостережень.

Якщо яка-небудь група об'єктів характеризується змінними  і проведений експеримент, що складається з n досвідів, де в кожному досвіді ці змінн вимірюються один раз,то експериментатор одержує набір чисел: .

Але процес виміру не дає однозначний результат. Реально результатом виміру якої-небудь величини Х є два числа: - нижня границя і  - верхня границя. Причому , де  - стинне значення вимірюваної величини. Результат виміру можна записати як . Інтервальне число X може бути представлене іншим способом, а саме, , де . Тут  - центр інтервалу (як правило не співпада з ), а Δx - максимально можлива похибка виміру.

3.1 Метод найменших квадратів для інтервальних даних

Нехай математична модель задана:

  (3.1.1)


де х = (х1, х2,..., хm) - вектор впливаючих змінних, що піддаються виміру;  - вектор оцінюваних параметрів моделі; у - відгук моделі (скаляр); Q(x,)- скалярна функція векторів х ; і ε - випадкова похибка.

Нехай проведено n досвідів, причому в кожному досвід обмірювані (один раз) значення відгуку (у) і вектора факторів (х). Результати вимірів можуть бути представлені в наступному виді:

де Х - матриця значень обмірюваного вектора (х) в n досвідах; Y - вектор значень обмірюваного відгуку в n досвідах; Е - вектор випадкових помилок. Тоді виконується матричне співвідношення:

, (3.1.2)

де , причому  - n-мірні вектора, які становлять матрицю

Введемо міру близькості  між векторами  і . В МНК в якості  береться квадратична форма зважених квадратів  нев'язань

,

тобто


де  - матриця ваг, що не залежить від . Тоді як оцінка  можна вибрати таке , при якому міра близькості d(Y,Q) приймає мінімальне значення, тобто

.

У загальному випадку рішення цього екстремального завдання може бути не єдиним. Тому надалі будемо мати на увазі одне із цих рішень. Воно може бути виражене у вигляді:

причому  неперервні і дифференційовні по (Х,Y)  Z, де Z - область визначення функції f(X,Y). Ці властивості функції f(X,Y) дають можливість використати підходи статистики інтервальних даних.

Перевага методу найменших квадратів полягає в порівняльній простоті й універсальності обчислювальних процедур. Однак не завжди оцінка МНК самостійною, що обмежує його застосування на практиці.

Важливим частковим випадком є лінійний МНК, коли Q(x,) є лінійна функція від :

,

де  = 1, а  - вільний член лінійно комбінації. Як відомо, у цьому випадку МНК-оцінка має вигляд:


Якщо матриця  невироджена, то ця оцінка диною. Якщо матриця ваг W одинична, то

Нехай виконуються наступні припущення щодо розподілу похибок :

- помилки  мають нульов математичні очікування М{} = 0,

- результати спостережень мають однакову дисперсію D {} = ,

- помилки спостережень некорельовані, тобто .

Тоді, як відомо, оцінки МНК є найкращими лінійними оцінками, тобто спроможними і незміщеними оцінками, які являють собою лінійні функц результатів спостережень і мають мінімальні дисперсії серед безлічі всіх лінійних незміщених оцінок. Далі саме цей найбільше практично важливий окремий випадок розглянемо більш докладно.

Запишемо істині дані в наступній формі:

де R - індекс, що вказує на те, що значення істинне. Істині і обмірювані дані пов’язані таким чином:

де

Припустимо, що похибки виміру відповідають граничним умовам


 (3.1.3)

Нехай безліч W можливих значень  входить в Z - область визначення функції f(X,Y). Розглянемо  - оцінку МНК, розраховану за стинним значенням факторів і відгуку, і  - оцінку МНК, знайдену за відхиленими похибкам даних.

Тоді

Введемо поняття нотни.

Означення: Величину максимально можливого (по абсолютній величині) відхилення, викликаного похибками спостережень , відомого статистику значення f(y) від істинного значення f(x), тобто

Nf(x) = sup | f(y) - f(x) |,

де супремум береться по безлічі можливих значень вектора похибки , будемо називати нотною.

Якщо функція f має частинні похідні другого порядку, а обмеження на похибку мають вигляд

    (3.1.4)

причому  мало, то збільшення функції f з точністю до нескінченно малих більш високого порядку описується головним лінійним членом, тобто


Щоб одержати асимптотичний (при ) вираз для нотни, досить знайти максимум і мінімум лінійної функції (головного лінійного члена) на кубі, заданому нерівностями (4.1.4). Легко бачити, що максимум досягається, якщо покласти

а мінімум, що відрізняється від максимуму тільки знаком, досягається при . Отже, нотна з точністю до нескінченно малих більше високого

порядку має вигляд

  (3.1.5)

Цей вираз назвемо асимптотичною нотною.

Покладемо:

Будемо називати n(1) нижньою нотною, а n(2) верхньою нотною.

Припустимо, що при безмежному зростанні числа вимірів n, тобто при

 вектора n(1), n(2) прямують до постійних значень  відповідно. Тоді  будемо називати нижньою асимптотичною нотною, а - верхньою асимптотичною нотною.

Розглянемо довірчу множину  для вектора параметрів , тобто замкнута зв'язна множина точок в r-мірному евклідовому просторі така, що  де α - довірча ймовірність, що відповідає (α ≈ 1). Інакше кажучи,  є область розсіювання випадкового вектора  з довірчою ймовірністю α і числом досвідів n.

З визначення верхньої й нижньої нотни треба, щоб завжди

 

Відповідно до визначення нижньої асимптотичної нотни й верхньої асимптотичної нотни можна вважати, що  при досить великій кількост спостережень n. Цей багатомірний інтервал описує r-мірний гіперпаралелепіпед P.

Розіб'ємо P на L гіперпаралелепіпедів. Нехай  - внутрішня точка k-го гіперпаралелепіпеда. З огляду на властивості довірчої множини і спрямовуючи L до нескінченності, можна стверджувати, що

де

Таким чином, безліч C характеризує невизначеність при оцінюванні вектора . Його можна назвати довірчою множиною в статистиці інтервальних даних.

Введемо деяку міру М(X), що характеризує "величину" множини . По визначенню міри вона задовольняє умові: якщо


 і  то

Прикладом такої міри є площа для r = 2 і об’єма для r = 3. Тоді:

М(C) = М(P) + М(F),    (3.1.6)

де F = C \ P. Тут М(F) характеризує міру статистично невизначеності, у більшості випадків вона спадає при збільшенні числа досвідів n. У той же час М(P) характеризує міру інтервальної невизначеності, і, як правило, М(P) прагне до деякої постійної величини при збільшенні числа досвідів n. Нехай тепер потрібно знайти те число досвідів, при якому статистична невизначеність становить δ-ю частина загальної невизначеності, тобто

М(F) = δ М(C),            (4.1.7)

де δ < 1. Тоді, підставивши співвідношення (4.1.7) у рівність (4.1. 6) і вирішивши рівняння відносно n, одержимо шукане число досвідів. В асимптотичній математичній ста