Оснащение тестирования и основные этапы организации

Содержание

 

 

С.

Введение ………………………………………………………………

3

Глава 1. Теоретические основы теста, как диагностического метода ……………………………………………………………………..

 

4

1.1. История возникновения и использования теста как диагностического метода …………………………………………………………..

 

4

         1.2. Тест, как общенаучный диагностический метод………………

8

1.3. Структурные компоненты и критерии качества теста…………

10

Глава 2.Оснащение тестирования и основные этапы организации……………………………………………………………………

 

18

2.1. Организация и оснащение тестирования ………………………

18

2.2. Подготовка испытуемых к работе с тестом……………………..

2.3. Проблемы организации тестирования,  связанные с индивидуальными физиологическими особенностями человека……….

2.4. Порядок проведения  тестирования…………………………….

Заключение ………………………………………………………….     

Список использованных источников и  литературы …………..


20

 

22

23

26

29

 

 

 

   
   
   
   
   
   
   

 

Введение

Временем  возникновения теста как общенаучного диагностического метода считается конец XIX  века,  когда для изучения индивидуальных различий начинают применяться различные способы измерения. 

Тест –  это инструмент,  краткое стандартизованное испытание,  в основе которого лежит специально подготовленный набор заданий,  позволяющих объективно и надёжно оценить исследуемые качества на основе использования статистических методов. 

Цель курсовой работы – исследовать теоретические основы теста, как диагностического метода. Цели настоящего исследования конкретизируются в следующих задачах:

- узнать историю возникновения и использования теста, как диагностического метода;

- рассмотреть  структурные компоненты и критерии  качества теста;

- изучить  особенности организации и оснащения  тестирования;

- рассмотреть  этапы подготовки испытуемых  к работе с тестом;

- определить  порядок проведения тестирования;

- выявить  проблемы организации тестирования,  связанные с индивидуальными физиологическими особенностями человека.

            Анализ содержания определений теста позволяет сделать вывод,  что при всем внешнем разнообразии многочисленных определений,  понятие  «тест» рассматривается в трех аспектах:

- во-первых,  как инструмент теоретического исследования;

- во-вторых,  как метод эмпирического исследования;

- в-третьих, как средство, предназначенное не только для распознания качеств личности, но и для получения объективной количественной оценки. 

 

 

Глава 1 Теоретические основы теста, как диагностического метода

1.1 История возникновения и использования теста как диагностического метода

История возникновения и использования  теста как диагностического метода, (diagnostikos –  гр. –  способный распознавать [1,  с.160])  а,  точнее сказать,  ее предыстория уходит в глубь веков.  Имеются сведения,  что уже с III тысячелетия до н.э.  в странах Древнего Востока  (Египет,  Вавилон,  Индия, Китай)  использовались системы конкурсных испытаний интеллектуального характера,  предназначенные для отбора персонала на правительственные должности.  Большое значение изучению проблемы выявления различий в поведении и характере людей уделяли мыслители Античных государств.  В

трудах Гераклита,  Аристотеля,  Гиппократа,  Галена,  Теофраста приведены

различные диагностические  показатели особенностей личности: Гераклит (VI–V  вв.  до н.э.)  впервые указал на разницу между душой взрослого  человека и ребенка,  соотнеся познавательные способности человека со степенью

влажности души; Аристотель (IV в. до н.э.) впервые заговорил  о необходимости соотнесения педагогических методов с уровнем психического развития ребенка;  Гиппократ (V  в.  до н.э.)  выдвинул гипотезу,  согласно которой различия между людьми можно сгруппировать по нескольким общим признакам поведения,  тем самым,  заложив научную основу современной типологии; Гален (II в. до н.э.) развил учение о темпераменте как о пропорциях,

в которых  смешаны несколько основных  «соков»; популярное в течение веков сочинение Теофраста  «Этические характеры»  содержало описание отдельных типов характера. Многочисленные попытки систематизации различий между людьми и создание на этой основе адекватных методик для выявления индивидуальных особенностей предпринимались и в дальнейшем.  Однако все эти методы исследования вряд ли можно назвать тестами в современном понимании этого термина. 

Подлинно  научная разработка диагностических  методик началась в XIX веке с развитием экспериментальных подходов.  Под воздействием запросов практики:  медицины,  психологии,  педагогики,  а затем и промышленного производства,  как область экспериментальной науки,  начинает развиваться диагностика. На рубеже XX века зарождаются новые области научного знания: психодиагностика, психотехника, педология.  В медицине [1,  с.160]  диагностика определяется как раздел,  изучающий признаки болезней, методы исследования больного и принципы установления диагноза.

В психологии [2,  с.7]  диагностика –  это  область психологической науки  и одновременно важнейшая форма психологической практики, которая связана с постановкой психологического диагноза с использованием различных тестовых методик.

Применительно к промышленному производству [1,  с.160]  диагностика – установление и изучение признаков,  характеризующих состояние машин, приборов,  технических систем,  для предсказания возможных отклонений и предотвращения нарушений нормального режима их работы.

В психолого-педагогическом понимании [3,  с.27]  диагностика  – 

обследование  человека для определения уровня его развития,  выявления его способностей и возможностей воспитания и обучения. 

Временем  возникновения теста как общенаучного диагностического метода считается конец XIX  века,  когда для изучения индивидуальных различий начинают применяться различные способы измерения.  Так английский психолог Ф.  Гальтон,  воспользовавшись работами бельгийского статиста А. Кетле, разработал метод статического сравнения двух рядов переменных и ввёл индекс совместного отношения,  названный коэффициентом корреляции.

Важным  вкладом Гальтона в развитие теории тестов было определение трёх основных принципов:  применение серии одинаковых испытаний к большому количеству испытуемых;  статистическая обработка результатов;  выделение эталонов оценки. Все современные тесты построены на основе статистической теории измерений,  а идея эталона оценки лежит в основе определения тестов как стандартизированного инструмента. 

Значителен  вклад американского психолога  Дж.  Кеттелла в развитие идеи статистического анализа при определении индивидуальных различий.  Считая тест средством для проведения научного эксперимента,  он выделил ряд требований к его чистоте [4,  с.19].  Эти идеи в настоящее время составляют основу современной тестологии.  Так,  требование  «одинаковости условий для всех испытуемых»  положено в основу принципа стандартизации процедуры проведения тестирования; «ограничение времени» используется в зависимости от целей тестирования; «отсутствие зрителей в лаборатории»  реализуется как учет влияния внешних факторов; идея «статистической обработки результатов» отражается в методах статистического анализа. 

С начала XX  века наметилось педагогическое направление в развитии

тестологии.  Американец В.А.  Макколл разделил тесты на педагогические

(Educational Test)  и психологические (Intelligence Test).  Основной задачей

педагогических  тестов являлось измерение успешности учащихся по тем или

иным школьным дисциплинам за определённый период обучения.  Макколл

обосновал цель использования педагогических тестов – объединение в группы учащихся, усваивающих равный по объёму материал с одинаковой скоростью [5,  с.4].  Однако основоположником педагогических измерений считается американский психолог Э.  Торндайк.  Ему принадлежит разработка первого педагогического теста и книга  «Введение в теорию психологии и социальных измерений» (1904). В 1915–1930 годы в Америке социальные измерения нашли особо широкое распространение, и этот период характеризуется как настоящий бум в развитии тестологии.

Распространение психолого-педагогической диагностики  в России связано с возникновением в 20-е годы XX века новой науки – педологии, которую Л.С. Выготский [6]  определял как науку о целостном развитии ребенка. Психологические службы в школах того периода,  в силу особенностей понимания предмета педологии, «принимали комплексный характер, соединяя в себе черты психологической,  социологической и медико-биологической служб одновременно» [7, с.101]. 

После 1925  года тесты получили практическое значение,  и в Москве при педагогическом отделе Института методов школьной работы была создана особая тестовая комиссия.  В её задачи входила разработка стандартизированных тестов для советской школы.  И уже весной 1926  года были созданы такие тесты. Проблемой разработки тестов вплотную занимались

видные российские ученые:  М.С.  Бернштейн,  П.П.  Блонский,  А.П.  Болтунов, С.Г. Геллерштейн, Г.И. Залкинд, И.Н. Шпильрейн, А.М. Шуберт и др. 

Однако,  педология,  претендовавшая на комплексный  подход к изучению ребенка,  активно  (и нередко агрессивно)  вторгалась в педагогическую практику,  в том числе в ее  «святая святых» –  в проблематику оценки

результатов обучения и воспитания [8, с.39]. Начало 30-х годов прошлого века стало временем массового использования тестов и, к глубокому сожалению, их неконтролируемого применения в народном образовании.  Мнимая простота определения уровня интеллекта с помощью тестирования, лёгкость получения результатов и их толкование обусловили широкое использование тестов непрофессионалами.  Массовые тестовые обследования не подкреплялись серьёзной проверкой качества инструментария,  решения о переводе некоторых учащихся для умственно отсталых детей принимались на основе коротких тестов без учёта других факторов,  влияющих на результаты проверки [9,  с.29].  К тому же применявшиеся в массовой педагогической практике тесты умственной одарённости,  в основном Бине-Берита,  были слабо адаптированы к местным условиям и не вполне отвечали задачам,  для решения которых они предназначались [10, с.23].

Характеризуя  особенности этого периода,  следует  отметить,  что,  как и во всяком массовом движении,  в педологии уже в конце 20-х годов наметился разрыв между методологически мыслящими теоретиками и игнорирующими теорию практиками.  Теоретики педологии,  с целью определения причин отставания развития школьника, призывали к комплексному изучению ребенка, при котором главным источником информации является длительное программированное наблюдение,  дополняемое антропометрическими измерениями,  анкетированием,  тестированием и изучением школьной

документации. В педологической же практике утвердилось  массовое увлечение тестами как  «простым»  оперативным средством диагностики,  бессистемность изучения ребенка и, как следствие, частые ошибки в педологических диагнозах.

Еще в 1931  году педолог И.П. Шумский указывал на опасную тенденцию, что школьные педологи,  увлекаясь всевозможными антропометрическими измерениями при обследовании учащихся,  растворяли их психические особенности и свойства в биологической характеристике [7, с.102].

Принятое  в 1936  году постановление ЦК ВКП(б) «О педологических

извращениях с системе Наркомпроса» [11]  охарактеризовало педологию как

«враждебную марксизму лженауку»,  наложив  запрет на применение тестов и

анкет. Метод  тестирования был признан буржуазным орудием дискриминации учащихся и «изгнан» из советской школы. В дальнейшем в течение многих лет тестирование официально не признавалось объективным методом и не находило практического применения,  хотя сама идея педологии как

«комплексной  человековедческой науки»  была перспективна и актуальна.  Не случайно в 60-е годы ее вновь пришлось отстаивать школе Б.Г. Ананьева.

По мнению ведущих психологов СССР А.Н.  Леонтьева,  А.Р.  Лурии,  А.А. Смирнова [12],  это  постановление получило неправомерно расширенное толкование и послужило основой для свертывания исследований в области разработки диагностических методик и отказа от систематической психолого-педагогической диагностики. 

1.2 Тест как общенаучный  диагностический метод

            Слово «тест» (Р.  Пенто и М.  Гравитц)  произошло из старофранцузского языка и имеет синоним «чашка» (лат. testa – ваза из глины). Этим термином обозначали небольшие сосуды из обожжённой глины,  используемые алхимиками для проведения опытов [13, с.11]. 

В русском  языке в XIX  веке термин существовал  в двух значениях:

испытательная присяга,  английская религиозная  клятва,  которую каждый

вступающий  в общественную должность должен давать, чтобы доказать, что он не тайный католик; плоский плавильный сосуд для выделения олова из золота и серебра (Русский энциклопедический словарь, 1872) [14, с.158].

Скорее всего,  использование именно первого значения термина объясняет

тот факт,  что большинство современных  исследователей рассматривают

происхождение этого слова от английского (test –  испытание, исследование).

Ряд авторов  называют тест специальным или особым видом экспериментального метода [15,  с.21].  Иногда тест практикуют как испытательный эксперимент,  используемый наряду с лабораторным и естественным экспериментами [16,  с.21].  Не считая необходимым дискутировать по вопросу о том, является ли тестовый метод самостоятельным или частью экспериментального,  важно подчеркнуть,  что все методы исследования представляют собой систему,  в которой взаимодействуют экспериментальные и неэкспериментальные методы.  Экспериментальность метода определяется сущностью и целью исследования, а не его названием.  Анализ содержания определений теста позволяет сделать вывод,  что при всем внешнем разнообразии многочисленных определений,  понятие  «тест» рассматривается в трех аспектах:

- во-первых,  как инструмент теоретического исследования;

- во-вторых,  как метод эмпирического исследования;

- в-третьих, как средство, предназначенное не только для распознания качеств личности, но и для получения объективной количественной оценки. 

В литературе,  изданной после девяностого года,  встречается понятие

«неформальный тест»,  под которым понимается метод диагностики, конструируемый исследователем с целью фиксации результатов планируемого им эксперимента.  Отличительными признаками неформальных тестов от

методик,  разработанных профессиональными  тестологами,  являются отсутствие точности определения надёжности и валидности теста. Не владея элементарными знаниями и методиками классической теории тестов,  создатели неизбежно допускает серьёзные ошибки при их конструировании.  Недостаточное знание понятийно-терминологического аппарата приводит к тому,  что одно понятие употребляется в различных смыслах.  Так,  понятие  «тест»  довольно часто не дифференцируется по отношению к понятию  «тестовое задание»,  а последнее,  в свою очередь, употребляется в смысле «вопрос». 

Тест –  это инструмент,  краткое стандартизованное испытание,  в основе которого лежит специально подготовленный набор заданий,  позволяющих объективно и надёжно оценить исследуемые качества на основе использования статистических методов. 

1.3 Структурные компоненты  и критерии качества теста

Структурными компонентами теста  являются: тестовое задание – задача в тестовой форме,  предназначенная для выполнения,  к которой помимо содержания предъявляются требования тестовой формы и эталон – образец полного и правильного выполнения действия,  служащий для сравнения достигнутого уровня с планируемым. 

Поскольку тестовое задание –  это некоторая  задача,  которую проходится решать испытуемому,  то необходимо усвоить понятие задачи.  Под задачей понимается сформулированное для испытуемого задание по достижению определённой цели в известных условиях раннее изученными методами

деятельности [17, с.78].

При разработке и использовании уже готовых  тестов важно знать, насколько они соответствуют запроектированным целям.  Ответ на этот вопрос дают критерии качества теста,  на основании которых оценивается эффективность любого теста.  Важнейшими из таких показателей являются валидность и надёжность. 

Термин валидность  (англ. valid)  является трудно переводимым понятием и относится к тем категориям,  которые не имеют в русском языке адекватного перевода.  В силу этих обстоятельств «валидность»  трактуется довольно широко,  что зачастую приводит к некорректному использованию термина не только в практике, но и в теории. Причины этого кроются в том, что настоящим термином именуется ряд показателей, которые имеют между собой достаточно условную связь.  Так,  зачастую в отечественных исследованиях термин «валидность» употребляется как «надежность теста» и соотносится с точностью измерений.  В психологии валидность теста выступает в качестве важнейшего критерия его доброкачественности и определяется как адекватность и действенность теста.  В наиболее общей формулировке,  валидность рассматривается как характеристика теста,  указывающая на то,  что тест измеряет и насколько хорошо он это делает.  Исходя из этого,  тест считается валидным,  если он измерят то, для чего он предназначен. Параллельно с вышеуказанными трактовками имеет место и другое определение валидности.  Под последней понимается комплексная  характеристика теста, включающая сведения об области исследуемых явлений и репрезентативности диагностической процедуры по отношению к ним [18, с.31].

В.С. Аванесов [19, с.187] употребляет термин «валидность» как пригодность тестовых результатов для той цели,  ради которой проводилось тестирование. Однако толкует его достаточно широко – это и качество заданий, и их число в тесте, и глубина охвата содержания, и баланс распределения заданий в тесте по степени трудности. 

           По мнению ряда  исследователей,  наиболее адекватен этот термин в русском переводе как  «пригодный».  Так В.М. Кадневский отмечает [20,  с.195]: «Это, пожалуй, более близкий к сути аналог зарубежного термина».

Важно отметить, что термин  «валидность»  связан по многим параметрам с областью исследования и задачами диагностирования.  Как справедливо обращает внимание В.И. Тесленко [21,  с.192]: «Тест нельзя назвать валидным или невалидным без указания сферы его применения». 

Рассматривая  понятие  «валидность»,  необходимо отметить еще на один существенный момент –  относительный характер валидности.  Так А.Н. Майоров [13, с.72] указывает: «В общем виде понятие валидности раскрывает, насколько полученные результаты тестирования соответствуют объективной реальности, а поскольку отсутствует способ точного определения объективной  реальности, то валидность – понятие относительное, так как тесты, как и любой измерительный инструмент,  никогда не являются абсолютно эквивалентными реальному положению вещей.  Соответственно,  валидность устанавливается относительно характеристики, признака, величины, принимаемой (а не истинно являющейся) за объективную».

В современной  тестологии выделяются несколько видов  валидности, однако их толкование,  как и количество в разных исследованиях неоднозначно.  Не считая необходимым приводить характеристики для всех видов валидности, остановимся более подробно на тех,  которые имеют, на наш взгляд, наиболее существенное значение. 

Очевидная валидность – внешнее представление о тесте с точки зрения испытуемого.  Она определяет,  насколько адекватно впечатление о предмете измерения, которое формируется у испытуемого при знакомстве с инструкцией и материалом теста,  тому,  что данный инструмент в действительности выявляет.  Чем более тест выглядит измеряющим то,  для измерения чего он предназначен,  тем выше его очевидная валидность.  Эффективным методом повышения очевидной валидности является привлечение испытуемых к анализу теста,  что позволяет взглянуть на тест глазами тех,  для кого он предназначен.  Очевидная валидность может быть присуща тесту,  а может и не быть. Это зависит от целей исследования. Для большинства тестов очевидная валидность позитивное, либо нейтральное качество, поскольку, как правило, нет оснований скрывать от испытуемых реальные цели тестирования.

Содержательная валидность – основной показатель,  характеризующий степень репрезентативности содержания заданий теста по отношению к измеряемой характеристике. Она определяется на основе экспертных методов. Наибольшее распространение нашли такие способы экспертной оценки,  как метод коллективной оценки,  метод средневзвешенной оценки,  метод ранжирования и метод парного сравнения.  Не считая необходимым на них останавливаться, обратим лишь внимание на то, что в работах А.Н. Майорова [13] и В.И. Тесленко [21] эти методы рассмотрены достаточно подробно. Одним из удобных и широко применяемых на практике способов оценки

содержательной  валидности является метод расчета коэффициента корреляции без привлечения независимых экспертов. Для этой цели в экспериментальной группе проводят тестирование по разработанному тесту,  а затем,  выявленные результаты сравнивают с оценками,  полученными традиционным способом. После чего рассчитывается коэффициент корреляции. Если он составляет 0,9 и более, то валидность теста считается высокой, если же менее 0,7 – низкой. 

Функциональная валидность – показатель теста, близкий к содержательной валидности,  но имеющий свои особенности.  Он характеризует степень соответствия содержания заданий теста по отношению к выявляемому уровню усвоения опыта деятельности.  Задания,  предлагаемые в тесте,  должны быть решены соответствующими определенному уровню способами деятельности и не могут быть выполнены путем использования способов деятельности более низкого уровня. Функциональная валидность может быть присуща тесту только в том случае,  когда при составлении теста заранее планируется уровень его сложности. 

Прогностическая валидность – характеристика теста, отражающая степень точности и обоснованности суждения о диагностируемой переменной.  Для установления прогностической валидности теста изучаются корреляции между данными,  полученными в ходе проведенного исследования и результатами, полученными спустя определённое время.

Критериальная валидность – вид валидности,  направленный на выбор критерия,  по которому можно объективно оценивать результаты работы

испытуемых  с тестами.  Вопрос о выборе критерия является в этом виде валидности основным.  Критерий валидности теста –  это признак его обоснованности,  правомерности его применения как измерительного инструмента. Важнейшей характеристикой критерия валидности считается его объективность, которая состоит в его независимости от субъективных мнений.  Валидизация теста по критерию состоит в сравнении результатов тестирования с данными по критерию и вычислению коэффициента корреляции тестового результата с внешним критерием.  В качестве внешнего критерия обычно используется привычная пятибалльная шкала оценки и традиционные отметки,  выставляемые экспертом без использования теста.  После чего результаты тестирования и оценки экспертов коррелируются.  При получении согласованности между оценками экспертов и результатами тестирования считается, что тест обладает валидностью. Степень согласованности указывает на меру валидности. 

Вторым  критерием качества теста является его надежность, показывающая обеспечивает ли тест как измерительный инструмент объективность

результатов.  Использование ненадежных тестов,  допуск большого количества ошибок в таком ответственном деле,  каким является тестирование людей,  может стать причиной педагогических и административных ошибок,  последствия которых трудно исправить [13,  с.163]. Следовательно,  возникает необходимость более детального рассмотрения этого показателя.

В психологии термин надежность рассматривается  в двух значениях.  Под надёжностью в широком смысле понимается характеристика того,  в какой степени,  выявленные у испытуемых различия по тестовым результатам, являются отражением действительных различий в измеряемых свойствах и в

какой мере они могут быть приписаны случайным  ошибкам. В узком смысле,

под этой группой  показателей подразумевается степень  согласованности результатов теста, получаемых при первичном и повторном его применении, по

отношению к  тем же испытуемым в различные моменты времени с использованием разных  (но сопоставимых по характеру)  наборов тестовых заданий или при иных изменениях условий обследования.

В педагогике под надёжностью понимается характеристика теста, отражающая точность диагностических измерений,  а также устойчивость результатов теста к действию посторонних случайных факторов.  Степень надёжности теста определяется с помощью коэффициента надёжности (коэффициента корреляции – r),  который характеризует устойчивость показателей при повторных измерениях с помощью того же теста или его равноценного варианта. 

В зависимости  от условий,  влияющих на результаты теста,  выделяют

следующие типы характеристик надёжности.

Ретестовая надёжность. Этот показатель определяется путём повторного обследования испытуемых с помощью одного и того же теста через некоторый промежуток времени. Он вычисляется по соответствию результатов первого и второго обследований или по сохранению ранговых мест испытуемых в выборке при ретесте,  т.е.  выявляет характер корреляции между результатами двух проверок.  Коэффициент надёжности соответствует коэффициенту корреляции между полученными результатами. 

На практике ретестовая надежность определяется следующим  образом. Результаты первичного тестирования в порядке возрастания распределяют на шкале тестирования.  Эти данные принимают за истинный показатель. Теоретически это место для каждого участника должно быть постоянным, т.е. повторное тестирование должно дать такое же распределение мест на шкале, как и в первый раз.  В этом случае тест считается абсолютно надежным. Полученные отклонения являются основой для расчета коэффициента надежности.  Величина коэффициента надежности определяется величиной изменения оценок испытуемых на шкале в результате вторичного тестирования по сравнению с первичным.  Следовательно,  чем выше точность измерения первичного и вторичного тестирования,  тем выше надежность теста как измерительного инструмента.  Метод повторного тестирования обладает как достоинствами,  так и недостатками.  К числу достоинств относятся естественность и простота определения коэффициента надежности.  Основным недостатком метода является неопределенность в выборе интервала между двумя тестированиями. Разные исследователи рекомендуют проводить повторное тестирование в интервале от двух недель до шести месяцев.  Кроме того,  при повторном тестировании зачастую очень сложно,  а порой и вовсе невозможно создать идентичные с первым обследованием условия. Это связано с тем, что при всех, казалось бы,  равных условиях,  повторное испытание всегда отличается отпервого. 

Оснащение тестирования и основные этапы организации