Основы теории тестов. Презентация основы теории тестов по физической культуре

24.09.2019

Жизненный цикл продукта и тестирование

Все чаще в наше время используются итеративные процессы разработки ПО, в частности, технология RUP - Rational Unified Process (Рис. 1). При использовании такого подхода тестирование перестает быть процессом «на отшибе», который запускается после того, как программисты написали весь необходимый код. Работа над тестами начинается с самого начального этапа выявления требований к будущему продукту и тесно интегрируется с текущими задачами. И это предъявляет новые требования к тестировщикам. Их роль не сводится просто к выявлению ошибок как можно полнее и как можно раньше. Они должны участвовать в общем процессе выявления и устранения наиболее существенных рисков проекта. Для этого на каждую итерацию определяется цель тестирования и методы ее достижения. А в конце каждой итерации определяется, насколько эта цель достигнута, нужны ли дополнительные испытания, и не нужно ли изменить принципы и инструменты проведения тестов. В свою очередь, каждый обнаруженный дефект должен пройти через свой собственный жизненный цикл.

Рис. 1. Жизненный цикл продукта по RUP

Тестирование обычно проводится циклами, каждый из которых имеет конкретный список задач и целей. Цикл тестирования может совпадать с итерацией или соответствовать ее определенной части. Как правило, цикл тестирования проводится для конкретной сборки системы.

Жизненный цикл программного продукта состоит из серии относительно коротких итераций (Рис. 2). Итерация - это законченный цикл разработки, приводящий к выпуску конечного продукта или некоторой его сокращенной версии, которая расширяется от итерации к итерации, чтобы, в конце концов, стать законченной системой.

Каждая итерация включает, как правило, задачи планирования работ, анализа, проектирования, реализации, тестирования и оценки достигнутых результатов. Однако соотношения этих задач может существенно меняться. В соответствие с соотношением различных задач в итерации они группируются в фазы. В первой фазе - Начало - основное внимание уделяется задачам анализа. В итерациях второй фазы - Разработка - основное внимание уделяется проектированию и опробованию ключевых проектных решений. В третьей фазе - Построение - наиболее велика доля задач разработки и тестирования. А в последней фазе - Передача - решаются в наибольшей мере задачи тестирования и передачи системы Заказчику.

Рис. 2. Итерации жизненного цикла программного продукта

Каждая фаза имеет свои специфические цели в жизненном цикле продукта и считается выполненной, когда эти цели достигнуты. Все итерации, кроме, может быть, итераций фазы Начало, завершаются созданием функционирующей версии разрабатываемой системы.

Категории тестирования

Тесты существенно различаются по задачам, которые с их помощью решаются, и по используемой технике.

Категории тестирования	Описание категории	Виды тестирования
Текущее тестирование	Набор тестов, выполняемый для определения работоспособности добавленных новых возможностей системы.	нагрузочное тестирование; тестирование бизнес циклов; стрессовое тестирование.
Регрессионное тестирование	Цель регрессионного тестирования заключается в проверке того, что добавления к системе не уменьшили ее возможностей, т.е. тестирование проводится согласно требованиям, которые уже были выполнены перед добавлением новых возможностей.	нагрузочное тестирование; тестирование бизнес циклов; стрессовое тестирование.

Подкатегории тестирования

Подкатегории тестирования	Описание вида тестирования	Подвиды тестирования
Нагрузочное тестирование	Применяется для тестирования всех без исключения функций приложения. В данном случае последовательность тестирования функций не имеет значения.	функциональное тестирование; тестирование интерфейса; тестирование БД
Тестирование бизнес циклов	Применяется для тестирования функций приложения в последовательности их вызова пользователем. Например, имитация всех действия бухгалтера за 1 квартал.	unit-тестирование (модульное тестирование); функциональное тестирование; тестирование интерфейса; тестирование БД.
Стрессовое тестирование	Применяется для тестирования Производительности приложения. Цель данного тестирования - определить рамки стабильной работы приложения. При данном тестирование производится вызов всех доступных функций.	unit-тестирование (модульное тестирование); функциональное тестирование; тестирование интерфейса; тестирование БД.

Подкатегории тестирования

Описание вида тестирования

Подвиды тестирования

Нагрузочное тестирование

Применяется для тестирования всех без исключения функций приложения. В данном случае последовательность тестирования функций не имеет значения.

функциональное тестирование;
тестирование интерфейса;
тестирование БД

Тестирование бизнес циклов

Применяется для тестирования функций приложения в последовательности их вызова пользователем. Например, имитация всех действия бухгалтера за 1 квартал.

unit-тестирование (модульное тестирование);
функциональное тестирование;
тестирование интерфейса;
тестирование БД.

Стрессовое тестирование

Применяется для тестирования

Производительности приложения. Цель данного тестирования - определить рамки стабильной работы приложения. При данном тестирование производится вызов всех доступных функций.

unit-тестирование (модульное тестирование);
функциональное тестирование;
тестирование интерфейса;
тестирование БД.

Виды тестирования

Unit-тестирование (модульное тестирование) - данный вид подразумевает тестирование отдельных модулей приложения. Для получения максимального результата тестирование проводится одновременно с разработкой модулей.

Функциональное тестирование - цель данного тестирования состоит в том, чтобы убедиться в надлежащем функционировании объекта тестирования. Тестируется правильность навигации по объекту, а также ввод, обработка и вывод данных.

Тестирование БД - проверка работоспособности БД при нормальной работе приложения, в моменты перегрузок и многопользовательском режиме.

Unit-тестирование

Для ООП обычная организация модульного тестирования заключается в тестировании методов каждого класса, затем класса каждого пакета и.т.д. Постепенно мы переходим к тестированию всего проекта, а предыдущие тесты носят вид регрессионных.

В выходную документацию данных тестов входят тестовые процедуры, входные данные, код, исполняющий тест, выходные данные. Далее представлен вид выходной документации.

Функциональное тестирование

Функциональное тестирование объекта тестирования планируется и проводится на основе требований к тестированию, заданных на этапе определения требований. В качестве требований выступают бизнес-правила, диаграммы use-case, бизнес-функции, а также при наличии, диаграммы активности. Цель функциональных тестов состоит в том, чтобы проверить соответствие разработанных графических компонентов установленным требованиям.

Данный вид тестирования не может быть полностью автоматизирован. Следовательно, он подразделяется на:

Автоматизированное тестирование (будет использоваться в случае, где можно проверить выходную информацию).

Цель: протестировать ввод, обработку и вывод данных;

Ручное тестирование (в остальных случаях).

Цель: тестируется правильность выполнения пользовательских требований.

Необходимо исполнить (проиграть) каждый из use-case, используя как верные значения, так и заведомо ошибочные, для подтверждения правильного функционирования, по следующим критериям:

продукт адекватно реагирует на все вводимые данные (выводятся ожидаемые результаты в ответ на правильно вводимые данные);
продукт адекватно реагирует на неправильно вводимые данные (появляются соответствующие сообщения об ошибках).

Тестирование БД

Цель данного тестирования - убедиться в надежности методов доступа к базам данных, в их правильном исполнении, без нарушения целостности данных.

Необходимо последовательно использовать максимально возможное число обращений к базе данных. Используется подход, при котором тест составляется таким образом, чтобы «нагрузить» базу последовательностью, как верных значений, так и заведомо ошибочных. Определяется реакция БД на ввод данных, оцениваются временные интервалы их обработки.

Математические основы теории конструирования тестов

Типы тестовых заданий

Существует две существенно отличающихся формы заданий: закрытые (когда испытуемому для выбора предлагаются варианты ответов) и открытые (испытуемый должен получить ответ самостоятельно). Открытые задания, в свою очередь, можно разделить на две группы:

задания с кратким регламентируемым ответом, формулировка которых должна порождать только один, запланированный разработчиком, ответ;

задания со свободно конструируемым ответом, не имеющие никаких ограничений на содержание и форму представления ответов.

Выделяют пять основных типов заданий. Все остальные типы являются вариациями или комбинациями этих пяти типов.

Задание с выбором. Текст задания состоит из вопроса. Для выбора предлагаются несколько вариантов ответа, из которых один или несколько являются правильными.

Задание на дополнение. В формулировке зада-ния пропущен некоторый фрагмент текста, который указыва-ется подчерком (или несколькими подчерками одинаковой длины, если пропущенных слов несколько). Пропуск может быть в любой части текста, но рекомендуется делать его в конце. В ответе испытуемый должен написать пропущенные слова.

Задание на установление правильной последовательности.

Задание на установление соответствия. Формулировка задания содер-жит два перечня. Слева, как правило, приводятся элементы множества, содержащие постановку проблемы, справа – элементы, подлежащие выбору. Элементы левого множества нумеруются, правого – обозначаются буквами. Желательно, чтобы второе множество содержало большее число элементов по сравнению с первым множеством. При этом каждому эле-менту первого множества соответствует один или несколько элементов второго множества.

Задание с развернутым ответом.

Этапы разработки теста

Формулировка цели и объекта исследования.

Кто, что и почему подлежит тестированию

Разработка содержания тестирования.

Изучение требований образовательного стандарта, содержания учебников.

Составление спецификации теста:

Выделение разделов (тем) и их процентного содержания в тесте

Выбор типов заданий

Определение уровней овладения знаниями и умениями:

1 уровень	Знание определений основных понятий дисциплины, а также основных утверждений о методах дисциплины
2 уровень	Знание основных формул и алгоритмов; умение применять их при решении стандартных задач
3 уровень	Применение полученных знаний для решения нетипичных задач

Определение примерного количества заданий в тесте и распределение этого количества по типам заданий.

Разработка заданий.

Поскольку первый вариант теста должен выявить недостатки заданий (в том числе и предложенных дистракторов), то в каждом задании предлагалось возможно наибольшее число дистракторов, чтобы при выбраковке их осталось достаточное количество.

Экспертиза сырого теста.

Целью экспертизы является выявление и исправление некорректных и непонятных формулировок. В результате из теста могут быть удалены какие-либо задания (поэтому рекомендуется заданий).

Апробация.

Расчет характеристик заданий и теста.

По результатам тестирования проводят расчет следующих статистических характеристик заданий и теста.

Размах индивидуальных баллов измеряет расстояние, в пределах которого изменяются все значения показателя в распределении (индивидуальных баллов).

Среднее выборочное (среднее арифметическое ) для совокупности индивидуальных баллов Х 1 , Х 2 , …, Х K группы K испытуемых вычисляется по формуле

Подсчет дисперсии основан на вычислении отклонений каждого значения показателя от среднего арифметического в распределении:

Низкая дисперсия указывает на низкое качество теста, поскольку слабая вариация результатов говорит о слабой дифференциации испытуемых по уровню подготовки. Излишне высокая дисперсия характерна для случая, когда все учащиеся различны по числу выполненных заданий, что также требует переработки теста.

Завершает расчёт характеристик теста оценка надёжности теста. Для вычисления коэффициента надёжности можно использовать формулу коэффициента Кьюдера-Ричардсона (только в случае, когда все веса заданий равны единице) :

Чтобы по значению коэффициента дать качественную оценку надежности теста, используют следующую таблицу:

Значение коэффициента надежности	Оценка надежности
	неудовлетворительная
	удовлетворительная

	отличная

Оценка трудности j-го задания рассчитывается по формуле

Заметим, что чем легче задание, тем больше будет доля правильных ответов на него (p j ), поэтому естественнее было бы интерпретировать эту долю как легкость задания. В хорошо сбалансированном по трудности тесте должно быть несколько трудных заданий, несколько легких, но основная масса заданий должна иметь трудность от 0,3 до 0,7; при этом желательно, чтобы за-да-ния располагались в порядке воз-рас-та-ния их трудности.

Валидность заданий теста определяется степенью соответствия задания цели дифференциации испытуемых. Для этого определяются коэффициенты корреляции оценки за задание с баллом по всему тесту. Это делается с помощью коэффициента корреляции по формуле

где X i  тестовый балл i -го испытуемого, Y i  балл i -го испытуемого за задание. Заметим, что в случае дихотомического оценивания задания расчёт коэффициента несколько упрощается . Если r < 0, то задание следует удалить из теста, т. к. в нем побеждают слабые ученики, а сильные выбирают неверный ответ либо пропускают задание при выполнении теста. Положительные значения, но близкие к нулю (незначимые), указывают на низкую прогностическую способность задания теста; такие задания требуют доработки содержания.

Способность дифференцировать испытуемых на лучших и худших показывает коэффициент дифференцирующей способности (или индекс дискриминативности ) задания. Самый простой способ вычисления такого индекса называется методом контрастных групп и заключается в следующем. Из всей группы испытуемых выделяется некоторая часть лучших по результатам выполнения теста испытуемых (будем называть их сильной подгруппой) и столько же худших (слабая подгруппа). Затем для каждой из этих подгрупп вычисляется доля правильных ответов в подгруппе. Обозначим через p 1 j долю правильных ответов на j -е задание в сильной подгруппе, а через p 0 j – долю правильных ответов в слабой подгруппе. Тогда индекс дискриминативности i -го задания определяется по формуле:

(r дис) j = p 1 j – p 0 j .

Для задания, с которым справились все сильные испытуемые, и не справился ни один слабый, индекс дискриминативности r дис будет равен 1; в этом случае задание обладает максимальным дифференцирующим эффектом. Для задания, с которым справились все слабые испытуемые, и не справился ни один сильный, индекс дискриминативности будет равен –1. В остальных случаях индекс будет принимать значения между –1 и 1. Задания с нулевым и отрицательным значением индекса дискриминативности плохо дифференцируют учащихся, поэтому должны быть удалены из теста. Если индекс положителен, но меньше 0,2 , то такое задание требует тщательного анализа содержания.

Согласно этим характеристикам какие-то задания могут быть удалены из теста, какие-то подлежат исправлению. После этого должны быть повторены этапы 5, 6.

Формулы для вычисления вероятности угадывания

При составлении теста нужно определить, сколько ответов следует предлагать на каждый вопрос, чтобы вероятность успешно пройти тестирование, просто угадав правильные ответы, была меньше 0,05 (т.е. меньше 5%). Тестирование будем считать успешно пройденным, если тестируемый верно отвечает не менее, чем на Q % вопросов. Если тест включает N вопросов, то для вычисления вероятности “успешного угадывания” используется следующая формула :

где m - число ответов, предлагаемых на каждый вопрос.

В случае, когда количество предлагаемых ответов на вопросы в разных заданиях различно, формула имеет более сложный вид:

где - вероятность угадывания ответов на j вопросов, которая вычисляется следующим образом. Пусть все вопросы в тесте можно разделить на r групп так, что в одну группу объединены вопросы с одинаковой вероятностью угадывания. Обозначим p i , 0< p i <1 - вероятность угадывания и k i - количество вопросов в i - той группе (
) , причем

Тогда для j от
до N:

где t r = j  (t 1 + t 2 +…+ t r -1) , причем если t r > k r , то будем считать
= 0 .

Примеры.

N=10, Q=2/3: m=2, P<0,2; m=3, P<0,02; m=4, P<0,004

Литература

Челышкова М. Б. Теория и практика конструирования педагогических тестов: Учебное пособие. – М.: Логос, 2002. – 432 с.

Малыгин А. А., Светцов В. И., Щаницина С. В. Практические рекомендации к составлению контрольно–измерительных материалов: Метод. пособие / Иван. гос. хим.–технол. ун-т. – Иваново, 2005. – 30 с.

Как составить тест // Слойер К. Математические фантазии. - М.: Мир, 1993. - с.116-118.

Основные вопросы: Тест как инструмент измерения. Основные теории тестирования. Функции, возможности и ограничения тестирования. Применение тестов в оценке персонала. Преимущества и недостатки использования тестов. Формы и виды тестовых заданий. Технология построения задания. Оценка качества теста. Достоверность и валидность. Программное обеспечение для разработки тестов. 2

Тест как инструмент измерения Основные понятия в тестологии: измерение, тест, содержание и форма заданий, надежность и валидность результатов измерения. Кроме того, в тестологии используются такие понятия статистической науки, как выборочная и генеральная совокупность, средние показатели, вариация, корреляция, регрессия и др. 4

Тестовое задание - это дидактически и технологически эффективная единица контрольного материала, часть теста, которая отвечает требованиям предметной чистоты содержания (или одномерности), содержательной и логической правильности, правильности формы, приемлемости геометрического образа задания. 6

Традиционный тест представляет собой стандартизованный метод диагностики уровня и структуры подготовленности. В таком тесте все испытуемые отвечают на одни и те же задания, в одинаковое время, в одинаковых условиях и с одинаковыми правилами оценивания ответов. Для достижения цели тестирования можно создать бесчисленное количество тестов, и все они могут соответствовать достижению поставленной задаче. 8

Профессиограмма (от лат. Professio специальность + Gramma запись) система признаков, описывающих ту или иную профессию, а также включающая в себя перечень норм и требований, предъявляемых этой профессией или специальностью к работнику. В частности, профессиограмма может включать в себя перечень психологических характеристик, которым должны соответствовать представители конкретных профессиональных групп. 9

Основные теории тестирования Первые научные труды по теории тестов появилась в начале ХХ века, на стыке психологии, социологии, педагогики и других, так называемых поведенческих наук. Зарубежные психологи называют эту науку психометрикой (Psychometrika), а педагоги - педагогическим измерением (Educational measurement). Незамутненная идеологией и политикой, интерпретация названия « тестология » проста и прозрачна: наука о тестах. 10

Первый этап - предыстория - с древности до конца XIX века, когда были распространены донаучные формы контроля знаний и способностей; второй период, классический, продолжался с начала 20- х до конца 60- х годов, в течение которого создавалась классическая теория тестов; третий период - технологический - начавшийся с 70- х годов - время разработки методов адаптивного тестирования и обучения, методологию эффективной разработки тестов и тестовых заданий для параметрической оценки испытуемых по измеряемому латентному качеству. 11

Функции, возможности и ограничения тестирования Применяемые при отборе тесты предназначены для того, чтобы получить психологический портрет кандидата, оценить его способности, а также профессиональные знания и навыки. Тесты позволяют сравнивать кандидатов между собой или с эталонами, то есть идеальным кандидатом. Тесты используются для измерения качеств человека, необходимых для результативного выполнения работы. Некоторые тесты устроены таким образом, чтобы работодатель сам администрировал тестирование и подсчитывал результаты. Другие требуют услуг опытных консультантов, чтобы обеспечить их правильное применение. 12

Ограничения использования тестов связаны - с их дорогим администрированием; - с пригодностью для оценки способностей человека; - тесты более успешны для прогнозирования успешности в работе, которая содержит короткие по времени профессиональные задачи, и не очень удобны в случаях, когда задачи, решаемые на работе, занимают несколько дней или недель. 13

2. Используемая терминология должна быть подобрана в расчете на конкретную целевую аудиторию. Также нужно исключить излишние статьи или статьи, включающие два или более вопроса, так как они иногда сбивают с толку респондента и затрудняют интерпретацию. 17

3. Чтобы удовлетворить всем этим требованиям, следует просмотреть весь банк вопросов статью за статьей и проанализировать, какой цели служит каждая из них. Например, если тест разрабатывается для измерения аналитических способностей стажеров - бухгалтеров, стоит подумать, что в этом случае означает понятие « аналитические способности ». 18

5. Когда вопросы и форматы подсчета результатов выбраны, их нужно преобразовать в удобный для пользователя формат, с ясно написанными инструкциями и вопросами - примерами; так, чтобы выполняющие тест кандидаты полностью понимали, что от них требуется. 20

6. Очень часто на этом этапе разработки в тест включают больше вопросов, чем нужно. По некоторым оценкам, в три раза больше, чем останется в окончательном тесте или системе измерения. Тогда исходной мерой станет проверка разрабатываемого теста на относительно широкой выборке из числа существующих работников, чтобы убедиться в том, что все вопросы легко понятны. 21

7. Тесты на определение знаний обычно начинаются с простых вопросов, постепенно усложняющихся к концу. Когда тесты предназначаются для измерения социальных установок и личностных характеристик, возможно, будет полезным чередовать негативно и позитивно сформулированные статьи, чтобы избежать непродуманных ответов. 22

8. Последний этап представляет собой применение теста на широкой репрезентативной выборке, чтобы установить нормы выполнения, достоверности и валидности еще до начала его использования в качестве инструмента отбора. Кроме того, необходимо определить справедливость теста, чтобы убедиться, что он не дискриминирует никакие подгруппы населения (например, этническим отличиям). 23

Оценка качества теста Чтобы методы отбора были достаточно результативными они должны быть надежными, валидными и достоверными. Достоверность метода отбора характеризуется его неподверженностью систематическим ошибкам при измерении, то есть его состоятельности при разных условиях. 24

На практике достоверность при вынесении суждений достигается сравнением результатов двух и более аналогичных тестов, проведенных в разные дни. Другой путь повышения достоверности – сравнение результатов нескольких альтернативных методов отбора (например, тест и беседа). Если результаты сходны или одинаковы, можно считать их верными. 25

Надежность означает, что проведенные замеры дадут тот же результат, что и предыдущие, то есть на результаты оценки не влияют сторонние факторы. Валидность означает, что этот метод измеряет именно то, для чего он предназначен. Максимально возможная точность информации, получаемой специально разработанными методиками в научных исследованиях, ограничена техническими факторами и не превышает 0,8. 26

В практике отбора персонала отмечается, что надежность различных методов оценки располагается в интервалах: 0,1 – 0,2 – традиционное интервью; 0,2 – 0,3 – рекомендации; 0,3 – 0,5 – профессиональные тесты; 0,5 – 0,6 – структурированное интервью, интервью по компетенциям; 0,5 – 0,7 – когнитивные и личностные тесты; 0,6 – 0,7 – компетентностный подход (ассессмент - центр). 27

Под обоснованностью понимается то, с какой степенью точности данный результат, метод или критерий « предсказывает » будущую результативность тестируемого человека. Обоснованность методов относится к выводам, сделанным на основе той или иной процедуры, а не к самой процедуре. То есть метод отбора может сам по себе быть достоверным, но не соответствовать конкретной задаче: измерять не то, что требуется в данном случае. 28

Программное обеспечение для разработки тестов В отечественной практике представлены различные комплексные программы с модулем « Психодиагностика », например, программа «1 С: Зарплата и Управление Персоналом 8.0» с модулем « Психодиагностика », разработанная совместно с группой преподавателей кафедры психологии личности и общей психологии факультета психологии МГУ им. М. В. Ломоносова под руководством д. псих. наук, проф. А. Н. Гусева. Учебный тренажер для разработки систем оценки персонала и адаптации тестовых методик факультета психологии ТГУ, разработанный также на базе «1 С: Предприятие 8.2» фирмой Персонал Софт. 29

Литература: Отбор и найм персонала: технологии тестирования и оценки / Доминик Купер, Иван Т. Робертсон, Гордон Тинлайн. – М., изд - во « Вершина, – 156 с. Психологическое обеспечение профессиональной деятельности: теория и практика / Под ред. Проф. Г. С. Никифорова. – СПб.: Речь, – 816 с. 30

ГЛАВА 3. СТАТИСТИЧЕСКАЯ ОБРАБОТКА РЕЗУЛЬТАТОВ ТЕСТИРОВАНИЯ

Статистическая обработка результатов тестирования позволяет с одной стороны, объективно определить результаты испытуемых, с другой – оценить качество самого теста, тестовых заданий, в частности оценить его надежность. Проблеме надежности уделено много внимания в классической теории тестов. Эта теория не потеряла своей актуальности и в настоящее время. Несмотря на появление, более современных теорий, классическая теория продолжает сохранять свои позиции.

3.1. ОСНОВНЫЕ ПОЛОЖЕНИЯ КЛАССИЧЕСКОЙ ТЕОРИИ ТЕСТОВ

3.2. МАТРИЦА РЕЗУЛЬТАТОВ ТЕСТИРОВАНИЯ

3.3. ГРАФИЧЕСКОЕ ПРЕДСТАВЛЕНИЕ ТЕСТОВЫХ БАЛЛОВ

3.4. МЕРЫ ЦЕНТРАЛЬНОЙ ТЕНДЕНЦИИ

3.5. НОРМАЛЬНОЕ РАСПРЕДЕЛЕНИЕ

3.6. ДИСПЕРСИЯ ТЕСТОВЫХ БАЛЛОВ ИСПЫТУЕМЫХ

3.7. КОРРЕЛЯЦИОННАЯ МАТРИЦА

3.8. НАДЕЖНОСТЬ ТЕСТА

3.9. ВАЛИДНОСТЬ ТЕСТА

ЛИТЕРАТУРА

ОСНОВНЫЕ ПОЛОЖЕНИЯ КЛАССИЧЕСКОЙ ТЕОРИИ ТЕСТОВ

Создателем классической теории тестов (Classical Theory of mental tests) является известный британский психолог, автор факторного анализа, Чальз Эдвард Спирмен (Charles Edward Spearman) (1863-1945 г.) 1 . Он родился 10 сентября 1863 года, и четверть своей жизни прослужил в британской армии. По этой причине, степень доктора философии он получил только в возрасте 41 года 2 . Диссертационное исследование Ч.Спирмен выполнял в Лейпцигской лаборатории экспериментальной психологии под руководством Вильгельма Вундта (Wilhelm Wundt). В тот период на Ч.Спирмена сильное влияние оказали работы Фрэнсиса Гальтона (Francis Galton) по тестированию интеллекта человека. Учениками Ч.Спирмена были R.Cattell и D.Wechsler. В числе его последователей можно назвать A.Anastasi, J. P. Guilford, P.Vernon, C.Burt, A.Jensen.

Большой вклад в развитие классической теории тестов внес Льюис Гуттман (Louis Guttman, 1916-1987) 3 .

Всесторонне и полно классическая теория тестов впервые изложена в фундаментальном труде Гарольда Гулликсена (Gulliksen H., 1950 г.) 4 . С тех пор теория несколько видоизменялась, в частности совершенствовался математический аппарат. Классическая теория тестов в современном изложении приведена в книге Crocker L., Aligna J. (1986 г.) 5 . Из отечественных исследователей впервые описание этой теории дал В.Аванесов (1989 г.) 6 . В работе Челышковой М.Б. (2002 г.) 7 приведены сведения о статистическом обосновании качества теста.

Классическая теория тестов основывается на следующих пяти основных положениях.

1. Эмпирически полученный результат измерения (X) представляет собой сумму истинного результата измерения (T) и ошибки измерения (E) 8:

X = T + E (3.1.1)

Величины T и E обычно неизвестны.

2. Истинный результат измерения можно выразить как математическое ожидание E(X):

3. Корреляция истинных и ошибочных компонентов по множеству испытуемых равна нулю, то есть ρ TE = 0.

4. Ошибочные компоненты двух любых тестов не коррелируют:

5. Ошибочные компоненты одного теста не коррелируют с истинными компонентами любого другого теста:

Кроме этого, основу классической теории тестов составляют два определения – параллельных и эквивалентных тестов.

ПАРАЛЛЕЛЬНЫЕ тесты должны соответствовать требованиям (1-5), истинные компоненты одного теста (T 1) должны быть равны истинным компонентам другого теста (T 2) в каждой выборке испытуемых, отвечающих на оба теста. Предполагается, что T 1 =T 2 и, кроме того, равны дисперсии s 1 2 = s 2 2 .

Эквивалентные тесты должны соответствовать всем требованием параллельных тестов за исключением одного: истинные компоненты одного теста не обязательно должны равняться истинным компонентам другого параллельного теста, но отличаться они должны на одну и ту же константу с .

Условие эквивалентности двух тестов записывается в следующем виде:

где c 12 - константа различий результатов первого и второго тестов.

На основе приведенных положений построена теория надежности тестов 9,10 .

то есть, дисперсия полученных тестовых баллов равна сумме дисперсий истинных и ошибочных компонентов.

Перепишем это выражение в следующем виде:

(3.1.3)

Правая часть этого равенства представляет собой надежность теста (r ). Таким образом надежность теста можно записать в виде:

На основе этой формулы в последующем были предложены различные выражения для нахождения коэффициента надежности теста. Надежность теста представляет собой его важнейшую характеристику. Если неизвестна надежность, то результаты тестирования невозможно интерпретировать. Надежность теста характеризует его точность как измерительного инструмента. Высокая надежность означает высокую повторяемость результатов тестирования в одинаковых условиях.

В классической теории тестов важнейшей проблемой является определение истинного тестового балла испытуемого (T). Эмпирический тестовый балл (X) зависит от многих условий – уровня трудности заданий, уровня подготовленности испытуемых, количества заданий, условий проведения тестирования и т.д. В группе сильных, хорошо подготовленных испытуемых, результаты тестирования будут как правило, лучше,. чем в группе слабо подготовленных испытуемых. В этой связи остается открытым вопрос о величине меры трудности заданий на генеральной совокупности испытуемых. Проблема заключается в том, что реальные эмпирические данные получают на вовсе не случайных выборках испытуемых. Как правило, это учебные группы, представляющие собой множество учащихся достаточно сильно взаимодействующих между собой в процессе учения и обучающиеся в условиях, часто не повторяющихся для других групп.

Найдем s E из уравнения (3.1.4)

Здесь в явной форме показана зависимость точности измерения от величины стандартного отклонения s X и от надежности теста r .

ОТЧЕТ

студента 137 гр. Иванова И.

о проверке эффективности методики тренировки
с применением методов математической статистики

Разделы отчета оформляются в соответствии с образцами, приведенными в настоящем пособии в конце каждого этапа игры. Зачтенные отчеты хранятся на кафедре биомеханики до консультации перед экзаменом. Студенты, не отчитавшиеся за проделанную работу и не сдавшие тетрадь с отчетом преподавателю, к экзамену по спортивной метрологии не допускаются.

I этап деловой игры
Контроль и измерения в спорте

Цель:

1. Ознакомиться с теоретическими основами контроля и измерений в спорте и физическом воспитании.

2. Приобрести навыки измерения показателей скоростных качеств у спортсменов.

1. Контроль в физическом
воспитании и спорте

Физическое воспитание и спортивная тренировка – не стихийный, а управляемый процесс. В каждый момент времени человек находится в определенном физическом состоянии, которое определяется, главным образом, здоровьем (соответствием показателей жизнедеятельности норме, степенью устойчивости организма к неблагоприятным внезапным воздействиям), телосложением и состоянием физических функций.

Физическим состоянием человека целесообразно управлять, изменяя его в нужном направлении. Это управление осуществляется средствами физического воспитания и спорта, к которым, в частности, относятся физические упражнения.

Это только кажется, что преподаватель (или тренер) управляет физическим состоянием, воздействуя на поведение спортсмена, т.е. предлагая определенные физические упражнения, а также контролируя правильность их выполнения и получаемые при этом результаты. В действительности же поведением спортсмена управляет не тренер, а сам спортсмен. В ходе спортивной тренировки оказывается воздействие на самоуправляемую систему (организм человека). Индивидуальные различия в состоянии спортсменов не дают уверенности в том, что одно и то же воздействие вызовет одинаковую ответную реакцию. Поэтому актуален вопрос об обратной связи: информации о состоянии спортсмена, поступающей тренеру в ходе контроля тренировочного процесса.

Контроль в физическом воспитании и спорте базируется на измерениях показателей, отборе наиболее существенных и их математической обработке.

Управление учебно-тренировочным процессом включает в себя три стадии:

1) сбор информации;

2) ее анализ;

3) принятие решений (планирование).

Сбор информации обычно осуществляется во время комплексного контроля, объектами которого являются:

1) соревновательная деятельность;

2) тренировочные нагрузки;

3) состояние спортсмена.

Различают (В.А. Запорожанов) три типа состояний спортсмена в зависимости от длительности промежутка, необходимого для перехода из одного состояния в другое.

1. Этапное (перманентное) состояние. Сохраняется относительно долго – недели или месяцы. Комплексная характеристика этапного состояния спортсмена, отражающая его возможности к демонстрации спортивных достижений, называется подготовленностью, а состояние оптимальной (наилучшей для данного цикла тренировки) подготовленности – спортивной формой . Очевидно, что в течение одного или нескольких дней нельзя достигнуть состояния спортивной формы или утратить его.

2. Текущее состояние. Изменяется под влиянием одного или нескольких занятий . Нередко последствия участия в соревнованиях или выполненной на одном из занятий тренировочной работы затягиваются на несколько дней. В этом случае спортсмен обычно отмечает явления как неблагоприятного характера (например, мышечные боли), так и позитивного (например, состояние повышенной работоспособности). Такие изменения называют отставленным тренировочным эффектом .

Текущее состояние спортсмена определяет характер ближайших тренировочных занятий и величину нагрузок в них. Частный случай текущего состояния, характеризующийся готовностью к выполнению в ближайшие дни соревновательного упражнения с результатом, близким к максимальному, называется текущей готовностью .

3. Оперативное состояние. Изменяется под влиянием однократного выполнения физических упражнений и является временным (например, утомление, вызванное однократным пробеганием дистанции; временное повышение работоспособности после разминки). Оперативное состояние спортсмена изменяется в ходе тренировочного занятия и должно учитываться при планировании интервалов отдыха между подходами, повторными забегами, при решении вопроса о целесообразности дополнительной разминки и т.п. Частный случай оперативного состояния, характеризующийся немедленной готовностью к выполнению соревновательного упражнения с результатом, близким к максимальному, называется оперативной готовностью .

В соответствии с приведенной классификацией выделяют три основных вида контроля состояния спортсмена:

1) этапный контроль . Его цель – оценить этапное состояние (подготовленность) спортсмена;

2) текущий контроль . Его основная задача – определить повседневные (текущие) колебания в состоянии спортсмена;

3) оперативный контроль . Его цель – экспресс-оценка состояния спортсмена в данный момент.

Измерение или испытание, проводимое с целью определения состояния или способностей спортсмена, называется тестом . Процедура измерений или испытаний называется тестированием.

Любой тест включает в себя измерение. Но не всякое измерение служит тестом. В качестве тестов могут быть использованы лишь те, которые удовлетворяют следующим метрологическим требованиям :

2) стандартизация;

3) наличие системы оценок;

4) надёжность и информативность (добротность) тестов;

5) вид контроля (этапный, текущий или оперативный).

Тест, в основе которого лежат двигательные задания, называется двигательным. Существует три группы двигательных тестов:

1. Контрольные упражнения, выполняя которые спортсмен получает задание показать максимальный результат. Результатом теста является двигательное достижение. Например, время, за которое спортсмен пробегает дистанцию 100 м.

2. Стандартные функциональные пробы, в ходе которых задание, одинаковое для всех, дозируется либо по величине выполненной работы, либо по величине физиологических сдвигов. Результатом теста являются физиологические или биохимические показатели при стандартной работе либо двигательные достижения при стандартной величине физиологических сдвигов. Например, процент увеличения ЧСС после 20 приседаний или скорость, с которой бежит спортсмен при фиксируемой величине ЧСС 160 ударов в минуту.

3. Максимальные функциональные пробы, в ходе которых спортсмен должен показать максимальный результат. Результатом теста являются физиологические или биохимические показатели при максимальной работе. Например, максимальное потребление кислорода или максимальная величина кислородного долга.

Высококачественное тестирование предполагает знание теории измерений.