Перейти к содержанию

Data (Данные)

AP Принципы информатики · Тема 2

Видеоурок по этой теме Открыть страницу видео
8:13

Data (Данные)

Включите песню. Что достигает вашего уха — это волна — гладкая, непрерывная, никогда не прыгающая от одного значения к следующему. Но ваш телефон не может хранить волну. Он может только…

Английское озвучивание · Английский + китайские субтитры (встроенные)

2.1

Двоичные числа

Программа

Ключевое понимание (DAT-1): То, как компьютер внутренне представляет данные, отличается от того, как эти данные интерпретируются и отображаются пользователю. Программы используются для преобразования данных в представление, которое легче воспринимать людьми.

Цель обучения DAT-1.A: Объяснить, как данные могут быть представлены с помощью битов. [Навык 3.C]

  • DAT-1.A.1 Значения данных могут храниться в переменных, списках элементов или отдельных константах и передаваться в качестве входа (или выхода) для процедур.
  • DAT-1.A.2 Вычислительные устройства представляют данные в цифровом виде, то есть наименьшими составляющими любого значения являются биты.
  • DAT-1.A.3 Бит — это сокращение от бинарный разряд и может принимать значение 0 или 1.
  • DAT-1.A.4 Байт равен 8 битам.
  • DAT-1.A.5 Абстракция — это процесс уменьшения сложности путем сосредоточения на главной идее. Скрывая детали, не относящиеся к текущему вопросу, и объединяя связанные и полезные детали, абстракция снижает сложность и позволяет сосредоточиться на сути.
  • DAT-1.A.6 Биты группируются для представления абстракций. К таким абстракциям относятся, но не ограничиваются ими, числа, символы и цвета.
  • DAT-1.A.7 Одна и та же последовательность битов может представлять разные типы данных в различных контекстах.
  • DAT-1.A.8 Аналоговые данные имеют значения, которые изменяются плавно, а не дискретными интервалами, во времени. Примерами аналоговых данных являются высота звука и громкость музыки, цвета картины или положение спринтера во время забега.
  • DAT-1.A.9 Использование цифровых данных для аппроксимации реальных аналоговых данных является примером абстракции.
  • DAT-1.A.10 Аналоговые данные можно близко аппроксимировать в цифровом виде с помощью метода выборки, который заключается в измерении значений аналогового сигнала через регулярные промежутки времени, называемые выборками. Измеряются выборки для определения точного количества битов, необходимого для хранения каждой выборки.

Цель обучения DAT-1.B: Объяснять последствия использования битов для представления данных. [Навык 1.D]

  • DAT-1.B.1 Во многих языках программирования целые числа представляются фиксированным количеством битов, что ограничивает диапазон допустимых значений целых чисел и математических операций над ними. Это ограничение может привести к переполнению или другим ошибкам.
  • DAT-1.B.2 Другие языки программирования предоставляют абстракцию, при которой размер представимых целых чисел ограничен только размером памяти компьютера; это относится к языку, определенному в справочном листе экзамена.
  • DAT-1.B.3 В языках программирования фиксированное количество битов, используемых для представления вещественных чисел, ограничивает диапазон и математические операции над этими значениями; это ограничение может привести к ошибкам округления и другим неточностям. Некоторые вещественные числа в хранилище компьютера представляются как приближения.
    • Исключение: Конкретные ограничения диапазонов для вещественных чисел выходят за рамки данной программы и экзамена AP.

Цель обучения DAT-1.C: Для двоичных чисел: a. Вычислите двоичный (основание 2) эквивалент положительного целого числа (основание 10) и обратно. [Навык 2.B] b. Сравнивать и упорядочивать двоичные числа. [Навык 2.B]

  • DAT-1.C.1 Числовые системы, включая двоичную и десятичную, используются для представления данных.
  • DAT-1.C.2 Двоичная система (основание 2) использует только комбинации цифр ноль и один.
  • DAT-1.C.3 Десятичная система (основание 10) использует только комбинации цифр $0 - 9$.
  • DAT-1.C.4 Как и в десятичной системе, позиция цифры в двоичной последовательности определяет её числовое значение. Числовое значение равно значению бита (0 или 1), умноженному на разрядное значение его позиции.
  • DAT-1.C.5 Разрядное значение каждой позиции определяется основанием, возведенным в степень этой позиции. Позиции нумеруются начиная с правойmost позиции с 0 и увеличиваются на 1 для каждой последующей позиции влево.

Источник: Описание курса и экзамена College Board AP

Двоичные цифры на дисплее — все цифровые данные в конечном итоге хранятся в виде 0 и 1
Двоичные цифры на дисплее — все цифровые данные в конечном итоге хранятся в виде 0 и 1

Компьютеры хранят всё как биты — каждый представляет собой 0 или 1. Группа из 8 бит образует байт. Числа хранятся в двоичной системе (основание 2), где каждое разрядное место соответствует степени двойки ($1, 2, 4, 8, 16, \dots$), вместо степеней десяти в десятичной системе. Например, двоичное число 1011 равно $8+2+1=11$.

Таблица позиций для 8-битовых чисел: единицы (1) расположены под значениями, которые складываются в число
Таблица разрядных значений для числа 8 бит: цифры 1 стоят под значениями, дающими сумму числа

Разбор примера. Чтобы перевести двоичное 1101 в десятичное, запишите разрядные веса 8 4 2 1 под битами 1 1 0 1 и сложите те, у которых есть 1: $8+4+0+1=13$. В обратную сторону, переведите 19 в двоичное, вычитая наибольшую степень двойки, которая помещается: $19-16=3$, затем $3-2=1$, затем $1-1=0$, поэтому единицы стоят на позициях 16, 2 и 1, образуя $\rightarrow$ 10011 (проверка: $16+2+1=19$).

Поскольку компьютер имеет конечное количество бит, он может представлять лишь ограниченный диапазон значений. Это вызывает два эффекта, которые проверяются на экзамене:

  • Ошибка переполнения: число, слишком большое для доступных бит, не может быть сохранено корректно.
  • Ошибка округления (округления): числа с дробной частью (вещественные числа) могут быть только приближенными, поскольку бесконечное множество вещественных значений должно отображаться на конечное множество битовых последовательностей.

Любые данные — текст, изображения, звук — в конечном итоге кодируются в двоичном виде. Изображение представляет собой сетку из пикселей, каждый из которых хранится как набор чисел для его цветов; звук хранится как набор чисел, взятых с дискретизацией множество раз в секунду.

Исследовать

Перевод между двоичной и десятичной системами

Компьютеры хранят числа в двоичном виде (основание 2). Каждый бит представляет степень двойки; сложите разрядные значения битов со значением 1, чтобы прочитать десятичное число.

English Русский
bits/bɪts/ битов
byte/baɪt/ байт
binary/ˈbaɪnəri/ бинарная
decimal/ˈdesɪml/ десятичный
Overflow error/ˌəʊvəˈfləʊ ˈerə/ Ошибка переполнения
Round-off (rounding) error/raʊnd ɒf ˈerə/ Ошибка округления
pixels/ˈpɪkslz/ пиксели
2.2

Сжатие данных

Программа

Ключевое понимание (DAT-1): То, как компьютер внутренне представляет данные, отличается от того, как эти данные интерпретируются и отображаются пользователю. Программы используются для преобразования данных в представление, которое легче воспринимать людьми.

Цель обучения DAT-1.D: Сравнивать алгоритмы сжатия данных, чтобы определить, какой из них лучше подходит в конкретном контексте. [Навык 1.D]

  • DAT-1.D.1 Сжатие данных может уменьшить размер (количество битов) передаваемых или хранимых данных.
  • DAT-1.D.2 Меньшее количество битов не обязательно означает меньший объем информации.
  • DAT-1.D.3 Степень уменьшения размера благодаря сжатию зависит как от степени избыточности в исходном представлении данных, так и от примененного алгоритма сжатия.
  • DAT-1.D.4 Алгоритмы без потерь обычно могут уменьшить количество битов, хранящихся или передаваемых, гарантируя полное восстановление исходных данных.
  • DAT-1.D.5 Алгоритмы с потерями могут значительно уменьшить количество битов, хранящихся или передаваемых, но позволяют восстановить только приближение исходных данных.
  • DAT-1.D.6 Алгоритмы сжатия с потерями обычно могут уменьшить количество битов, хранящихся или передаваемых, больше, чем алгоритмы без потерь.
  • DAT-1.D.7 В ситуациях, когда критически важны качество или возможность точного восстановления исходных данных, обычно выбирают алгоритмы сжатия без потерь.
  • DAT-1.D.8 В ситуациях, когда критически важно минимизировать размер данных или время передачи, обычно выбирают алгоритмы сжатия с потерями.

Источник: Описание курса и экзамена College Board AP

Шпиндельы жесткого диска и головка: данные сжаты и сохранены в виде магнитных паттернов
Шпиндельы жесткого диска и головка: данные сжаты и сохранены в виде магнитных паттернов

Сжатие уменьшает количество бит, необходимых для хранения или передачи данных. Два вида:

Методы сжатия: безпотерянное против потерного, с типичными примерами
Методы сжатия: без потерь против с потерями, с распространенными примерами
  • Без потерь (lossless) позволяет восстановить точный исходный данные (используется для текста и программ, где важен каждый бит).
  • С потерями (lossy) отбрасывает часть данных, чтобы еще больше уменьшить размер (further — дальше/еще больше) (используется для фотографий, музыки, видео, где допустима небольшая потеря качества).

Выбор между ними предполагает компромисс между размером и точностью: без потерь сохраняет всё, но экономит меньше места; с потерями экономит больше, но навсегда теряет детали. Предпочитайте без потерь, когда данные должны быть точными.

Исследовать

Сжатие последовательности повторений

Кодирование длин серий является потерянным сжатием: длинная последовательность одного и того же символа заменяется самим символом и счетчиком, уменьшая объем данных без потери информации.

English Русский
Compression/kəmˈpreʃn/ Сжатие
Lossless compression/ˈlɒsləs kəmˈpreʃn/ Сжатие без потерь
Lossy compression/ˈlɒsi kəmˈpreʃn/ Сжатие с потерями
Data/ˈdeɪtə/ Data (Данные)
information/ˌɪnfəˈmeɪʃn/ интернет
correlation/ˌkɒrɪˈleɪʃn/ корреляцию
Metadata/ˌmetəˈdeɪtə/ Метаданные
filtering/ˈfɪltərɪŋ/ фильтрованием
visualizing/ˈvɪʒuːəlaɪzɪŋ/ визуализация
privacy/ˈprɪvəsi/ конфиденциальности
2.3

Извлечение информации из данных

Программа

Принципиальное понимание (DAT-2): Программное обеспечение может использоваться для обработки данных, что позволяет пользователям открывать новую информацию и создавать новые знания.

Цель обучения DAT-2.A: Описать, какую информацию можно извлечь из данных. [Навык 5.B]

  • DAT-2.A.1 Информация — это совокупность фактов и закономерностей, извлеченных из данных.
  • DAT-2.A.2 Данные предоставляют возможности для выявления тенденций, установления связей и решения проблем.
  • DAT-2.A.3 Обработанные цифровые данные могут демонстрировать корреляцию между переменными. Корреляция, обнаруженная в данных, не обязательно указывает на наличие причинно-следственной связи. Для понимания точной природы этой зависимости требуется дополнительное исследование.
  • DAT-2.A.4 Часто одного источника недостаточно для получения данных, необходимых для вывода заключения. Может потребоваться объединение данных из различных источников для формулирования вывода.

Цель обучения DAT-2.B: Описать, какую информацию можно извлечь из метаданных. [Навык 5.B]

  • DAT-2.B.1 Метаданные — это данные о данных. Например, данные могут представлять собой изображение, а метаданные могут включать дату создания или размер файла изображения.
  • DAT-2.B.2 Изменения и удаления, внесенные в метаданные, не изменяют основные данные.
  • DAT-2.B.3 Метаданные используются для поиска, организации и управления информацией.
  • DAT-2.B.4 Метаданные могут повысить эффективность использования данных или наборов данных за счет предоставления дополнительной информации.
  • DAT-2.B.5 Метаданные позволяют структурировать и организовывать данные.

Цель обучения DAT-2.C: Определить проблемы, связанные с обработкой данных. [Навык 5.D]

  • DAT-2.C.1 Возможность обработки данных зависит от возможностей пользователей и используемых ими инструментов.
  • DAT-2.C.2 Наборы данных создают трудности независимо от их размера, например:
    • необходимость очистки данных
    • неполнота данных
    • невалидность данных
    • необходимость объединения источников данных
  • DAT-2.C.3 В зависимости от способа сбора данных они могут быть неоднородными. Например, если пользователи вводят данные в открытое поле, способ, которым они решают сокращать слова, писать их или использовать регистр, может различаться от пользователя к пользователю.
  • DAT-2.C.4 Очистка данных — это процесс приведения данных к единообразию без изменения их смысла (например, замена всех эквивалентных сокращений, орфографических вариантов и регистров одним и тем же словом).
  • DAT-2.C.5 Проблемы предвзятости часто создаются типом или источником собираемых данных. Предвзятость не устраняется простым увеличением объема собираемых данных.
  • DAT-2.C.6 Размер набора данных влияет на объем информации, который можно из него извлечь.
  • DAT-2.C.7 Большие наборы данных трудно обрабатывать с помощью одного компьютера, и может потребоваться использование параллельных систем.
  • DAT-2.C.8 Масштабируемость систем является важным аспектом при работе с наборами данных, поскольку вычислительные мощности системы влияют на то, как наборы данных могут быть обработаны и хранены.

Источник: Описание курса и экзамена College Board AP

Данные становятся полезными, когда мы извлекаем из них информацию — паттерны, тенденции и ответы на вопросы. Большие массивы данных могут выявить корреляции, которые не видны в малых наборах, но данные необходимо очистить (устранить ошибки и несоответствия) и часто сначала преобразовать или отфильтровать. Корреляция между двумя вещами не доказывает, что одно вызывает другое — важное предостережение. Метаданные (данные о данных, например дата и местоположение фото) помогают организовывать и искать большие коллекции.

2.4

Использование программ с данными

Программа

Принципиальное понимание (DAT-2): Программное обеспечение может использоваться для обработки данных, что позволяет пользователям открывать новую информацию и создавать новые знания.

Цель обучения DAT-2.D: Извлекать информацию из данных с помощью программы. [Навык 2.B]

  • DAT-2.D.1 Программы могут использоваться для обработки данных с целью получения информации.
  • DAT-2.D.2 Таблицы, диаграммы, текст и другие визуальные инструменты могут использоваться для передачи инсайтов и знаний, полученных из данных.
  • DAT-2.D.3 Инструменты поиска полезны для эффективного нахождения информации.
  • DAT-2.D.4 Системы фильтрации данных являются важными инструментами для поиска информации и распознавания закономерностей в данных.
  • DAT-2.D.5 Программы, такие как электронные таблицы, помогают эффективно организовывать информацию и выявлять тенденции.
  • DAT-2.D.6 Некоторые процессы, которые могут использоваться для извлечения или изменения информации из данных, включают следующее:
    • преобразование каждого элемента набора данных, например, умножение каждого элемента в списке на два или добавление электронной почты родителя к каждой записи студента
    • фильтрация набора данных, например, сохранение только положительных чисел из списка или сохранение только студентов, зарегистрировавшихся в духовом оркестре, из реестра всех студентов
    • объединение или сравнение данных определенным образом, например, суммирование списка чисел или поиск студента с самым высоким средним баллом (GPA)
    • визуализация набора данных с помощью диаграммы, графика или другого визуального представления

Цель обучения DAT-2.E: Объяснить, как программы могут использоваться для получения инсайтов и знаний из данных. [Навык 5.B]

  • DAT-2.E.1 Программы используются итеративно и интерактивно при обработке информации, чтобы позволить пользователям получать инсайты и знания о данных.
  • DAT-2.E.2 Программисты могут использовать программы для фильтрации и очистки цифровых данных, тем самым получая инсайты и знания.
  • DAT-2.E.3 Объединение источников данных, кластеризация данных и классификация данных являются частями процесса использования программ для получения инсайтов и знаний из данных.
  • DAT-2.E.4 Инсайты и знания можно получить путем перевода и преобразования информации, представленной в цифровом виде.
  • DAT-2.E.5 Закономерности могут возникать, когда данные преобразуются с помощью программ.

Источник: Описание курса и экзамена College Board AP

Программы обрабатывают данные в масштабах, недоступных человеку. Распространенные операции — фильтрация (оставление только строк, удовлетворяющих условию), очистка (удаление ошибок) и визуализация (диаграммы и графики, делающие паттерны видимыми). Объединение данных из нескольких источников может дать больше информации, но поднимает вопросы конфиденциальности. Интерактивные инструменты и визуализации позволяют людям исследовать данные и делать собственные выводы.

Навык для экзамена: уметь объяснить, как программа помогает находить информацию в большом наборе данных, и почему корреляция, показанная в данных, не устанавливает причинно-следственную связь.

2.4

Советы для экзамена

  • Уверенно конвертируйте между двоичной, десятичной и (по требованию) шестнадцатеричной системами счисления — тренируйтесь до автоматизма.
  • Помните, что бит — это один двоичный разряд, а байт — 8 бит; $n$ бит представляют $2^n$ значение.
  • Объясните, что все данные — числа, текст, изображения, звук — хранятся в двоичном виде, и что конечное число бит вызывает переполнение и ошибку округления.
  • Различайте без потерь и с потерями сжатие и знать, когда каждое из них уместно.
  • Продемонстрируйте идею аналого-цифрового преобразования: дискретизация (sampling) превращает непрерывный сигнал в дискретные значения.

Интерактивные уроки по этой теме

Пройдите его шаг за шагом с упражнениями мгновенной проверки.

Архив экзаменационных работ

Больше тем в AP Принципы информатики

Войти или создать аккаунт

IGCSE, A-Level & AP