Дифференциальное и матричное исчисление
Производная как линейная аппроксимация
Не «скорость изменения», а лучшая линейная модель функции рядом с точкой
Определение, из которого всё следует
Обычное определение — предел разностного отношения:
Оно верное, но плохо переносится на многомерный случай: делить на вектор нельзя. Полезнее эквивалентная формулировка через приближение.
Читается так:
Такая формулировка переносится дословно: в многомерном случае вместо числа будет матрица, а деления нигде нет. Именно поэтому здесь стоит потратить время на смену точки зрения.
Секущая становится касательной
Разностное отношение — наклон секущей через точки и . Производная — предел этих наклонов. Включите секущую и уменьшайте зазор:
- x
- 0.8
- f(x)
- 0.64
- f'(x)
- 1.6
Обратите внимание на : производная существует не всегда. Слева и справа наклоны разные, значит единой линейной аппроксимации нет. Это ровно та ситуация, которая позже возникнет с ReLU.
Правила
Три правила, из которых собирается всё остальное:
- произведение:
- частное:
- цепочка:
Правило цепочки — самое важное во всём блоке. Смысл: коэффициенты линейных приближений перемножаются. Если внутренняя функция растягивает приращение в раз, а внешняя — ещё в раз, суммарное растяжение есть произведение.
Именно из этого и вырастет backprop, где перемножаются матрицы вместо чисел.
Предел и непрерывность — на уровне интуиции
Формальные – в этом плане не нужны, но словарь нужен.
Предел означает: значения подходят к как угодно близко, если достаточно близко к . Про саму точку утверждение ничего не говорит — и именно поэтому предел разностного отношения имеет смысл, хотя в дробь не определена.
Непрерывность в точке — это : предел существует и совпадает со значением.
Связь односторонняя и её стоит помнить: дифференцируемость влечёт непрерывность, но не наоборот. непрерывна в нуле и не дифференцируема — это и есть контрпример.
Условие первого порядка
Если — точка локального экстремума и дифференцируема, то .
Причина понятна из линейной аппроксимации: при линейная часть меняет знак вместе с , значит в одну сторону функция растёт, в другую убывает — экстремума нет.
Обратное неверно. У в нуле производная равна нулю, а экстремума нет — переключитесь на неё в графике выше и убедитесь. Такие точки называются критическими, и разбираться, что в них происходит, будет вторая производная.
Вся оптимизация в блоке 5 — это поиск точек, где градиент равен нулю. Стоит уже здесь усвоить, что это условие необходимое, но не достаточное.
Источники
- 3Blue1Brown — Essence of Calculus, эпизоды 1–3 — Производная, парадокс мгновенной скорости, правила дифференцирования
- Deisenroth, Faisal, Ong — Mathematics for Machine Learning, гл. 5.1 — Дифференцирование одномерных функций
Проверки
0 из 2Что такое производная
Отметьте все верные утверждения.
Численная производная
Реализуйте
central_difference(coeffs, x, h)— оценку производной многочлена центральной разностью.coeffsзадаёт многочлен по возрастанию степеней:[a0, a1, a2, ...]означает Сначала напишите вычисление значения в точке, затем применитеПочему именно центральная разность, а не : у односторонней ошибка порядка , у центральной — порядка . В разложении Тейлора линейные члены ошибки взаимно уничтожаются, и остаётся квадратичный. Это тот самый приём, которым в конце блока будем проверять свой автоград.
Загрузка редактора…
Ctrl/⌘ + Enter