# Numpy i Matplotlib - tutorial

Ten samouczek został pierwotnie napisany przez [Justina Johnsona](https://web.eecs.umich.edu/~justincj/) dla kursu CS231n. Został zaadaptowany jako notatnik Jupyter dla kursu CS228 przez [Volodymyra Kuleshova](http://web.stanford.edu/~kuleshov/) i [Isaaca Caswella](https://symsys.stanford.edu/viewing/symsysaffiliate/21335).

Zadania do samodzielnego wykonania pochodzą z kursu Machine Learning (GMUM UJ): https://github.com/gmum/

## Wprowadzenie

Python to świetny, ogólnego przeznaczenia język programowania, ale z pomocą kilku popularnych bibliotek (numpy, scipy, matplotlib) staje się potężnym środowiskiem do obliczeń naukowych.

Zakładamy, że wielu z Was ma już pewne doświadczenie z Pythonem i biblioteką numpy; dla pozostałych ta sekcja będzie stanowić szybki kurs wprowadzający zarówno do samego języka Python, jak i jego zastosowań w obliczeniach naukowych.

Jeśli masz wcześniejsze doświadczenie z Matlabem, polecamy również stronę „numpy dla użytkowników Matlaba” (https://docs.scipy.org/doc/numpy-dev/user/numpy-for-matlab-users.html).

W tym samouczku omówimy:

- Numpy: Tablice, indeksowanie tablic, typy danych, operacje matematyczne na tablicach, broadcasting
- Matplotlib: Tworzenie wykresów, podwykresy, obrazy


##Numpy

Numpy to podstawowa biblioteka do obliczeń naukowych w Pythonie. Udostępnia wydajny obiekt tablicy wielowymiarowej oraz narzędzia do pracy z tymi tablicami. Jeśli masz już doświadczenie z MATLAB-em, pomocny może być ten [samouczek](http://wiki.scipy.org/NumPy_for_Matlab_Users), który ułatwi Ci rozpoczęcie pracy z biblioteką Numpy.

Aby korzystać z biblioteki Numpy, najpierw musimy zaimportować pakiet `numpy`:

In [None]:
import numpy as np

### Tablice

Tablica Numpy to siatka wartości, wszystkie tego samego typu, indeksowana za pomocą krotki zawierającej nieujemne liczby całkowite. Liczba wymiarów tablicy nazywana jest jej **rangą** (rank), a jej **kształt** (shape) to krotka liczb całkowitych określająca rozmiar tablicy wzdłuż każdej osi.

Możemy inicjalizować tablice Numpy z zagnieżdżonych list Pythona oraz uzyskiwać dostęp do ich elementów za pomocą nawiasów kwadratowych:

In [None]:
a = np.array([1, 2, 3])  # Create a rank 1 array
print(type(a), a.shape, a[0], a[1], a[2])
a[0] = 5                 # Change an element of the array
print(a)

In [None]:
b = np.array([[1,2,3],[4,5,6]])   # Create a rank 2 array
print(b)

In [None]:
print(b.shape)
print(b[0, 0], b[0, 1], b[1, 0])

Numpy udostępnia również wiele funkcji do tworzenia tablic:

In [None]:
a = np.zeros((2,2))  # Create an array of all zeros
print(a)

In [None]:
b = np.ones((1,2))   # Create an array of all ones
print(b)

In [None]:
c = np.full((2,2), 7) # Create a constant array
print(c)

In [None]:
d = np.eye(2)        # Create a 2x2 identity matrix
print(d)

In [None]:
e = np.random.random((2,2)) # Create an array filled with random values
print(e)

### Indeksowanie tablic

Numpy oferuje kilka sposobów indeksowania tablic.

**Slicing (wycinki)**

Podobnie jak w przypadku list Pythona, tablice Numpy można dzielić na fragmenty (slicing). Ponieważ tablice mogą być wielowymiarowe, należy określić wycinek dla każdego wymiaru tablicy:

In [None]:
import numpy as np

# Create the following rank 2 array with shape (3, 4)
# [[ 1  2  3  4]
#  [ 5  6  7  8]
#  [ 9 10 11 12]]
a = np.array([[1,2,3,4], [5,6,7,8], [9,10,11,12]])

# Use slicing to pull out the subarray consisting of the first 2 rows
# and columns 1 and 2; b is the following array of shape (2, 2):
# [[2 3]
#  [6 7]]
b = a[:2, 1:3]
print(b)

Wycinek (slice) tablicy jest widokiem na te same dane, więc jego modyfikacja zmieni również oryginalną tablicę.

In [None]:
print(a[0, 1])
b[0, 0] = 77    # b[0, 0] is the same piece of data as a[0, 1]
print(a[0, 1])

Możesz również łączyć **indeksowanie liczbami całkowitymi** z **indeksowaniem przez wycinek (slicing)**. Jednak w takim przypadku wynikowa tablica będzie miała **niższą rangę** niż oryginalna.  

Warto zauważyć, że sposób działania wycinków w Numpy różni się od tego w MATLAB-ie:

In [None]:
# Create the following rank 2 array with shape (3, 4)
a = np.array([[1,2,3,4], [5,6,7,8], [9,10,11,12]])
print(a)

Dwa sposoby uzyskiwania dostępu do danych w środkowym wierszu tablicy:

- Łączenie indeksowania liczbami całkowitymi z wycinkami zwraca tablicę o niższej randze niż oryginalna.
- Używanie wyłącznie wycinków zwraca tablicę o tej samej randze co oryginalna:

In [None]:
row_r1 = a[1, :]    # Rank 1 view of the second row of a
row_r2 = a[1:2, :]  # Rank 2 view of the second row of a
row_r3 = a[[1], :]  # Rank 2 view of the second row of a
print(row_r1, row_r1.shape)
print(row_r2, row_r2.shape)
print(row_r3, row_r3.shape)

In [None]:
# We can make the same distinction when accessing columns of an array:
col_r1 = a[:, 1]
col_r2 = a[:, 1:2]
print(col_r1, col_r1.shape)
print()
print(col_r2, col_r2.shape)

**Indeksowanie tablicą liczb całkowitych**  

Gdy indeksujesz tablice Numpy za pomocą **wycinków (slicing)**, wynikowa tablica zawsze będzie **podtablicą** oryginalnej tablicy.  

Natomiast **indeksowanie tablicą liczb całkowitych** pozwala na **dowolne konstruowanie nowych tablic**, wybierając określone elementy z innej tablicy. Oto przykład:

In [None]:
a = np.array([[1,2], [3, 4], [5, 6]])

# An example of integer array indexing.
# The returned array will have shape (3,) and
print(a[[0, 1, 2], [0, 1, 0]])

# The above example of integer array indexing is equivalent to this:
print(np.array([a[0, 0], a[1, 1], a[2, 0]]))

In [None]:
# When using integer array indexing, you can reuse the same
# element from the source array:
print(a[[0, 0], [1, 1]])

# Equivalent to the previous integer array indexing example
print(np.array([a[0, 1], a[0, 1]]))

Jedna przydatna technika przy **indeksowaniu tablicą liczb całkowitych** to **wybieranie lub modyfikowanie jednego elementu z każdego wiersza macierzy**:

In [None]:
# Create a new array from which we will select elements
a = np.array([[1,2,3], [4,5,6], [7,8,9], [10, 11, 12]])
print(a)

In [None]:
# Create an array of indices
b = np.array([0, 2, 0, 1])

# Select one element from each row of a using the indices in b
print(a[np.arange(4), b])  # Prints "[ 1  6  7 11]"

In [None]:
# Mutate one element from each row of a using the indices in b
a[np.arange(4), b] += 10
print(a)

 **Indeksowanie tablicą wartości logicznych (Boolean array indexing)**  

Indeksowanie tablicą wartości logicznych pozwala na wybieranie dowolnych elementów tablicy, które spełniają określony warunek.  

Tego typu indeksowanie jest często używane do **filtrowania elementów tablicy** na podstawie warunków logicznych.  

Oto przykład:

In [None]:
import numpy as np

a = np.array([[1,2], [3, 4], [5, 6]])

bool_idx = (a > 2)  # Find the elements of a that are bigger than 2;
                    # this returns a numpy array of Booleans of the same
                    # shape as a, where each slot of bool_idx tells
                    # whether that element of a is > 2.
print(bool_idx)

In [None]:
# We use boolean array indexing to construct a rank 1 array
# consisting of the elements of a corresponding to the True values
# of bool_idx
print(a[bool_idx])

# We can do all of the above in a single concise statement:
print(a[a > 2])

Dla zwięzłości pominęliśmy wiele szczegółów dotyczących indeksowania tablic Numpy. Jeśli chcesz dowiedzieć się więcej, warto zapoznać się z [oficjalną dokumentacją Numpy](https://numpy.org/doc/stable/user/basics.indexing.html).

### Typy danych

Każda tablica Numpy to **siatka elementów tego samego typu**.  

Numpy udostępnia szeroki zestaw **numerycznych typów danych**, które można wykorzystać do tworzenia tablic. Podczas tworzenia tablicy Numpy **automatycznie zgaduje typ danych**, ale większość funkcji konstrukcyjnych pozwala również na **jawne określenie typu danych** poprzez opcjonalny argument.  

Oto przykład:

In [None]:
x = np.array([1, 2])  # Let numpy choose the datatype
y = np.array([1.0, 2.0])  # Let numpy choose the datatype
z = np.array([1, 2], dtype=np.int64)  # Force a particular datatype

print(x.dtype, y.dtype, z.dtype)

Możesz znaleźć pełne informacje o typach danych w Numpy w [dokumentacji](http://docs.scipy.org/doc/numpy/reference/arrays.dtypes.html).

### Operacje na tablicach

Podstawowe funkcje matematyczne działają **element po elemencie** na tablicach i są dostępne zarówno jako **przeciążone operatory**, jak i jako **funkcje w module Numpy**:

In [None]:
x = np.array([[1,2],[3,4]], dtype=np.float64)
y = np.array([[5,6],[7,8]], dtype=np.float64)

# Elementwise sum; both produce the array
print(x + y)
print(np.add(x, y))

In [None]:
# Elementwise difference; both produce the array
print(x - y)
print(np.subtract(x, y))

In [None]:
# Elementwise product; both produce the array
print(x * y)
print(np.multiply(x, y))

In [None]:
# Elementwise division; both produce the array
# [[ 0.2         0.33333333]
#  [ 0.42857143  0.5       ]]
print(x / y)
print(np.divide(x, y))

In [None]:
# Elementwise square root; produces the array
# [[ 1.          1.41421356]
#  [ 1.73205081  2.        ]]
print(np.sqrt(x))

Należy zauważyć, że w przeciwieństwie do MATLAB-a, operator `*` wykonuje **mnożenie elementów tablicy (elementwise multiplication)**, a nie **mnożenie macierzy**.  

Aby obliczyć iloczyn skalarny wektorów, pomnożyć wektor przez macierz lub wykonać mnożenie macierzy, używamy funkcji `dot`.  

Funkcja `dot` jest dostępna zarówno jako:  
- funkcja w module `numpy`,  
- metoda instancji obiektu tablicy (`array.dot(...)`).  

Oto przykład:

In [None]:
x = np.array([[1,2],[3,4]])
y = np.array([[5,6],[7,8]])

v = np.array([9,10])
w = np.array([11, 12])

# Inner product of vectors; both produce 219
print(v.dot(w))
print(np.dot(v, w))

Możesz również użyć operatora `@`, który jest **równoważny funkcji `numpy.dot`** i służy do mnożenia macierzy oraz obliczania iloczynów skalarnych.  


In [None]:
print(v @ w)

In [None]:
# Matrix / vector product; both produce the rank 1 array [29 67]
print(x.dot(v))
print(np.dot(x, v))
print(x @ v)

In [None]:
# Matrix / matrix product; both produce the rank 2 array
# [[19 22]
#  [43 50]]
print(x.dot(y))
print(np.dot(x, y))
print(x @ y)

Numpy udostępnia wiele przydatnych funkcji do wykonywania obliczeń na tablicach; jedną z najważniejszych jest funkcja `sum`:

In [None]:
x = np.array([[1,2],[3,4]])

print(np.sum(x))  # Compute sum of all elements; prints "10"
print(np.sum(x, axis=0))  # Compute sum of each column; prints "[4 6]"
print(np.sum(x, axis=1))  # Compute sum of each row; prints "[3 7]"

Pełną listę funkcji matematycznych dostępnych w Numpy znajdziesz w [dokumentacji](http://docs.scipy.org/doc/numpy/reference/routines.math.html).  

Oprócz wykonywania obliczeń matematycznych na tablicach, często musimy **zmieniać ich kształt lub manipulować danymi**.  

Najprostszym przykładem takiej operacji jest **transponowanie macierzy**. Aby transponować macierz, wystarczy użyć **atrybutu `T`** obiektu tablicy:

In [None]:
print(x)
print("transpose\n", x.T)

In [None]:
v = np.array([[1,2,3]])
print(v )
print("transpose\n", v.T)

###Broadcasting

**Broadcasting** to potężny mechanizm, który pozwala Numpy na **wykonywanie operacji arytmetycznych na tablicach o różnych kształtach**.  

Często mamy **mniejszą tablicę** i **większą tablicę**, a chcemy wielokrotnie użyć tej mniejszej do wykonania operacji na większej.  

Na przykład, jeśli chcemy **dodać stały wektor do każdego wiersza macierzy**, możemy to zrobić w następujący sposób:

In [None]:
# We will add the vector v to each row of the matrix x,
# storing the result in the matrix y
x = np.array([[1,2,3], [4,5,6], [7,8,9], [10, 11, 12]])
v = np.array([1, 0, 1])
y = np.empty_like(x)   # Create an empty matrix with the same shape as x

# Add the vector v to each row of the matrix x with an explicit loop
for i in range(4):
    y[i, :] = x[i, :] + v

print(y)

To rozwiązanie działa, ale jeśli macierz `x` jest bardzo duża, jawna pętla w Pythonie może być wolna.  

Zauważ, że **dodanie wektora `v` do każdego wiersza macierzy `x`** jest równoważne utworzeniu macierzy `vv` poprzez **wielokrotne skopiowanie `v` w pionie**, a następnie wykonaniu **sumowania element po elemencie** dla `x` i `vv`.  

Możemy zaimplementować to podejście w następujący sposób:

In [None]:
vv = np.tile(v, (4, 1))  # Stack 4 copies of v on top of each other
print(vv)                # Prints "[[1 0 1]
                         #          [1 0 1]
                         #          [1 0 1]
                         #          [1 0 1]]"

In [None]:
y = x + vv  # Add x and vv elementwise
print(y)

**Broadcasting w Numpy** pozwala nam wykonać tę operację **bez konieczności tworzenia wielu kopii** wektora `v`.  

Oto wersja wykorzystująca mechanizm broadcastingu:

In [None]:
import numpy as np

# We will add the vector v to each row of the matrix x,
# storing the result in the matrix y
x = np.array([[1,2,3], [4,5,6], [7,8,9], [10, 11, 12]])
v = np.array([1, 0, 1])
y = x + v  # Add v to each row of x using broadcasting
print(y)

Instrukcja `y = x + v` działa, mimo że `x` ma kształt `(4, 3)`, a `v` ma kształt `(3,)`, dzięki **mechanizmowi broadcastingu**.  

Działa to tak, jakby `v` miało kształt `(4, 3)`, gdzie każdy wiersz był kopią `v`, a następnie wykonywane było **sumowanie element po elemencie**.

### **Zasady broadcastingu w Numpy**  

1. Jeśli tablice nie mają tej samej liczby wymiarów (**rangi**), do tablicy o mniejszej randze dodaje się **jedynki** z przodu jej kształtu, aż oba kształty będą miały tę samą długość.  
2. Dwie tablice są **kompatybilne** w danym wymiarze, jeśli:  
   - Mają taką samą wielkość w tym wymiarze, **lub**  
   - Jedna z tablic ma rozmiar **1** w tym wymiarze.  
3. Tablice można **rozszerzyć (broadcastować) razem**, jeśli są kompatybilne we wszystkich wymiarach.  
4. Po rozszerzeniu każda tablica **zachowuje się tak, jakby miała kształt równy maksymalnemu rozmiarowi** wzdłuż każdej osi.  
5. W każdym wymiarze, gdzie jedna tablica miała rozmiar **1**, a druga większy, pierwsza tablica **zachowuje się tak, jakby została powielona** wzdłuż tego wymiaru.  

Jeśli ta koncepcja jest niejasna, warto zapoznać się z wyjaśnieniami w [oficjalnej dokumentacji](http://docs.scipy.org/doc/numpy/user/basics.broadcasting.html) lub w tej [dodatkowej analizie](http://wiki.scipy.org/EricsBroadcastingDoc).  

 **Funkcje wspierające broadcasting**  
Funkcje obsługujące broadcasting nazywane są **funkcjami uniwersalnymi (universal functions, ufuncs)**. Pełną listę można znaleźć w [dokumentacji](http://docs.scipy.org/doc/numpy/reference/ufuncs.html#available-ufuncs).  

**Przykłady zastosowania broadcastingu:**  


In [None]:
# Compute outer product of vectors
v = np.array([1,2,3])  # v has shape (3,)
w = np.array([4,5])    # w has shape (2,)
# To compute an outer product, we first reshape v to be a column
# vector of shape (3, 1); we can then broadcast it against w to yield
# an output of shape (3, 2), which is the outer product of v and w:

print(np.reshape(v, (3, 1)) * w)

In [None]:
# Add a vector to each row of a matrix
x = np.array([[1,2,3], [4,5,6]])
# x has shape (2, 3) and v has shape (3,) so they broadcast to (2, 3),
# giving the following matrix:

print(x + v)

In [None]:
# Add a vector to each column of a matrix
# x has shape (2, 3) and w has shape (2,).
# If we transpose x then it has shape (3, 2) and can be broadcast
# against w to yield a result of shape (3, 2); transposing this result
# yields the final result of shape (2, 3) which is the matrix x with
# the vector w added to each column. Gives the following matrix:

print((x.T + w).T)

In [None]:
# Another solution is to reshape w to be a row vector of shape (2, 1);
# we can then broadcast it directly against x to produce the same
# output.
print(x + np.reshape(w, (2, 1)))

In [None]:
# Multiply a matrix by a constant:
# x has shape (2, 3). Numpy treats scalars as arrays of shape ();
# these can be broadcast together to shape (2, 3), producing the
# following array:
print(x * 2)

Broadcasting zazwyczaj sprawia, że kod jest **bardziej zwięzły i szybszy**, dlatego warto go stosować tam, gdzie to możliwe.

To krótkie wprowadzenie omówiło wiele kluczowych aspektów biblioteki Numpy, ale nie jest ono wyczerpujące. Aby dowiedzieć się więcej, warto zajrzeć do [oficjalnej dokumentacji Numpy](http://docs.scipy.org/doc/numpy/reference/).

##Matplotlib

**Matplotlib** to biblioteka do tworzenia wykresów.  

W tej sekcji przedstawimy krótkie wprowadzenie do modułu **`matplotlib.pyplot`**, który oferuje system wykresów podobny do tego znanego z **MATLAB-a**.

In [None]:
import matplotlib.pyplot as plt

Uruchamiając to specjalne polecenie w **IPythonie**, sprawimy, że wykresy będą wyświetlane **bezpośrednio w notatniku**:

In [None]:
%matplotlib inline

### Rysowanie wykresów funkcją ```plot```

Najważniejszą funkcją w **Matplotlib** jest `plot`, która pozwala na tworzenie **wykresów 2D**.  

Oto prosty przykład:

In [None]:
# Compute the x and y coordinates for points on a sine curve
x = np.arange(0, 3 * np.pi, 0.1)
y = np.sin(x)

# Plot the points using matplotlib
plt.plot(x, y)

Dodając niewielką ilość dodatkowego kodu, możemy łatwo **narysować wiele linii jednocześnie** oraz dodać **tytuł, legendę i etykiety osi**:

In [None]:
y_sin = np.sin(x)
y_cos = np.cos(x)

# Plot the points using matplotlib
plt.plot(x, y_sin)
plt.plot(x, y_cos)
plt.xlabel('x axis label')
plt.ylabel('y axis label')
plt.title('Sine and Cosine')
plt.legend(['Sine', 'Cosine'])

### Podwykresy (ang. subplots)

Możesz **rysować różne wykresy w ramach jednego wykresu**, używając funkcji `subplot`.  

Oto przykład:

In [None]:
# Compute the x and y coordinates for points on sine and cosine curves
x = np.arange(0, 3 * np.pi, 0.1)
y_sin = np.sin(x)
y_cos = np.cos(x)

# Set up a subplot grid that has height 2 and width 1,
# and set the first such subplot as active.
plt.subplot(2, 1, 1)

# Make the first plot
plt.plot(x, y_sin)
plt.title('Sine')

# Set the second subplot as active, and make the second plot.
plt.subplot(2, 1, 2)
plt.plot(x, y_cos)
plt.title('Cosine')

# Show the figure.
plt.show()

Więcej informacji na temat funkcji subplot można znaleźć [w dokumentacji](http://matplotlib.org/api/pyplot_api.html#matplotlib.pyplot.subplot).

# Zadania do samodzielnego wykonania

In [None]:
# Wgraj dostarczony plik whl i wykonaj poniższy kod:
!pip install my_package-0.1-py3-none-any.whl

In [None]:
import random
from math import cos, sin

import checker
import matplotlib.pyplot as plt
import numpy as np
import utils

## Zadanie 1.
Wykonać poniższe ćwiczenia przy pomocy Numpy:

1. Wykorzystując `broadcasting` (patrz na rysunek poniżej) stwórz funkcję, która dla zadnego $K$ zwraca tabliczkę mnożenia, tzn. tablicę $A$ taką, że: $$A_{ij} = i \cdot j\;\;\;\;\; \forall i,j \in \{1,\dots,K\}$$
    <img src="http://www.astroml.org/_images/fig_broadcast_visual_1.png">

    Przydatne funkcje: `np.arange`, `np.reshape`.

*Wskazówka: przydatna może okazać się wiedza, czym różni się wektor o kształcie (n,) od (n,1): https://stackoverflow.com/questions/22053050/difference-between-numpy-array-shape-r-1-and-r*

In [None]:
def multiplication_table(k: int) -> np.ndarray:
    ...


print("Wynik funkcji multiplication:\n", multiplication_table(10))
checker.check_multiplication_table(multiplication_table)

2. Mając daną tablice jednowymiarową oraz liczbę `x` znajdź najbliższą wartość `x` w `A`, tzn.

$$ \mathrm{closest}(x, A) = \arg\min_{a\in A}|x - a|  $$

Przydatne funkcje: `np.argmin`, `np.abs`.

In [None]:
def closest(x: float, A: np.ndarray) -> np.ndarray:
    ...


print("Wynik funkcji closest:", closest(9, np.array([5, 8, 14])))
checker.check_closest(closest)

3. Zaimplementuj proste liczenie wartosci wielomianu o zadanych współczynnikach (analogię `np.poly1d`), czyli funkcję

$$
\mathrm{poly}(x, a) = a_0 + a_1 x + a_2 x^2 + \dots + a_k x^k = \sum_{i=1}^k a_i x^i
$$

Potencjalnie przydatne funkcje: `np.cumprod`, `np.concatenate`, `np.sum`.

In [None]:
def poly(x: int, a: np.ndarray) -> np.ndarray:
    ...


print("Wynik funkcji poly:", poly(3, np.array([1, 2, 4])))
checker.check_poly(poly)

## Zadanie 2.
Należy:
1. Wysamplować $10000$ przykładów z rozkładu normalnego $\mathcal{N}(\mu, \sigma)$. **Należy wybrać niestandardowe parametry**, tzn. $\mu \neq 0$ oraz $\sigma \neq 1$.
2. Następnie należy policzyć, jaki procent wylosowanych przykładów, znajduje się od środka w odległości większej niż:
    * $1\sigma$ (tzn. $|x - \mu| > 1\sigma$)
    * $2\sigma$ (tzn. $|x - \mu| > 2\sigma$)
    * $3\sigma$ (tzn. $|x - \mu| > 3\sigma$)
    
3. Wypisać wszystkie przykłady, które wpadają do ostatniej kategorii (tzn. są oddalone o co najmniej $3\sigma$ od średniej).

In [None]:
# Podpunkt 1: Wysamplować 10000 przykładów z rozkładu normalnego
loc = ???  # średnia wybranego rozkładu normalnego
scale = ???  # odchylenie standardowe wybranego rozkładu normalnego
X = np.random.normal(???)

# Podpunkt 2: Wyliczyć i wypisać procent

# Podpunkt 3: Wypisać elementy, które są oddalone od średniej o 3 sigma.

# Trochę wizualizacji
utils.visualize_normal_dist(X, loc, scale)