MathLabs

Toán ứng dụng và Tính toán

Toán cho học máy

Đại số tuyến tính, tối ưu và xác suất làm nền tảng cho các thuật toán học mẫu hình từ dữ liệu.

Trực giácHọc máy: đi xuống một địa hình

Giả sử bạn muốn dự đoán điều gì đó — giá nhà, nhãn thư rác, từ tiếp theo trong câu — bằng một mô hình có các núm điều chỉnh θ\theta. Huấn luyện mô hình nghĩa là chọn θ\theta sao cho một độ đo sai số đã chọn L(θ)L(\theta), gọi là hàm mất mát, càng nhỏ càng tốt. Nếu hình dung LL như độ cao của một địa hình trên không gian mọi cách đặt núm, việc học trở thành một quá trình vật lý: bắt đầu ở đâu đó, rồi liên tục bước xuống dốc.

Một mặt cong 3D gợn sóng với các đồi và thung lũng xen kẽ tạo bởi sin x nhân cos y, minh họa một địa hình mất mát không lồi với nhiều cực tiểu địa phương thay vì một cái bát toàn cục duy nhất.
z=sin⁡xcos⁡yz = \sin x \cos y: một địa hình mất mát với nhiều đồi và thung lũng. Khác với một cái bát duy nhất, gradient descent xuất phát gần các điểm khác nhau có thể trượt vào các thung lũng khác nhau — các cực tiểu địa phương khác nhau.

Hình dạng bạn nhận được phụ thuộc vào mô hình. Một mô hình tuyến tính huấn luyện bằng sai số bình phương có hàm mất mát chính xác là một paraboloid — một cái bát duy nhất như cái dùng để minh họa tối ưu lồi — nên gradient descent luôn tìm được điểm khớp tốt nhất. Một mạng nơ-ron sâu, với nhiều lớp hàm phi tuyến ghép lại, thường có địa hình mất mát gần giống mặt gồ ghề ở trên: đầy những hố địa phương, cao nguyên phẳng và điểm yên ngựa.

Đại họcCực tiểu hóa rủi ro thực nghiệm

Định nghĩa: Hàm mất mát

Một hàm mất mát ℓ(y^,y)\ell(\hat y, y) đo mức độ tệ của việc dự đoán y^\hat y khi giá trị thật là yy: nó bằng 00 (hoặc nhỏ) khi y^\hat y gần yy, và tăng lên khi dự đoán tệ hơn. Với bài toán hồi quy, lựa chọn phổ biến là sai số bình phương ℓ(y^,y)=(y^−y)2\ell(\hat y, y) = (\hat y - y)^2; với phân loại, entropy chéo là chuẩn mực.

Định nghĩa: Rủi ro thực nghiệm

Với tập huấn luyện gồm nn ví dụ {(xi,yi)}i=1n\{(x_i, y_i)\}_{i=1}^n và một mô hình fθf_\theta, rủi ro thực nghiệm R^(θ)\hat R(\theta) là mất mát trung bình trên tập huấn luyện. Huấn luyện một mô hình — bao gồm hồi quy tuyến tính, hồi quy logistic, và cả mạng sâu — nghĩa là tìm θ\theta cực tiểu hóa R^(θ)\hat R(\theta).

R^(θ)=1n∑i=1nℓ(fθ(xi),yi)\hat R(\theta) = \frac{1}{n}\sum_{i=1}^n \ell(f_\theta(x_i), y_i)

Trên thực tế, ta quan tâm tới hiệu năng trên dữ liệu mới, không chỉ tập huấn luyện: rủi ro tổng thể (thật) R(θ)R(\theta) lấy trung bình mất mát trên toàn bộ phân phối nền D\mathcal{D} mà các ví dụ đến từ đó, chứ không chỉ nn ví dụ ta tình cờ lấy mẫu. Vì D\mathcal{D} không biết được, R(θ)R(\theta) không thể tính trực tiếp — R^(θ)\hat R(\theta) chỉ là một đại diện, và khoảng cách R(θ)−R^(θ)R(\theta) - \hat R(\theta) được gọi là khoảng cách tổng quát hóa.

R(θ)=E(x,y)∼D[ℓ(fθ(x),y)]R(\theta) = \mathbb{E}_{(x,y)\sim \mathcal{D}}[\ell(f_\theta(x), y)]

Đại họcGradient descent và tốc độ hội tụ

Gradient descent cực tiểu hóa R^(θ)\hat R(\theta) (viết gọn là L(θ)L(\theta) bên dưới) bằng cách liên tục di chuyển theo hướng làm LL giảm nhanh nhất: gradient âm. Ở mỗi bước, ta tính ∇L(θk)\nabla L(\theta_k) và di chuyển một khoảng nhỏ được điều khiển bởi tốc độ học η>0\eta > 0.

θk+1=θk−η∇L(θk)\theta_{k+1} = \theta_k - \eta \nabla L(\theta_k)
Các thuật toán huấn luyện phổ biến và quy tắc cập nhật của chúng
Phương phápQuy tắc cập nhậtChi phí mỗi bướcThường dùng cho
Gradient descent theo lô đầy đủθk+1=θk−η∇L(θk)\theta_{k+1} = \theta_k - \eta \nabla L(\theta_k)O(n)O(n) mỗi bướcTập dữ liệu nhỏ, gradient chính xác
Gradient descent ngẫu nhiênθk+1=θk−η∇ℓi(θk)\theta_{k+1} = \theta_k - \eta \nabla \ell_i(\theta_k)O(1)O(1) mỗi bướcTập dữ liệu khổng lồ, cập nhật nhanh nhưng nhiễu
SGD theo mini-batchθk+1=θk−η1b∑i∈B∇ℓi(θk)\theta_{k+1} = \theta_k - \eta \dfrac{1}{b}\sum_{i \in B} \nabla \ell_i(\theta_k)O(b)O(b) mỗi bướcChuẩn mực trong học sâu; cân bằng tốc độ và ổn định
Momentumvk+1=βvk+∇L(θk),θk+1=θk−ηvk+1v_{k+1} = \beta v_k + \nabla L(\theta_k), \quad \theta_{k+1} = \theta_k - \eta v_{k+1}O(n)O(n) hoặc O(b)O(b) mỗi bướcTăng tốc qua các thung lũng hẹp và cao nguyên

Cho LL lồi và LL-trơn (gradient của nó Lipschitz với hằng số LL: ∥∇L(x)−∇L(y)∥≤L∥x−y∥\|\nabla L(x) - \nabla L(y)\| \le L\|x-y\|), và θ⋆\theta^\star cực tiểu hóa LL. Gradient descent với bước η=1/L\eta = 1/L thỏa mãn L(θK)−L(θ⋆)≤L∥θ0−θ⋆∥22KL(\theta_K) - L(\theta^\star) \le \dfrac{L\|\theta_0 - \theta^\star\|^2}{2K} sau KK bước.

Vì sao đúng?

Tính trơn đảm bảo mỗi bước gradient làm LL giảm một lượng tỉ lệ với bình phương độ lớn gradient, nên L(θk)L(\theta_k) không bao giờ tăng. Tính lồi cho phép ta so sánh mức giảm mỗi bước đó với khoảng cách còn lại L(θk)−L(θ⋆)L(\theta_k) - L(\theta^\star). Cộng dồn các mức giảm được đảm bảo qua KK bước — một tổng kính viễn vọng — cho thấy tổng mức giảm bị chặn, và vì điểm tốt nhất trong một dãy không tăng ít nhất cũng tốt bằng trung bình, khoảng cách cuối cùng phải thu hẹp theo tốc độ 1/K1/K.

Chứng minh

Do tính LL-trơn, với mọi x,yx, y: L(y)≤L(x)+∇L(x)⊤(y−x)+L2∥y−x∥2L(y) \le L(x) + \nabla L(x)^\top (y-x) + \dfrac{L}{2}\|y-x\|^2. Đặt y=θk+1=θk−1L∇L(θk)y = \theta_{k+1} = \theta_k - \dfrac{1}{L}\nabla L(\theta_k) và x=θkx = \theta_k ta được bổ đề giảm dần: L(θk+1)≤L(θk)−12L∥∇L(θk)∥2L(\theta_{k+1}) \le L(\theta_k) - \dfrac{1}{2L}\|\nabla L(\theta_k)\|^2.

Do tính lồi của LL: L(θk)≤L(θ⋆)+∇L(θk)⊤(θk−θ⋆)L(\theta_k) \le L(\theta^\star) + \nabla L(\theta_k)^\top(\theta_k - \theta^\star). Cộng vào bổ đề giảm dần: L(θk+1)−L(θ⋆)≤∇L(θk)⊤(θk−θ⋆)−12L∥∇L(θk)∥2L(\theta_{k+1}) - L(\theta^\star) \le \nabla L(\theta_k)^\top(\theta_k - \theta^\star) - \dfrac{1}{2L}\|\nabla L(\theta_k)\|^2.

Hoàn thiện bình phương ở vế phải: ∇L(θk)⊤(θk−θ⋆)−12L∥∇L(θk)∥2=L2(∥θk−θ⋆∥2−∥θk−θ⋆−1L∇L(θk)∥2)=L2(∥θk−θ⋆∥2−∥θk+1−θ⋆∥2)\nabla L(\theta_k)^\top(\theta_k - \theta^\star) - \dfrac{1}{2L}\|\nabla L(\theta_k)\|^2 = \dfrac{L}{2}\left(\|\theta_k - \theta^\star\|^2 - \left\|\theta_k - \theta^\star - \dfrac{1}{L}\nabla L(\theta_k)\right\|^2\right) = \dfrac{L}{2}\left(\|\theta_k - \theta^\star\|^2 - \|\theta_{k+1} - \theta^\star\|^2\right), vì θk+1−θ⋆=θk−θ⋆−1L∇L(θk)\theta_{k+1} - \theta^\star = \theta_k - \theta^\star - \dfrac{1}{L}\nabla L(\theta_k).

Vậy L(θk+1)−L(θ⋆)≤L2(∥θk−θ⋆∥2−∥θk+1−θ⋆∥2)L(\theta_{k+1}) - L(\theta^\star) \le \dfrac{L}{2}\left(\|\theta_k - \theta^\star\|^2 - \|\theta_{k+1} - \theta^\star\|^2\right). Cộng dồn bất đẳng thức này với k=0,…,K−1k = 0, \dots, K-1, vế phải rút gọn kính viễn vọng thành L2(∥θ0−θ⋆∥2−∥θK−θ⋆∥2)≤L2∥θ0−θ⋆∥2\dfrac{L}{2}\left(\|\theta_0 - \theta^\star\|^2 - \|\theta_K - \theta^\star\|^2\right) \le \dfrac{L}{2}\|\theta_0 - \theta^\star\|^2.

Bổ đề giảm dần cũng cho thấy L(θk)L(\theta_k) không tăng, nên L(θK)L(\theta_K) nhỏ hơn hoặc bằng trung bình của L(θ1),…,L(θK)L(\theta_1), \dots, L(\theta_K): L(θK)−L(θ⋆)≤1K∑k=1K(L(θk)−L(θ⋆))≤L∥θ0−θ⋆∥22KL(\theta_K) - L(\theta^\star) \le \dfrac{1}{K}\sum_{k=1}^K \left(L(\theta_k) - L(\theta^\star)\right) \le \dfrac{L\|\theta_0 - \theta^\star\|^2}{2K}, đúng bằng chặn cần chứng minh.

Đại họcLan truyền ngược: quy tắc chuỗi ở quy mô lớn

Một mạng có DD lớp tính z(l)=W(l)a(l−1)+b(l)z^{(l)} = W^{(l)} a^{(l-1)} + b^{(l)}, rồi áp dụng một hàm phi tuyến a(l)=σ(z(l))a^{(l)} = \sigma(z^{(l)}), với l=1,…,Dl = 1, \dots, D, và a(0)a^{(0)} là đầu vào. Áp dụng ngây thơ quy tắc chuỗi để tính ∂L/∂W(l)\partial L / \partial W^{(l)} cho từng lớp riêng rẽ sẽ lặp lại cùng các phép tính con nhiều lần, tốn thời gian tăng theo bậc hai với độ sâu.

z(l)=W(l)a(l−1)+b(l),a(l)=σ(z(l))z^{(l)} = W^{(l)} a^{(l-1)} + b^{(l)}, \qquad a^{(l)} = \sigma(z^{(l)})

Lan truyền ngược tránh công việc lặp lại bằng cách tính một đại lượng trung gian cho mỗi lớp, số hạng lỗi δ(l)=∂L/∂z(l)\delta^{(l)} = \partial L / \partial z^{(l)}, bắt đầu từ lớp đầu ra và đi ngược lại. Mỗi δ(l)\delta^{(l)} được xây dựng trực tiếp từ δ(l+1)\delta^{(l+1)}, tái sử dụng nó thay vì tính lại, và gradient của trọng số suy ra ngay từ δ(l)\delta^{(l)} và đầu vào của lớp a(l−1)a^{(l-1)}:

δ(l)=((W(l+1))⊤δ(l+1))⊙σ′(z(l)),∂L∂W(l)=δ(l)(a(l−1))⊤\delta^{(l)} = \left((W^{(l+1)})^\top \delta^{(l+1)}\right) \odot \sigma'(z^{(l)}), \qquad \frac{\partial L}{\partial W^{(l)}} = \delta^{(l)} (a^{(l-1)})^\top

Vì mỗi δ(l)\delta^{(l)} chỉ được tính một lần và tái sử dụng bởi lớp phía trước nó, tổng chi phí của một lượt lan truyền ngược tỉ lệ với DD, cùng bậc với một lượt lan truyền xuôi — không phải D2D^2. Đây chính là điều khiến việc huấn luyện các mạng có hàng chục hoặc hàng trăm lớp trở nên khả thi về mặt tính toán.

Đại họcGiảm chiều dữ liệu: SVD và PCA

Dữ liệu thực tế thường có các đặc trưng dư thừa, tương quan với nhau. Phân tích giá trị kỳ dị (SVD) phân tích bất kỳ ma trận AA nào (chẳng hạn nn điểm dữ liệu đã căn giữa xếp thành hàng) thành A=UΣV⊤A = U \Sigma V^\top, trong đó UU và VV có các cột trực chuẩn và Σ\Sigma là ma trận đường chéo với các phần tử không âm σ1≥σ2≥⋯≥0\sigma_1 \ge \sigma_2 \ge \cdots \ge 0, gọi là giá trị kỳ dị.

A=UΣV⊤A = U \Sigma V^\top

Phân tích thành phần chính (PCA) dùng các vector kỳ dị phải v1,v2,…v_1, v_2, \dots (các cột của VV) làm trục tọa độ mới: v1v_1 là hướng mà dữ liệu (đã căn giữa) trải rộng nhất, v2v_2 là hướng trải rộng nhì, v.v., mỗi hướng trực giao với các hướng trước. Chỉ giữ lại kk hướng đầu và bỏ phần còn lại nén dữ liệu trong khi giữ được nhiều biến thiên nhất có thể mà bất kỳ phép chiếu kk chiều nào cũng có thể giữ.

Cho A∈Rm×nA \in \mathbb{R}^{m \times n} có các giá trị kỳ dị σ1≥σ2≥⋯≥σr>0\sigma_1 \ge \sigma_2 \ge \cdots \ge \sigma_r > 0, và với k<rk < r đặt Ak=∑i=1kσiuivi⊤A_k = \sum_{i=1}^k \sigma_i u_i v_i^\top chỉ giữ kk thành phần kỳ dị đầu. Khi đó với mọi ma trận BB có rank⁡(B)≤k\operatorname{rank}(B) \le k, ∥A−B∥2≥σk+1\|A - B\|_2 \ge \sigma_{k+1}, và chặn này đạt được: ∥A−Ak∥2=σk+1\|A - A_k\|_2 = \sigma_{k+1}. Vậy AkA_k là xấp xỉ hạng kk tốt nhất của AA theo chuẩn toán tử.

Vì sao đúng?

Các giá trị kỳ dị đo mức độ AA kéo giãn vector theo mỗi hướng trực giao viv_i; giữ lại các giá trị lớn nhất và bỏ các giá trị nhỏ nhất nghĩa là bỏ đi các hướng mà AA kéo giãn ít nhất. Bất kỳ ma trận hạng kk nào khác BB đều phải thất bại trong việc tái tạo một hướng nào đó trong số k+1k+1 hướng kỳ dị hàng đầu (có quá nhiều hướng để vừa trong một ảnh kk chiều), và thất bại đó tốn ít nhất σk+1\sigma_{k+1}.

Chứng minh

Đạt được chặn. Vì U,VU, V có các cột trực chuẩn, ∥A−Ak∥2=∥U(Σ−Σk)V⊤∥2=∥Σ−Σk∥2\|A - A_k\|_2 = \|U(\Sigma - \Sigma_k)V^\top\|_2 = \|\Sigma - \Sigma_k\|_2, trong đó Σk\Sigma_k giữ kk giá trị kỳ dị đầu và đặt phần còn lại bằng 0. Σ−Σk\Sigma - \Sigma_k là ma trận đường chéo với các phần tử 0,…,0,σk+1,…,σr0, \dots, 0, \sigma_{k+1}, \dots, \sigma_r, nên chuẩn toán tử của nó là phần tử lớn nhất, σk+1\sigma_{k+1}.

Tính tối ưu. Cho BB là ma trận bất kỳ với rank⁡(B)≤k\operatorname{rank}(B) \le k; không gian không (hạt nhân) của nó có số chiều ít nhất n−kn - k. Đặt S=span⁡(v1,…,vk+1)S = \operatorname{span}(v_1, \dots, v_{k+1}), một không gian con (k+1)(k+1) chiều. Vì dim⁡(ker⁡B)+dim⁡(S)≥(n−k)+(k+1)=n+1>n\dim(\ker B) + \dim(S) \ge (n-k) + (k+1) = n+1 > n, hai không gian con này phải giao nhau nhiều hơn chỉ gốc tọa độ: tồn tại vector đơn vị z∈Sz \in S với Bz=0Bz = 0.

Viết z=∑i=1k+1civiz = \sum_{i=1}^{k+1} c_i v_i với ∑i=1k+1ci2=1\sum_{i=1}^{k+1} c_i^2 = 1 (vì zz có chuẩn đơn vị và các viv_i trực chuẩn). Vì Bz=0Bz = 0, ∥(A−B)z∥=∥Az∥=∥∑i=1k+1ciσiui∥=∑i=1k+1ci2σi2\|(A-B)z\| = \|Az\| = \left\|\sum_{i=1}^{k+1} c_i \sigma_i u_i\right\| = \sqrt{\sum_{i=1}^{k+1} c_i^2 \sigma_i^2}, dùng tính trực chuẩn của các uiu_i.

Vì σi≥σk+1\sigma_i \ge \sigma_{k+1} với mọi i≤k+1i \le k+1, ∑i=1k+1ci2σi2≥σk+12∑i=1k+1ci2=σk+12\sum_{i=1}^{k+1} c_i^2 \sigma_i^2 \ge \sigma_{k+1}^2 \sum_{i=1}^{k+1} c_i^2 = \sigma_{k+1}^2. Do đó ∥A−B∥2≥∥(A−B)z∥≥σk+1\|A-B\|_2 \ge \|(A-B)z\| \ge \sigma_{k+1} với mọi ma trận hạng ≤k\le k là BB, cùng với việc chặn đạt được, điều này chứng minh định lý.

Cùng AkA_k đó cũng cực tiểu hóa sai số theo chuẩn Frobenius trong số các ma trận hạng ≤k\le k, với sai số bị loại bỏ bằng các giá trị kỳ dị bị loại bỏ: ∥A−Ak∥F=∑i=k+1rσi2\|A - A_k\|_F = \sqrt{\sum_{i=k+1}^r \sigma_i^2}. Vì tổng phương sai của dữ liệu bằng ∑iσi2\sum_i \sigma_i^2, đây chính xác là phương sai mà PCA bỏ lại khi chỉ giữ kk thành phần — đại lượng này càng nhỏ, kk chiều càng tóm tắt trung thực dữ liệu gốc.

∥A−Ak∥F=∑i=k+1rσi2\|A - A_k\|_F = \sqrt{\sum_{i=k+1}^r \sigma_i^2}

Đại họcỨng dụng thực tiễn và Ví dụ minh họa

Các công cụ này xuất hiện cùng nhau trong hầu hết mọi hệ thống học máy thực tế: gradient descent (và các biến thể của nó) huấn luyện hệ thống gợi ý, bộ phân loại ảnh và mô hình ngôn ngữ; lan truyền ngược là thứ khiến việc huấn luyện mạng sâu cho nhận dạng giọng nói và thị giác máy tính khả thi; và PCA được dùng để nén dữ liệu gen, khử nhiễu tín hiệu cảm biến, và trực quan hóa các tập dữ liệu tài chính hoặc khoa học nhiều chiều xuống còn hai hoặc ba chiều.

Ví dụ: Một bước gradient descent để dự đoán giá nhà

Một trang bất động sản mô hình hóa giá dự đoán (đơn vị 100,000100{,}000 đô la) là y^=θx\hat y = \theta x, với xx là diện tích nhà (đơn vị 1,0001{,}000 feet vuông). Ba ngôi nhà huấn luyện cho (xi,yi)(x_i, y_i): (1,2)(1, 2), (2,3)(2, 3), (3,5)(3, 5). Dùng rủi ro thực nghiệm sai số bình phương R^(θ)=13∑i=13(θxi−yi)2\hat R(\theta) = \tfrac{1}{3}\sum_{i=1}^3 (\theta x_i - y_i)^2 và xuất phát từ θ0=1\theta_0 = 1, tìm θ1\theta_1 sau một bước gradient descent với η=0.05\eta = 0.05.

Lời giải

Trước tiên lấy đạo hàm: ∇R^(θ)=23∑i=13xi(θxi−yi)=23[(θ−2)+2(2θ−3)+3(3θ−5)]=23(14θ−23)\nabla \hat R(\theta) = \tfrac{2}{3}\sum_{i=1}^3 x_i(\theta x_i - y_i) = \tfrac{2}{3}\big[(\theta - 2) + 2(2\theta - 3) + 3(3\theta - 5)\big] = \tfrac{2}{3}(14\theta - 23).

Tính tại θ0=1\theta_0 = 1: các dự đoán là y^i=1,2,3\hat y_i = 1, 2, 3; phần dư y^i−yi=−1,−1,−2\hat y_i - y_i = -1, -1, -2; nên ∇R^(1)=23(14⋅1−23)=23(−9)=−6\nabla \hat R(1) = \tfrac{2}{3}(14 \cdot 1 - 23) = \tfrac{2}{3}(-9) = -6.

Áp dụng quy tắc cập nhật: θ1=θ0−η∇R^(θ0)=1−0.05×(−6)=1+0.3=1.3\theta_1 = \theta_0 - \eta \nabla \hat R(\theta_0) = 1 - 0.05 \times (-6) = 1 + 0.3 = 1.3.

Gradient âm nên gradient descent đã đẩy θ\theta tăng lên đúng hướng: tăng độ dốc giá-trên-diện-tích làm giảm sai số bình phương trên tập huấn luyện này, đưa θ\theta tiến về điểm tối ưu bình phương tối thiểu thật sự (hóa ra là θ⋆=23/14≈1.64\theta^\star = 23/14 \approx 1.64, tìm được bằng cách đặt ∇R^(θ)=0\nabla \hat R(\theta) = 0).

Ví dụ: Tìm thành phần chính của một ma trận hiệp phương sai

Hai đặc trưng đã căn giữa có ma trận hiệp phương sai Σ=(4221)\Sigma = \begin{pmatrix} 4 & 2 \\ 2 & 1 \end{pmatrix}. Tìm hướng của thành phần chính thứ nhất và tỉ lệ phương sai tổng nó giải thích được.

Lời giải

Các hướng chính là vector riêng của Σ\Sigma. Phương trình đặc trưng là det⁡(Σ−λI)=(4−λ)(1−λ)−2⋅2=λ2−5λ=0\det(\Sigma - \lambda I) = (4-\lambda)(1-\lambda) - 2 \cdot 2 = \lambda^2 - 5\lambda = 0, cho trị riêng λ1=5\lambda_1 = 5, λ2=0\lambda_2 = 0.

Với λ1=5\lambda_1 = 5: giải (Σ−5I)v=0(\Sigma - 5I)v = 0, tức (−122−4)v=0\begin{pmatrix} -1 & 2 \\ 2 & -4 \end{pmatrix} v = 0, cho v∝(2,1)v \propto (2, 1). Chuẩn hóa, hướng thành phần chính thứ nhất là u1=15(2,1)u_1 = \tfrac{1}{\sqrt5}(2, 1).

Tổng phương sai là tr⁡(Σ)=4+1=5\operatorname{tr}(\Sigma) = 4 + 1 = 5, bằng λ1+λ2=5+0\lambda_1 + \lambda_2 = 5 + 0. Tỉ lệ phương sai được giải thích bởi thành phần thứ nhất là λ1/(λ1+λ2)=5/5=100%\lambda_1/(\lambda_1+\lambda_2) = 5/5 = 100\%.

Vì λ2=0\lambda_2 = 0, tập dữ liệu này chính xác là một chiều: mọi điểm nằm đúng trên hướng (2,1)(2,1), nên chiếu lên đường thẳng duy nhất đó (xấp xỉ hạng 1) không mất thông tin nào cả, khớp với công thức Eckart–Young ∥A−A1∥F=λ2=0\|A-A_1\|_F = \sqrt{\lambda_2} = 0.

Hàm mất mát là L(θ)=(θ−4)2L(\theta) = (\theta - 4)^2. Xuất phát từ θ0=0\theta_0 = 0 với tốc độ học η=0.1\eta = 0.1, θ1\theta_1 sau một bước gradient descent là bao nhiêu?

Công thức nào định nghĩa đúng rủi ro thực nghiệm R^(θ)\hat R(\theta) cho tập huấn luyện nn ví dụ {(xi,yi)}\{(x_i,y_i)\} và hàm mất mát ℓ\ell?

Một ma trận có các giá trị kỳ dị σ1=6\sigma_1 = 6, σ2=3\sigma_2 = 3, σ3=2\sigma_3 = 2. Sai số theo chuẩn Frobenius ∥A−A1∥F\|A - A_1\|_F của xấp xỉ hạng 1 tốt nhất A1A_1 là bao nhiêu?

Mạng thị giác của một xe tự lái có 50 lớp. Tính gradient của mọi trọng số bằng lan truyền ngược tốn chi phí xấp xỉ một lượt lan truyền xuôi thêm, chứ không phải gấp 50 lần. Tính chất nào của lan truyền ngược giải thích điều này?

Tài liệu tham khảo

  1. Ian Goodfellow, Yoshua Bengio, Aaron Courville (2016). Deep Learning
  2. Christopher M. Bishop (2006). Pattern Recognition and Machine Learning
  3. Chiyuan Zhang, Samy Bengio, Moritz Hardt, Benjamin Recht, Oriol Vinyals (2017). Understanding deep learning requires rethinking generalization · arXiv:1611.03530
  4. Arthur Jacot, Franck Gabriel, Clément Hongler (2018). Neural Tangent Kernel: Convergence and Generalization in Neural Networks · arXiv:1806.07572
  5. Mikhail Belkin, Daniel Hsu, Siyuan Ma, Soumik Mandal (2019). Reconciling modern machine learning practice and the classical bias-variance trade-off · arXiv:1812.11118