1. 전체 파라미터 수와 실제 필요한 자유도는 다르다
파라미터가 D 개인 신경망을 생각하면, 일반적인 학습은 다음 공간 전체에서 이루어진다.
- theta ∈ R^D
하지만 이 D 개의 파라미터가 모두 독립적으로 조절되어야만 문제를 해결할 수 있는 것은 안디ㅏ
논문은 파라미터를 다음과 같이 제한
- theta = theta_0 + P_z
- theta_0 고정된 초기 파라미터
- P 고정된 무작위 투영 행렬
- z 실제로 학습하는 작은 파라미터 벡터
원래는 D 개의 파라미터를 각각 조정할 수 있지만, 실험에서는 임의의 d 차원 부분공간 안에서만 움직이게 한다.
그런데도 충분한 성능을 얻는 최소 d 가 존재 이것을 논문에서는 대략적인 intrinsic dimension 으로 정의
해를 만드는 데 필요한 차원
전체 파라미터가 1000개지만, 실제로는 10개의 독립적인 조건만 맞추면 되는 문제의 경우
990 개의 방향은 바꾸어도 여전히 정담
논문에서 발견한 중요한 결과
1. 모델 크기는 크게 증가했지만 instrinsic dimension 은 거의 증가하지 않았다
네트워크를 훨씬 크게 만들어도 문제 해결에 필요한 본질적인 자유도는 거의 그대로
문제를 풀 만큼 모델이 커진 이후 추가되는 파라미터는 필요한 자유도를 늘리기보다 해의 중복성을 증가시킨다.
모데링 커질수록 정답이 도리 수 있는 파라미터 조합의 차원이 커진다.
2. 실제 파라미터 중 극히 일부의 자유도만으로도 성능을 얻었다.
그렇다면 큰 네트워크는 불필요한가
큰 네트워크의 추가 파라미터는 표현 능력만 늘리는 것이 아니라, 학습 가능한 해를 찾기 쉽게 만드는 역할을 할 수 있다.
작은 모델에서는 좋은 해가 제한적으로만 존재할 수 있음
큰 모델에서는 같은 기능을 구현하는 해가 수많은 파라미터 좋바으로 존재
하나의 점이 아닌 고차원 manifold 를 이룬다는 것
'명징직조' 카테고리의 다른 글
| 0과 1은 물리적으로 무엇인가 (0) | 2026.07.08 |
|---|---|
| 기계어와 회로 연산 (0) | 2026.07.08 |
| 옌센 부등식 — 평균을 먼저 계산하는 것과 변환한 뒤 평균내는 것은 다르다 (0) | 2026.07.06 |
| 규모 불변성과 거듭제곱 법칙 - 확대해도 같은 구조가 나타나는 이유 (0) | 2026.07.06 |
| AI 와 양자 컴퓨팅의 대비 - 특정한 수학적 구조를 정확히 찾아낸 경우에만 강력해지는 계산 방식 (0) | 2026.07.01 |