본문 바로가기

명징직조

신경망은 왜 필요한 것보다 큰가 - MEASURING THE INTRINSIC DIMENSIONOF OBJECTIVE LANDSCAPES

1. 전체 파라미터 수와 실제 필요한 자유도는 다르다

파라미터가 D 개인 신경망을 생각하면, 일반적인 학습은 다음 공간 전체에서 이루어진다.

  • theta ∈ R^D

하지만 이 D 개의 파라미터가 모두 독립적으로 조절되어야만 문제를 해결할 수 있는 것은 안디ㅏ

논문은 파라미터를 다음과 같이 제한

  • theta = theta_0 + P_z
    • theta_0 고정된 초기 파라미터
    • P 고정된 무작위 투영 행렬
    • z 실제로 학습하는 작은 파라미터 벡터

원래는 D 개의 파라미터를 각각 조정할 수 있지만, 실험에서는 임의의 d 차원 부분공간 안에서만 움직이게 한다. 

그런데도 충분한 성능을 얻는 최소 d 가 존재 이것을 논문에서는 대략적인 intrinsic dimension 으로 정의

 

해를 만드는 데 필요한 차원

전체 파라미터가 1000개지만, 실제로는 10개의 독립적인 조건만 맞추면 되는 문제의 경우 

990 개의 방향은 바꾸어도 여전히 정담

 

논문에서 발견한 중요한 결과

1. 모델 크기는 크게 증가했지만 instrinsic dimension 은 거의 증가하지 않았다

네트워크를 훨씬 크게 만들어도 문제 해결에 필요한 본질적인 자유도는 거의 그대로

문제를 풀 만큼 모델이 커진 이후 추가되는 파라미터는 필요한 자유도를 늘리기보다 해의 중복성을 증가시킨다.

모데링 커질수록 정답이 도리 수 있는 파라미터 조합의 차원이 커진다.

 

2. 실제 파라미터 중 극히 일부의 자유도만으로도 성능을 얻었다.

 

그렇다면 큰 네트워크는 불필요한가

큰 네트워크의 추가 파라미터는 표현 능력만 늘리는 것이 아니라, 학습 가능한 해를 찾기 쉽게 만드는 역할을 할 수 있다. 

작은 모델에서는 좋은 해가 제한적으로만 존재할 수 있음

큰 모델에서는 같은 기능을 구현하는 해가 수많은 파라미터 좋바으로 존재

하나의 점이 아닌 고차원 manifold 를 이룬다는 것