본문 바로가기

AI Compiler framework

AICF v2 기술 설계 및 구현 명세서

1. 프로젝트 개요

그래프 기반 AI 컴파일러, 연산 그래프의 사전 정의, CUDA Graph 로 캡처하여 최적의 성능으로 리플레이

 

2. 핵심 아키텍처 레이어

프론트엔드

  • Sequential & Model : 연산의 흐름을 정의하고, 내부적으로 Builder 를 통해 IR 을 생성한다.
  • 표준 레이어 인터페이스 : 각 레이어는 emit 와 emit_backward 명세를 가진다.

 

자동 미분 엔진

  • Tape Recording : 순전파 시 inputs, outputs, params 를 테이프에 기록하여 역전파 시 데이터 종속성을 해결한다.
  • Symbolic Backward : grad_initial 로부터 시작하여 테이프를 역순으로 순회하며 각 레이어의 미분 커널을 자동으로 배치

 

백엔드

  • KID (Kernel ID) 시스템 : C++ 백엔드와 1:1 매핑되어 실행 커널을 식별한다.

 

3. 수치적 검증 및 학습 성과

수치적 정합성 (Numerical Parity)

  • Softmax/XENT: PyTorch Reference 대비 오차 이하 달성.
  • Autodiff: 연쇄 법칙(Chain Rule)이 다층 신경망(MLP)에서 완벽히 작동함을 증명.

 

MNIST 실전 학습 결과

  • 모델 구조: 784(Input) → 128(Hidden) → 10(Output) + Softmax
  • 학습 성과: 5 Epoch 기준 정확도 44.38% 기록 (상승 곡선 확인).
  • 의의: 단순 수치 계산을 넘어, 대량의 외부 데이터를 로드하고 GPU 상에서 가중치를 반복 업데이트하는 전체 학습 루프(Training Loop) 완성.