Perceptron 의 구조
입력층과 출력층으로 구성되어 있으며 출력층으로 구성되어 있다.
입력층은 d+1개의 노드를 가지고, 출력층은 1개의 노드를 가진다.
여기서 d는 특징 벡터의 차원을 의미한다.
입력 노드 xi와 출력 노드 o는 가중치 wi를 통해 연결된다.

x0=1은 바이어스를 위한 입력으로 항상 1이다.
출력은 계단함수를 사용하여 결정되는데, 입력값 x 가중치의 합을 활성 함수에 통과시킨다.
이 값이 양수이면 1, 음수면 0으로 출력되는 것이다.
Perceptron의 학습 메커니즘
학습된 퍼셉트론이 있다면 데이터를 보고 올바르게 인식할 수 있다.
실제 상황에서는 학습 알고리즘이 가중치들을 직접 찾아야 한다.
단순한 이진 분류 데이터라면 쉽게 계산이 가능하지만, 복잡한 데이터 (64차원, 1797개의 샘플 등)는 학습 알고리즘 없이는 불가능하다.
사람의 수영 학습 vs 사람의 수영 학습 (수학적 기술)

이러한 알고리즘을 활용하여 신경망의 학습을 진행하면 된다.
신경망의 학습

훈련 데이터를 입력 데이터로, 최적의 가중치를 출력 데이터로 설정한다.
신경망은 인간과 다르게 수학에 기반하여 작동한다.
신경망의 학습은 일종의 최적화 문제인데, 이 최적화 대상이 바로 가중치(파라미터)이다.
학습은 곧 손실 함수를 최소화하는 가중치의 조합을 찾아내는 과정이다.
(이 과정에서 경사하강법 같은 최적화 알고리즘이 사용되는 것)
Neuronal model (multi-input, one-ouput)
일반적인 뉴런 프로세스 요소(PE: 일반적으로 뉴런 하나)는 Unit, cell, node이다.
보통 아래 사진과 같이 다중 입력, 단일 출력 형태를 가진다.

각 입력에 대한 가중치가 존재하는데, 모든 입력값 x 각 가중치값의 합산을 응답 함수인 f에 통과시켜 출력 Y를 얻게 되는 것이다.
F(x)의 의미
PE 상태
Y = 1 → 흥분된 뉴런
Y = 0 → 억제된 뉴런
Wi는 가중치로 시냅스 연결 강도를 의미한다.
이 값은 학습을 통해 변화될 수 있는 값이다!
학습의 목표가 출력 오차를 줄이는 방향으로 가중치를 조정하는 것이다.
신경망의 뉴런들은 서로 연결되어 있는데, 이 연결을 시냅스라고 부르고, 이 연결 강도를 숫자로 나타낸 것이 가중치이다.
가중치가 양수이면 흥분성 연결, 즉 연결된 뉴런을 더 활성화 시키는 것을 의미한다 .
반대로 가중치가 음수이면 억제성 연결, 즉 연결된 뉴런을 더 억제하는 것을 의미한다.
대표적인 손실함수에는 계단 함수, 시그모이드 함수, 임계 함수 등이 있다.

Hebb's 학습 룰
1949년 심리학자 Hebb이 제안한 뇌의 학습 모델로, 같이 활성화 되는 뉴런들 사이의 연결은 강화된다는 것이다.
즉, A뉴런이 B 뉴런을 자주 자극해서 둘이 자주 같이 활성화가 된다면, 그 시냅스 연결은 점점 더 강해진다는 것이다.
이를 인공 신경망에 적용하면 A와 B가 같이 자주 활성화되면, A에서 B로 가는 가중치를 증가시킨다.

학습 절차
1. 무작위로 초기 가중치를 설정한다.
2. 입력 데이터를 넣고 평가한다.
3. 잘못됐다면 가중치를 수정한다.
4. 이 과정을 반복하면서 최적의 값에 가까워진다.

단일 퍼셉트론
퍼셉트론은 1957년 심리학자 Rosenblatt이 제안한 신경망 모델이다.
목표는 고양이 vs 강아지, 일반 메일 vs 스팸 메일 등 패턴을 분류하는 것이다.
입력 → 가중치 곱 → 합산 → 활성화 함수 → 출력 순서로 작동한다.
두 개의 신호를 받으면 학습으로 인식 개선이 가능하다.
이 말은, 퍼셉트론이 단순히 입력을 받기만 하는 것이 아니라 학습 데이터를 통해 스스로 인식 능력을 개선한다는 의미이다.
처음에는 분류를 잘 못하지만, 입력과 정답을 비교하고 가중치를 수정하며 점점 더 정확한 분류가 가능해지는 것이다.

퍼셉트론의 한계점
1. 지역 최소값 (local minima)에 빠질 수 있음
전체에서 가장 낮은 지점이 아니라 어정쩡하게 낮은 지점에 빠질 수 있다.
이는 학습이 더 이상 개선되지 않고 멈추는 문제가 발생한다.
2. 전방향(feedforward) 방식
입력에서 출력으로 한 방향으로 정보가 흐른다.
3. 학습이 수렴할 때까지 많은 시간이 걸림
파라미터 수가 많고, 기울기 계산도 반복해야 하기때문에 학습 속도가 느리다.
4. 추가 학습 시 전체적인 재학습 필요
새로운 데이터를 조금만 추가해도 전체 네트워크를 다시 학습해야 할 수도 있다.
5. 학습의 완료 시점을 예측할 수 없음
언제 최적 상태에 도달할지 기약이 없고, 오차가 진동하거나 정체 구간에 머무를 수 있다.
MLP와 역전파
다층 신경망 (MLP)은 은닉층이 있는 구조이다.
이 구조는 역전파라는 학습 방법을 사용하는데, 역전파는 오차를 기울기를 따라 전파하면서 가중치를 조정한다.
이 방식을 Generalized Delta Rule이라고 한다.

신경망 비교

'CS > 기계학습' 카테고리의 다른 글
| [기계학습] Neural Network - Deep Learning의 한계와 발전 (3) | 2025.06.12 |
|---|---|
| [기계학습] Neural Network - Deep Learning 기초 (0) | 2025.06.12 |
| [기계학습] Neural Network - history (0) | 2025.06.11 |
| [기계학습] Probabilistic Model (1) | 2025.05.29 |
| [기계학습] Regression (5) | 2025.05.29 |