왜 지금 '하이브리드 모델'을 토큰 단위로 봐야 하는가

요즘 LLM 아키텍처 논쟁에서 가장 뜨거운 키워드 중 하나가 하이브리드(hybrid) 모델이에요. 어텐션 레이어 몇 개는 그대로 두고, 나머지를 순환(recurrent) 레이어로 갈아끼운 구조인데요. 표준 벤치마크 점수만 보면 "트랜스포머랑 비슷하거나 살짝 낫다" 수준이라, **그래서 대체 어디가 어떻게 좋은 건데?**라는 질문이 늘 남습니다.

이 글은 그 질문에 토큰 레벨에서 답한 실험을 정리한 거예요. 같은 데이터, 같은 토크나이저, 같은 학습 레시피로 만든 7B 트랜스포머(Olmo 3)와 7B 하이브리드(Olmo Hybrid)를 1:1로 붙여놓고, 토큰 하나하나마다 두 모델이 실제 정답 토큰에 얼마나 높은 확률을 줬는지 비교했습니다. 아키텍처 말고는 변수를 최대한 통제했기 때문에, 여기서 나오는 차이는 거의 순수하게 구조 차이에서 온다고 봐도 됩니다.

이런 토큰 단위 분석은 실무에서도 중요해요. 모델을 고를 때 "평균 loss 3.2 vs 3.1" 같은 숫자만 보면 뭘 얻고 뭘 포기하는지 전혀 감이 안 오거든요. 근거자료는 Hugging Face 블로그의 원 리포트에서 확인할 수 있습니다.

Researcher comparing transformer and hybrid LLM token prediction outputs on laptop screen with loss gap charts Coding Session Visual

어텐션 vs 순환: 두 메커니즘의 근본 차이

비교에 들어가기 전에 두 레이어가 뭘 잘하는지부터 정리할게요.

어텐션 레이어 (트랜스포머)

  • 모든 이전 토큰을 한 번에 직접 참조할 수 있어요.
  • 그래서 **멀리 떨어진 토큰을 정확히 그대로 복사(recall)**하는 데 강합니다.
  • 대신 입력이 길어질수록 비용이 제곱으로 증가하고, 시간에 따라 순차적으로 진화하는 정보(상태 추적)를 표현하는 건 약해요.

순환 레이어 (하이브리드)

  • 토큰을 좌→우로 읽으면서 고정 크기 메모리에 접어 넣습니다.
  • 입력이 아무리 길어져도 토큰당 비용이 **일정(flat)**해요.
  • 메모리가 압축·손실되기 때문에 과거 토큰을 정확히 되꺼내는 건 못 합니다.
  • 대신 읽는 동안 변하는 상태(state)를 계속 갱신하는 데 강해요.

정리하면 **"정확한 복사 = 어텐션", "상태 추적 = 순환"**이라는 상보적 강점 구조입니다.

실험 방법 (loss gap)

# 두 모델의 토큰별 loss gap 계산 개념도
# gap > 0 이면 하이브리드가 더 잘 예측, gap < 0 이면 트랜스포머가 더 잘 예측

def token_loss_gap(transformer_logits, hybrid_logits, target_token_id):
    # 각 모델이 실제 정답 토큰에 부여한 확률을 로그 스케일로 변환
    t_loss = -torch.log_softmax(transformer_logits, dim=-1)[target_token_id]
    h_loss = -torch.log_softmax(hybrid_logits, dim=-1)[target_token_id]
    # loss gap: 하이브리드가 낮은 loss → 양수
    return t_loss - h_loss

# 카테고리별 평균 + 회귀 분석으로 희소성/반복 같은 교란 변수 통제

데이터는 위키피디아, 책, 논문 같은 자연어 산문과 Python, HTML, LaTeX 같은 구조화된 텍스트를 모두 사용했습니다.

Token-level loss gap heatmap visualization comparing Olmo 3 transformer and Olmo Hybrid architectures across content and function words Developer Related Image

결과: 하이브리드가 이기는 곳, 트랜스포머가 이기는 곳

하이브리드가 강한 구간

  • 내용어(content words): 명사, 동사, 형용사 — 문장이 '무엇에 관한 것인지'를 결정하는 단어들. loss gap이 뚜렷하게 양수.
  • 부사/형용사: 하이브리드 우위가 특히 두드러짐.
  • 대명사 참조 해석: "그 사람이 누구를 가리키는가" 같은 문맥 추적이 필요한 토큰.
  • 일부 기능어: "there" 같은 존재사(existential)도 하이브리드가 강했음 — 문맥 의존적이라 순환 레이어의 상태 추적이 유리.

트랜스포머가 강한 구간

  • 반복 n-gram 복사: 앞서 나온 구절이 그대로 다시 나올 때. 반복 구간이 길수록 하이브리드의 이점은 0에 수렴.
  • 닫는 괄호(closing brace): } ) ] 예측. 언어·코드·마크업 전반에서 재현됨. 여는 괄호는 해당 없음. 어텐션만으로 괄호 매칭을 표현할 수 있다는 기존 연구와 일치.

정리 표

토큰 유형하이브리드 우위트랜스포머 우위이유
명사/동사/형용사의미 합성 + 상태 추적
부사/형용사문맥 의존도 높음
대명사 참조순차 상태 갱신
기능어(일부)존재사 등 문맥 의존
반복 n-gram정확한 복사 = 어텐션
닫는 괄호어텐션만으로 충분

실무 적용: '필터링된 토큰 loss'로 아키텍처 비교하기

이 연구의 진짜 실용적 성과는 필터링된 토큰 loss(filtered token loss)를 평가 지표로 쓰자는 제안이에요. 1B 파라미터 트랜스포머 / 하이브리드 / 순수 순환 모델 3개를 비교했을 때:

  • 의미 있는 비-반복 토큰에서는 하이브리드와 순수 순환이 트랜스포머를 앞지름(하이브리드가 최고).
  • 반복 토큰에서는 어텐션이 전혀 없는 순수 순환이 하이브리드와 트랜스포머 양쪽에 뒤짐.

즉, 사전학습 초기 단계에서 단일 평균 loss로는 절대 안 보이던 복사 능력·내용어 차이가 필터링된 loss로 드러납니다. 여러분이 아키텍처 A/B 테스트를 할 때 평균 loss만 보면 이런 신호를 통째로 놓친다는 뜻이에요.

Server rack powering LLM pretraining pipeline for transformer versus recurrent hybrid architecture experiments Dev Environment Setup

그래서 실무에서는 어떻게 써야 하나

1. 평균 loss 하나로 아키텍처를 비교하지 마세요. 트랜스포머 vs 하이브리드 같은 구조 비교에서는 평균 loss가 너무 뭉툭한 지표예요. 최소한 (a) 내용어, (b) 반복 n-gram, (c) 구조적 토큰(괄호, 태그) 세 카테고리로 나눠서 loss를 봐야 실제 강약이 보입니다.

2. 워크로드에 따라 아키텍처를 고르세요.

  • 요약·복사·코드 인용처럼 긴 입력에서 정확한 재현이 중요한 태스크 → 어텐션 비중이 높은 구조가 유리.
  • 추론·대화·상태 추적, 롱컨텍스트에서 비용 효율이 중요한 태스크 → 하이브리드가 매력적.

3. 이 기술의 한계와 주의사항

  • 이 실험은 7B / 1B 스케일에서의 결과예요. 스케일이 커지면 우위 지형이 바뀔 수 있습니다.
  • loss gap은 다음 토큰 예측 지표일 뿐, 실제 다운스트림 태스크 성능과 1:1 대응하지 않아요.
  • 토큰 카테고리 분류는 언어·토크나이저에 의존하므로, 한국어처럼 교착어 특성이 강한 언어에서는 카테고리 경계가 흐려질 수 있습니다.
  • 국내 환경에서 특히 주의할 점: 한국어는 조사·어미가 토큰 경계를 자주 넘나들어서 '기능어 vs 내용어' 분리가 영어만큼 깔끔하지 않아요. 필터링된 loss를 한국어 모델에 적용하려면 카테고리 정의부터 자체적으로 재설계해야 합니다.

4. 다음 단계 학습 방향

  • 원 논문의 필터링된 loss 지표를 여러분의 사전학습 파이프라인에 직접 붙여보세요. 학습 초반에 아키텍처 차이가 어디서 벌어지는지 즉시 관찰할 수 있습니다.
  • 어텐션 레이어를 몇 개 남길지(하이브리드 비율)를 토큰 카테고리별 loss로 튜닝하는 것도 재미있는 실험 주제예요.
  • 롱컨텍스트 RAG 파이프라인을 운영 중이라면, 복사 구간에서 생기는 약점을 어떻게 보완할지 먼저 벤치마크해보시길 권합니다.

함께 보면 좋은 글

본 콘텐츠는 신뢰할 수 있는 출처를 바탕으로 AI 도구를 활용하여 초안이 작성되었으며, 편집자의 검토를 거쳐 발행되었습니다. 전문가의 조언을 대체하지 않습니다.