메타, 첫 자체 학습용 AI 칩 ‘MTIA 300’ 공개…”네트워크를 칩 안으로”

메타가 자체 개발 AI 가속기 ‘엠티아이에이 300′(MTIA 300)을 공개했다. 학습(트레이닝)에 최적화된 자체 칩으로는 첫 작품이며, 이미 양산돼 메타의 16개 데이터센터에 배치된 상태다. 칩 안에 네트워크 인터페이스를 직접 넣어 통신 병목을 없앤 설계가 핵심으로 꼽힌다.

발표 내용은 무엇인가

메타 엔지니어링 블로그에 따르면 MTIA 300은 콘텐츠 추천·랭킹 모델 학습 전용으로 설계됐다. 초당 800기가비트 규모의 맞춤형 네트워크 인터페이스(RDMA NIC) 12개를 칩 패키지 안에 직접 통합해, PCI 버스를 거치지 않고도 초당 1.2테라바이트의 입출력 대역폭을 확보했다.

여기에 통신 전용 ‘메시지 엔진’ 16개를 따로 두어 올리듀스·올투올·올개더 같은 집합 통신을 연산과 분리해 처리한다. 그 결과 통신을 병렬로 돌릴 때 연산 성능 저하가 0.5% 미만에 그친다. 일반 GPU에서는 통신이 연산 자원을 함께 쓰면서 20%를 넘는 성능 저하가 발생하는 것과 대비된다.

칩과 함께 설계한 통신 라이브러리 ‘HCCL’은 랙(서버 장비 수납 장) 하나 안에서 초당 최대 940기가바이트의 통신 대역폭을 낸다. 1500억 개 파라미터 규모의 실제 운용 추천 모델을 40개 가속기로 학습할 때 총 통신 시간은 동급 GPU 클러스터보다 3.9배 빠르다고 메타는 밝혔다.

배경

추천 모델 학습은 대규모 언어 모델과 달리 순수 연산량보다 기기 사이 통신이 병목이 되는 경우가 많다. 메타는 통신을 ‘일급 시민’으로 취급하는 칩 설계로 이 문제에 정면으로 접근했다.

더 큰 흐름은 엔비디아 같은 외부 공급자에 대한 의존도를 줄이는 것이다. 구글이 TPU로 먼저 자체 실리콘 길을 연 데 이어 마이크로소프트·아마존도 자체 AI 칩을 확대하는 가운데, 메타는 추론용으로 쓰던 MTIA 계열을 학습까지 확장하며 속도를 붙이고 있다.

전망

메타는 후속 세대인 MTIA 400·450·500을 2026년부터 2027년 사이 순차 배치할 계획이며, 이들 칩은 생성 AI 학습·추론까지 지원 범위를 넓힌다. 자체 칩 비중이 커질수록 데이터센터 운영 비용과 전력 부담을 줄일 수 있어, 엔비디아 중심의 AI 인프라 시장 판도에 변수가 될지 주목된다.

다만 당장은 추천·랭킹이라는 특정 작업에 특화된 칩이라는 한계가 있다. 대규모 언어 모델 학습까지 대체하려면 후속 세대의 실제 성능이 입증돼야 한다. 국내 입장에서는 빅테크의 자체 칩 확대가 파운드리와 첨단 메모리 수요 구조를 바꿀 수 있다는 점에서 지켜볼 대목이다.

원문: 메타 엔지니어링 블로그 공식 발표 / 관련: 인텔, 에이전틱 AI 시대 칩 아키텍처 3종 공개

자주 묻는 질문

Q. MTIA 300은 어떤 용도의 칩인가요?
A. 페이스북·인스타그램 등 메타 서비스의 콘텐츠 추천·랭킹 모델을 학습시키기 위한 전용 가속기입니다. 범용 GPU와 달리 통신 효율에 최적화된 것이 특징입니다.

Q. 일반 GPU와 뭐가 다른가요?
A. 네트워크 인터페이스 12개를 칩 패키지 안에 직접 넣고, 통신 전용 엔진 16개를 따로 둬서 연산과 통신이 서로 자원을 빼앗지 않는 구조입니다.

Q. 성능은 얼마나 좋아졌나요?
A. 1500억 개 파라미터 규모 추천 모델 기준으로 동급 GPU 클러스터 대비 학습 중 통신 시간이 3.9배 빠르고, 통신 병렬 실행 시 연산 성능 저하도 0.5% 미만입니다.

Q. 이미 쓰이고 있나요?
A. 네. MTIA 300은 이미 양산돼 메타의 16개 데이터센터에 배치됐으며, 후속 버전인 MTIA 400·450·500은 2026~2027년 순차 투입될 예정입니다.

Related Post