찾아보고 싶은 뉴스가 있다면, 검색
검색
최근검색어
  • 블랙웰 GPU
    2026-10-07
    검색기록 지우기
  • 쉼터
    2026-10-07
    검색기록 지우기
  • 단수
    2026-10-07
    검색기록 지우기
  • 커브
    2026-10-07
    검색기록 지우기
  • 오아
    2026-10-07
    검색기록 지우기
저장된 검색어가 없습니다.
검색어 저장 기능이 꺼져 있습니다.
검색어 저장 끄기
전체삭제
총 64 건
  • 엔비디아 독주에 도전장 내민 인텔 가우디3…성공할 수 있을까? [고든 정의 TECH+]

    엔비디아 독주에 도전장 내민 인텔 가우디3…성공할 수 있을까? [고든 정의 TECH+]

    최근 IT 업계의 최대 화두는 AI입니다. 주요 프로세서 제조사와 빅테크들은 너도나도 AI 기반 서비스, 플랫폼, 하드웨어를 선보이면서 시장을 선점하기 위해 노력하고 있습니다. 하지만 AI 하드웨어 시장에서는 초반부터 기세를 장악한 엔비디아의 강세가 계속 이어지고 있습니다. 인텔은 엔비디아의 AI GPU의 대항마로 가우디 AI 가속기를 내놓고 반전을 모색하고 있습니다. 하지만 이를 위해서는 AI 하드웨어만이 아니라 이 하드웨어를 사용하는 개발자와 개발 생태계가 필요합니다. 인텔의 비전 2024 행사에서는 차세대 AI 가속기인 가우디 3(Gaudi 3)의 공개와 함께 깜짝 손님으로 한국의 네이버가 초대됐습니다. 네이버는 가우디 2를 인텔 클라우드에서 테스트해 거대 언어 모델 (LLM) 성능을 검증하고 개발했습니다. 네이버 개발팀에 따르면 가우디 2는 전력 대 성능비가 우수하고 LLM에 강점을 지닌 AI 가속 하드웨어입니다. 네이버 클라우드와 인텔은 AI 공동연구센터(NICL, NAVER Cloud·Intel·Co-Lab)를 설립하고 카이스트, 서울대, 포스텍 등 국내 대학 및 스타트업과 함께 AI 생태계 구축에 나서기로 했습니다. 다만 가우디 2가 네이버의 AI 서비스에 바로 활용되는 것은 아닙니다. 가우디는 최근에야 시장에 합류한 신참으로 이미 시장에서 견고한 위치를 차지하고 있는 엔비디아 GPU처럼 바로 서비스에 투입할 만큼 생태계가 구축되어 있지 않습니다. 여기에 엔비디아가 계속해서 차세대 GPU를 개발하면서 경쟁자를 저 멀리 따돌리려고 하고 있기 때문에 이를 추격하기 위해서는 가우디 2의 상용화보다 후속 모델 개발에 집중해야 할 형편입니다. 따라서 이날 행사에서 인텔은 차세대 AI 가속기인 가우디 3를 공개하고 올해 하반기에 출시한다고 발표했습니다. 가우디 3는 TSMC의 5nm 공정으로 제조되며 128GB의 HBM2e 메모리를 탑재하고 있습니다. 트랜지스터 집적도를 비롯한 더 구체적인 정보는 공개하지 않았지만, 가우디 2와 비교해서 텐서 코어를 24개에서 64개로 늘리고 연산 능력도 865 TFLOPS에서 1835 TFLOPS로 두 배 이상 대폭 늘렸다는 것이 인텔의 설명입니다.비전 2024 행사에서 인텔은 가우디 3가 엔비디아의 H100보다 더 빠르다고 주장했습니다. 예를 들어 Llama2-13B 훈련 기준으로 1.7배 빠르고 GPT 3 – 175B에서는 1.5배 빠릅니다. 그리고 다른 AI 연산에서도 전력 대 성능비로 우위에 있다는 것이 인텔의 주장입니다. 하지만 이 주장이 맞다고 해도 인텔의 도전은 쉽지 않은 게 사실입니다. H100은 이제 출시된 지 2년이 지난 제품이고 엔비디아는 이미 그 후속작인 블랙웰 GPU를 공개했기 때문입니다. 블랙웰 B200의 AI 연산 능력은 FP 8 기준으로 4.5페타플롭스로 단순 수치만 봐도 가우디 3보다 몇 배 뛰어납니다. 여기에 AI 서비스 기업과 개발자들이 사용하기 쉬운 생태계가 이미 구축된 점은 엔비디아 AI 하드웨어의 넘볼 수 없는 장점입니다. 이런 점을 봤을 때 가우디 3가 시장에서 의미 있는 성과를 거둘 수 있을지는 아직 미지수입니다. 하지만 엔비디아의 AI 하드웨어가 공급 부족에 시달리는 점이 한 가지 변수가 될 수 있습니다. 공급난을 타개하기 위해 엔비디아 GPU 이외에 다른 대안에 눈을 돌리는 기업이 많아질 수 있기 때문입니다. 한국과 손잡은 인텔의 가우디 AI 가속기가 치열한 경쟁 속에서 자신의 입지를 확보할지, 아니면 경쟁에서 밀려나 사라질지는 아직 말하기 이릅니다. 하지만 발전 속도가 매우 빠르고 한 번 뒤처지면 따라잡기 어려운 IT 분야의 속성을 생각할 때 결론이 나오는 것은 먼 미래가 아닐 것으로 생각합니다.
  • 현 시대 AI 하드웨어 최강자…엔비디아 블랙웰 GPU [고든 정의 TECH+]

    현 시대 AI 하드웨어 최강자…엔비디아 블랙웰 GPU [고든 정의 TECH+]

    엔비디아는 AI 시대에 가장 가치가 치솟은 기업입니다. 현재의 AI 기술 중 상당 부분이 이 회사가 만든 GPU에 의존하고 있기 때문입니다. 오래전부터 GPU의 병렬 연산을 위해 CUDA 코어와 소프트웨어를 공개했고 이를 AI 연산에 활용하는 생태계를 구축해 왔기 때문에 지금 와서 다른 회사의 하드웨어로 이를 대체하기 힘든 것이 현실입니다. 오랜 경쟁자인 AMD도 데이터 센터 GPU를 계속 공개하고 있고 인텔도 새로운 AI 시장 공략을 위해 GPU를 공개했지만, 시장을 먼저 선점한 엔비디아의 아성을 깨뜨리기는 쉽지 않습니다. 이런 상황에서 새로 공개한 블랙웰 GPU는 반도체 미세 공정의 한계를 극복하고 AI 연산 성능을 높여 누구도 따라잡기 쉽지 않은 경쟁력을 유지하려는 의도로 풀이됩니다. 블랙웰 GPU는 TSMC의 4nm 공정의 개량형인 4NP 공정으로 제조되었습니다. 3nm 공정을 적용하지 않은 이유는 확실치 않지만, 비용 및 공급 부족 등이 이유가 된 것으로 보입니다. 하지만 그런 만큼 트랜지스터 집적도를 전 세대인 호퍼 (Hopper)보다 더 높이기 힘든 상황입니다. 800억 개의 트랜지스터를 집적한 호퍼 H100 GPU는 4nm 공정에서 다이(die, 웨이퍼에서 잘라낸 반도체 칩) 면적이 814㎟에 달합니다. 이는 현재 반도체 제조 기술에서 이론적인 다이 크기의 한계치에 거의 근접한 것으로 더 크기를 늘리기 쉽지 않습니다. 따라서 블랙웰 B200은 두 개의 다이를 연결하는 방법으로 2080억 개의 트랜지스터를 집적했습니다. 이런 접근법은 최근 점점 일반적인 추세가 되고 있습니다. 공정 미세화의 한계에 부딪힌 반도체 제조사들은 하나의 큰 칩 대신 여러 개의 작은 칩인 칩렛을 연결해 거대한 크기의 프로세서를 만들고 있습니다. 인텔, AMD, 애플이 모두 이 방법을 사용했고 이번에는 엔비디아도 이 방식을 적용해 트랜지스터 집적도를 대폭 늘렸습니다. 블랙웰 B200은 AI 연산에서 전 세대인 H100과 비교해서 최대 5배인 20페타플롭스의 성능을 지니고 있습니다. 물론 칩을 두 개 붙인 점을 생각하면 실제 성능은 2.5배라고 할 수 있는데, 실은 FP 8 연산의 절반 정도의 자원을 소모하는 FP 4 연산에서 그렇다는 이야기로 FP 8 기준으로 보면 AI 연산 능력은 절반 수준인 10페타플롭스가 최대입니다. 결국 칩 하나의 성능은 사실 1.25배 정도로 트랜지스터 수 증가를 생각하면 딱 그 정도의 성능 증가인 셈입니다. 하지만 그렇다고 해서 블랙웰이 아무 의미 없는 꼼수에 지나지 않는 것은 아닙니다. FP 4 연산만 해도 충분한 경우 AI 연산 속도를 크게 높일 수 있고 심지어 FP 4와 FP 8 연산의 중간을 원하는 고객을 위해 FP 6까지 지원하는 기능을 갖춰 더 유연한 AI 연산이 가능합니다. 그보다 더 중요한 점은 AI 경쟁이 격화되면서 어떤 비용을 치르더라도 남들보다 앞서기를 원하는 고객을 위해 성능을 높일 수 있는 다양한 옵션을 제공하고 있다는 것입니다.예를 들어 블랙웰은 기반 GB 200은 그레이스 슈퍼칩 CPU 한 개와 두 개의 B200 GPU를 하나로 묶어 최대 40페타플롭스의 AI 연산 능력을 갖고 있습니다. 물론 그만큼 비싸고 전력 소모도 엄청나지만, AI 개발에 사활을 걸고 있는 기업이 많아 오히려 수요 대비 공급이 부족할 것으로 예상됩니다. 그리고 이 경우 HBM의 수요가 크게 늘어 우리나라 메모리 업계에도 호재가 될 것입니다. B200 GPU는 24GB HBM3e를 8개나 탑재해 192GB의 메모리 용량을 갖고 있고 GB200는 그 두 배인 384GB의 HBM3e 메모리를 지니고 있기 때문입니다. 여기서 화룡점정을 찍는 것 같은 소식은 비용에 상관없이 최강의 성능이 요구하는 고객을 위한 서버 랙 시스템인 GB 200 NVL 72 노드입니다. 하나의 서버 랙에 두 개의 GB 200을 탑재한 서버 트레이 18 유닛을 쌓아서 총 72개의 B200 GPU를 장착한 시스템으로 강력한 대규모 AI 연산을 위한 슈퍼컴퓨터라고 할 수 있습니다. 다만 이 경우 엄청난 전력을 소모하기 때문에 공랭 쿨러 대신 수랭 쿨러를 사용해야 시스템 발열을 처리할 수 있습니다.그런데 이렇게 많은 프로세서를 사용해 대규모 연산 시스템을 구축하는 경우 데이터를 공유하고 작업을 분산하는 과정이 새로운 문제로 떠오르게 됩니다. 이 과정에서 병목현상이 생기면 전체 시스템의 성능이 크게 저하되는 것입니다. 이를 해결하기 위해 엔비디아는 아예 NVLINK 스위치라는 새로운 네트워크 전용 프로세서를 만들었습니다. 그리고 NVLINK 스위치 프로세서를 서버 트레이 하나에 두 개씩 넣어서 총 14.4TB/s의 대역폭을 확보했습니다. 이런 트레이가 9개가 있기 때문에 GB 200 NVL 72 노드 한 개가 130TB/s에 달하는 거대한 프로세서 간 대역폭을 확보할 수 있습니다. 덕분에 갈수록 커지고 있는 대규모 AI 학습 데이터를 더 효과적으로 처리하고 학습을 빨리할 수 있게 됐습니다. 마지막으로 GB 200 NVL 72 노드를 여러 대 연결하면 엑사플롭스급 AI 슈퍼컴퓨터 구축이 가능합니다. 물론 비용도 에너지 소모량도 엄청나지만, 역시 수요는 충분할 것으로 예상됩니다. 블랙웰 GPU를 보면 AI 하드웨어가 본격적인 산업화 시대에 도달했다는 것을 알 수 있습니다. 과거 GPU는 게임용으로 많이 사용되었고 초기 AI 연산용 GPU도 이것과 크게 다르지 않았으나 최근 나오는 데이터 센터 GPU는 산업용 및 연구용으로 특화되어 관련 분야에 종사하는 사람이 아니라면 직접 한 번 보거나 다뤄보기 어려운 물건이 됐습니다. 블랙웰 GPU는 대규모 데이터 처리와 AI 연산에 적합한 데이터 센터 GPU로 AI 혁명을 한 단계 앞당길 제품이 될 것으로 보입니다.
  • “움직이는 모든 건 로봇으로”… 엔비디아, 2.5배 빠른 AI칩 내놨다

    “움직이는 모든 건 로봇으로”… 엔비디아, 2.5배 빠른 AI칩 내놨다

    “미래에 움직이는 모든 것은 로봇이 될 것입니다.” 젠슨 황 엔비디아 최고경영자(CEO)는 18일(현지시간) 미국 캘리포니아주 새너제이에서 열린 엔비디아 개발자 콘퍼런스(GTC 2024) 기조연설에서 기대를 모았던 차세대 인공지능(AI) 칩을 소개한 뒤 AI의 미래 종점인 로봇 사업에 대한 비전을 내비쳤다. AI 칩 ‘큰손’으로 떠오른 엔비디아가 자체 플랫폼을 통해 AI 생태계를 구축한 뒤 성장 가능성이 큰 휴머노이드 로봇 시장에서도 영향력을 확대하겠다는 포부를 밝힌 것이다. 검은 가죽점퍼를 입고 연단에 선 황 CEO는 이날 1만 6000여명의 관중 앞에서 엔비디아가 그리는 큰 그림의 시작점이 될 새로운 플랫폼 ‘블랙웰’ 기반의 AI 칩을 선보였다.2080억개의 트랜지스터로 가득 메운 이 칩은 현존하는 최고 AI 칩인 엔비디아 ‘H100’(호퍼 기반)에 비해 연산 처리 속도가 2.5배 더 빠르다. 두 개의 그래픽처리장치(GPU·B200)를 연결해 하나의 칩처럼 작동하는 방식이다. H100을 사용하면 생성형 AI GPT 모델을 훈련시키는 데 90일 동안 8000개의 GPU가 필요하지만 블랙웰 GPU는 같은 기간 2000개만 사용하면 된다는 게 그의 설명이다. 황 CEO는 “호퍼는 매우 환상적이었지만 우리는 더 큰 GPU를 원한다”며 “블랙웰은 이 새로운 산업 혁명을 구동하는 엔진이 될 것”이라고 강조했다. 엔비디아가 구상하는 제품은 생성형 AI의 대규모 연산이 가능한 일종의 ‘슈퍼컴퓨터’(GB200 NVL72)다. 블랙웰 GPU 2개에 중앙처리장치(CPU)를 연결한 ‘슈퍼칩’(GB200)을 36개 쌓아 올린 뒤 시스템 최적화를 통해 성능을 극대화하겠다는 계산이다. 대만 파운드리(위탁생산) 업체인 TSMC의 4㎚(나노미터·10억분의 1m) 공정으로 만들어진 뒤 올 연말부터 공급될 예정이다.엔비디아가 새 AI 칩 가격을 밝히지는 않았지만 기존 제품 가격을 감안하면 5만 달러(약 6700만원) 수준일 것이란 전망이 나온다. 황 CEO는 “(첫 제품은) 수천만 달러에 달할 것”이라고 농담을 하기도 했다. 엔비디아는 블랙웰이 최대 10조개의 매개변수(파라미터)를 가진 대규모 언어모델(LLM)에서 생성형 AI를 구축하고 실행할 수 있을 것이라 보고 있다. 파라미터는 생성형 AI가 정보를 학습하고 기억하는 신경 연결 역할을 한다. 파라미터가 많을수록 AI 성능이 뛰어나다고 평가받는다. 오픈AI가 개발한 생성형 AI GPT-4의 파라미터 수치가 공개되지 않았지만 5000억개 정도로 알려져 있다. 산술적으로는 블랙웰이 이보다 20배 뛰어난 AI 모델도 지원할 수 있다는 얘기다. AI 기술이 궁극적으로 지향하는 로봇 플랫폼을 지원하겠다는 것도 이러한 성능에 대한 자신감 때문이다. 황 CEO는 이날 무대에 자체적으로 훈련시킨 로봇 ‘오렌지’와 ‘그레이’를 등장시키고, 로봇 훈련이 가능한 ‘프로젝트 그루트’(GR00T)를 공개했다.
  • 엔비디아에 올라탄 SK하이닉스, 5세대 HBM 양산 앞서간다

    엔비디아에 올라탄 SK하이닉스, 5세대 HBM 양산 앞서간다

    SK하이닉스가 고대역폭 메모리(HBM) 5세대 신제품인 HBM3E D램을 세계 최초로 대규모 양산해 이달 말부터 제품 공급을 시작한다고 밝혔다. 미 반도체 기업인 엔비디아의 차세대 인공지능(AI)칩 ‘블랙웰’ 공개에 발맞춘 행보로 보인다. 19일 SK하이닉스는 초고성능 AI용 메모리 신제품인 HBM3E를 메모리 업체 중 가장 먼저 양산해 이달 말부터 납품을 시작한다고 밝혔다. 지난해 8월 HBM3E 개발을 알린 지 7개월 만이다. 고객사를 따로 밝히진 않았지만 세계 최대 반도체 회사인 엔비디아에 해당 제품을 공급할 전망이다.SK하이닉스에 따르면 HBM3E는 속도와 발열 제어 등 AI 메모리에 요구되는 모든 부문에서 세계 최고 성능을 갖췄다. 초당 최대 1.18테라바이트(TB)의 데이터를 처리하며 이는 풀고화질(FHD)급 영화(5GB) 230편 분량이 넘는 데이터를 1초 만에 처리하는 수준이다. SK하이닉스는 “HBM3에 이어 현존 D램 최고 성능이 구현된 HBM3E 역시 가장 먼저 고객에게 공급하게 됐다”면서 “HBM3E 양산도 성공적으로 진행해 AI 메모리 시장에서의 경쟁 우위를 이어 가겠다”고 강조했다. HBM은 D램 여러 개를 수직으로 연결해 데이터 처리 속도를 끌어올린 고성능 메모리다. 1세대(HBM)-2세대(HBM2)-3세대(HBM2E)-4세대(HBM3)-5세대(HBM3E) 순으로 개발되고 있으며 HBM3E는 HBM3의 확장 버전이다. 앞서 세계 D램 3위 업체인 마이크론 테크놀로지가 지난달 26일(현지시간) 올해 2분기 출시 예정인 엔비디아의 H200 그래픽처리장치(GPU)에 탑재될 HBM3E 양산을 시작했다고 발표했으나 실제 HBM3E 납품을 위한 대량 양산은 SK하이닉스가 처음인 것으로 알려졌다. 한편 HBM 시장은 현재까지 SK하이닉스와 삼성전자가 양분하고 있다. 대만 시장조사업체 트렌드포스에 따르면 지난해 HBM 시장 점유율은 SK하이닉스가 53%, 삼성전자 38%, 마이크론 9%로 추정된다. 올해 HBM3E 시장이 열리면서 경쟁이 치열해질 전망이다.
위로