찾아보고 싶은 뉴스가 있다면, 검색
검색
최근검색어
  • AI Ops
    2026-10-05
    검색기록 지우기
저장된 검색어가 없습니다.
검색어 저장 기능이 꺼져 있습니다.
검색어 저장 끄기
전체삭제
총 151 건
  • 메모리 절반이면 충분? 일론 머스크의 피지컬 AI 전략 [고든 정의 TECH+]

    메모리 절반이면 충분? 일론 머스크의 피지컬 AI 전략 [고든 정의 TECH+]

    최근 마이크론 테크놀로지의 산자이 메로트라 최고경영자(CEO)는 실적 발표에서 흥미로운 전망을 내놓았습니다. 자율주행차처럼 휴머노이드 로봇 1대당 200GB 이상의 D램과 수 테라바이트의 낸드 플래시가 필요하기 때문에, 피지컬 AI가 결국 미래 메모리·스토리지 수요의 주요 동력이 될 수 있다는 것입니다. 이는 현재의 AI 붐이 끝난 뒤 실적이 꺾일 수 있다는 시장의 우려를 불식시키려는 메시지로 읽힙니다. 그런데 그 직후 일론 머스크는 엑스(X)에 묘하게 다른 시각을 보여주는 글을 올렸습니다. 테슬라가 개발 중인 AI5 칩의 메모리 용량을 기존 계획의 절반인 72GB로, AI6 칩은 약 3분의 1을 줄인 144GB로 조정했다는 내용이었습니다. 메모리 공급 부족을 극복하고 비용을 크게 낮추기 위한 결정이며, 이 변경이 옵티머스 성능에는 거의 영향을 주지 않을 것이라고 강조했습니다. 옵티머스와 테슬라 자율주행 시스템에 탑재될 AI5는 약 2000~2500 TOPS의 연산 능력을 목표로 하고 있습니다. 기존 AI4 대비 유용한 성능이 5배 이상 향상된 수준입니다. 칩은 하프 렉티클 크기(430mm² 정도)의 단일 대형 다이에 12개의 D램 모듈을 주변에 배치한 형태로 설계됐으며, 대용량 온 칩 (On-chip) SRAM을 함께 탑재하고 있습니다. 여기서 머스크가 강조한 포인트는 명확합니다. 메모리 ‘용량’보다 ‘대역폭(속도)’이 더 중요한 병목이라는 것입니다. 용량을 줄이면서도 대역폭 자체는 그대로 유지했고, 추가로 온 칩 SRAM을 적극 활용해 실효 속도를 높인 것으로 보입니다. 프로세서 내부에 있는 SRAM은 용량은 작지만 외부 D램보다 훨씬 빠르게 데이터를 주고받을 수 있기 때문입니다. 로봇과 자율주행에 필요한 피지컬 AI는 사실 크고 똑똑한 모델보다 빠른 모델이 더 중요합니다. 계속해서 변하는 상황에 맞춰 즉각적으로 반응해야 하기 때문입니다. 파라미터가 많은 모델은 더 정교한 판단을 내릴 가능성이 높지만, 너무 커지면 연산에 시간과 전력이 많이 소모돼 반응 속도가 느려지고 로봇에 탑재하기 부담스러워집니다. 머스크의 주장에 따르면 AI5는 엔비디아 H100에 준하는 성능을 내면서도 전력 소모는 200W 수준으로 비교적 낮게 설계됐습니다. 온 칩 SRAM으로 필요한 빠른 반응을 확보하고, 용량을 줄인 LPDDR5 메모리로 전력 효율을 높인 덕분으로 풀이됩니다. TSMC와 삼성의 2㎚ 공정을 통해 전성비를 개선했을 가능성도 큽니다. 물론 이 모든 내용은 테슬라와 머스크의 주장에 기반한 것입니다. AI5 칩이 실제로 공개되거나 양산된 것은 아니기 때문에, 전력 소모와 메모리 사용량을 줄이면서도 피지컬 AI에 적합한 반응 속도를 확보했는지 현재로서는 검증하기 어렵습니다. AI5의 본격 양산은 2027년으로 예정돼 있으며, 그때 실제 제품이 나오면 자연스럽게 확인될 전망입니다. 그래도 이 내용이 흥미로운 이유는 테슬라의 AI 전략을 엿볼 수 있기 때문입니다. 앞서 중국 AI 모델들은 메모리와 연산 자원을 구하기 어려운 상황에서 극단적인 효율화 기술을 적극 도입했습니다. 반면 테슬라는 메모리 수급의 현실적 제약을 인정하면서도, 피지컬 AI에 필수적인 빠른 반응 속도와 높은 전력 효율을 우선시한 설계를 선택한 것으로 보입니다. 이 전략이 실제로 효과적인지 가까운 미래에 확인할 수 있을 것입니다.
  • AI 수직 계열화에 도전하는 알리바바…AI 가속기 ‘젠우 V900’ 공개 [고든 정의 TECH+]

    AI 수직 계열화에 도전하는 알리바바…AI 가속기 ‘젠우 V900’ 공개 [고든 정의 TECH+]

    최근 미국 프런티어 모델을 거의 따라잡은 성능과 증류 논란으로 유명해진 문샷 AI의 키미 K3나 지난해 AI 시장에 큰 충격을 몰고 온 딥시크와 비교해서 알리바바의 Qwen은 상대적으로 대중적 인지도는 낮은 편입니다. 하지만 누구나 다운로드 해 사용할 수 있는 개방형 LLM 모델 가운데서 Qwen 3.8 시리즈는 모델 크기 대비 높은 성능으로 많은 사용자를 확보한 상태로 만만치 않은 기술력을 자랑하는 회사이기도 합니다. 여기에 중국 AI 회사 가운데서는 일찍부터 AI 하드웨어에 많은 투자를 해 자체 플랫폼을 구축하고 있는 회사이기도 합니다. 이런 점에서 알리바바는 자체 모델인 제미나이와 AI 가속기인 TPU를 지닌 구글과 상당히 유사한 전략을 지닌 회사이기도 합니다. 최근 알리바바는 5조에서 10조개 파라미터 규모의 차세대 Qwen 모델을 개발하겠다고 밝혔습니다. 더 중요한 것은 이런 대형 모델을 훈련하고 서비스할 수 있는 자체 AI 가속기 ‘젠우 V900’을 공개했다는 점입니다. 지난 22일 항저우에서 열린 압사라 콘퍼런스에서 공개한 알리바바의 젠우 V900은 216GB의 메모리를 탑재하고 있으며 전 세대인 M890의 3배의 성능을 지니고 있습니다. 구체적인 성능은 아직 공개하지 않았는데, FP16 기준으로 3배라면 1.8 PFLOPs의 성능을 지닌 것으로 추정됩니다. 여기에 FP8/FP4 연산도 지원한다고 밝혔습니다. 아무튼 대략적인 수치를 감안하면 알리바바의 젠우 V900은 엔비디아의 베라 루빈(FP4 기준 50 PFLOPs)과 비교해 성능은 낮은 편입니다. 하지만 엔비디아 칩을 수입하기 힘든 알리바바 입장에서는 자체 개발이 필수적인 상황입니다. 그리고 사실 중국 내에서 경쟁 상대인 화웨이 어센드 칩과 비교해서 크게 낮은 성능이라고 할 수 없는 수준이기도 합니다. 일단 젠우 V900 칩을 계획대로 양산해서 목표처럼 20GW 급 데이터 센터를 2032년까지 구축할 수 있다면 알리바바는 나름 승산이 있다고 보고 있습니다. 중국 AI 모델의 특징은 상대적으로 적은 연산 자원을 이용해서 높은 성능을 낼 수 있게 한 데 있습니다. 미국이 제재로 칩 수급이 어려운 상황에서 내놓은 여러 고육지책이 지금은 오히려 큰 무기가 되고 있는 셈입니다. 최신 Qwen 모델은 활성 파라미터 크기를 줄여 연산 부담을 더는 MoE(Mixture of Experts) 기법은 물론이고 ‘N-gram 임베딩’처럼 AI 가속기의 메모리 부담까지 덜어주는 최신 기법을 사용해 연산 자원 대비 높은 성능을 보여주고 있습니다. 따라서 50만 개의 V900 칩을 실제로 양산해 대규모 AI 데이터 센터를 구축할 수만 있다면 앞으로 AI 경쟁에서 연산 자원 확보에 어려움을 겪는 딥시크나 키미 K3보다 유리한 고지를 차지할 수 있습니다. 물론 하이퍼스케일러가 되기 위해서는 AI 가속기 만으로는 불가능합니다. 한 개의 기속기에서 10조 개의 파라미터를 돌릴 순 없기 때문입니다. 젠우 V900 가속기는 알리바바의 ICN 스위치 패브릭을 통해 약 1.2TB/s의 칩 간 인터커넥트 속도를 제공합니다. 그리고 지우(Panjiu) 슈퍼노드 서버(V900 + ICN 스위치 기반), 이톈(Yitian) CPU를 포함한 자체 맞춤형 랙 스케일 솔루션을 개발하고 있습니다. 다만 중국 내 반도체 수급 상황도 쉽지 않다는 점을 생각하면 순조롭게 캐파 확장에 성공할 수 있을진 미지수입니다. 최대 50만 개의 V900 가속기는 108페타바이트의 HBM 메모리를 의미합니다. 다만 중국 내 고성능 반도체와 고대역폭 메모리 공급이 빠듯한 상황이어서, 계획대로 50만 개 규모로 양산해 대규모 데이터센터를 구축할 수 있을지는 아직 미지수입니다. 물론 이런 어려움을 극복하고 알리바바가 대규모 데이터센터, 자체 AI 가속기, 자체 LLM까지 완성한다면 AI 수직 계열화에 한 발 더 다가가며 입지를 크게 강화할 수 있을 것입니다. 알리바바는 젠우 V900의 출시 시점을 내년 1분기로 밝혔습니다. 알리바바가 어떤 결과를 겨두게 될지 주목됩니다.
  • 느리지만 그래도 꾸준히 성장? 화웨이 AI 로드맵 공개 [고든 정의 TECH+]

    느리지만 그래도 꾸준히 성장? 화웨이 AI 로드맵 공개 [고든 정의 TECH+]

    최근 세간을 놀라게 만든 중국의 인공지능(AI) 서비스 ‘키미 K3’나 딥시크 ‘V4.1 플래시’, 알리바바 ‘Qwen 3.8’ 등은 모두 한 가지 공통된 특징이 있습니다. 모델 크기와 관계없이 극도로 효율성을 높여 제한된 하드웨어에서 최대한 많은 토큰을 생성할 수 있다는 것입니다. 여기에 모델을 공개하기 때문에 실제로 전 세계 많은 사용자가 개인 컴퓨터나 클라우드, 그리고 내부 컴퓨터에서 이 모델들을 사용하고 있습니다. 성능에 비해 하드웨어 자원을 매우 효율적으로 사용해 비용을 절감할 수 있는 것이 높은 인기의 비결입니다. 중국 모델의 효율이 높은 이유 중 하나는 아이러니하게도 미국의 금수 조치로 인해 연산 인프라를 확충하기 어렵다는 점에 있습니다. 엔비디아 칩 수급이 힘들다 보니 어쩔 수 없이 연산 효율성을 높여야만 하는 것입니다. 물론 최근 화웨이 같은 중국 내 정보기술(IT) 기업들이 자체 AI 가속기인 ‘어센드’(Ascend) 시리즈를 공급하고 있긴 하나, 아직은 성능 면에서 엔비디아 칩과 상당한 격차가 있어 당분간 연산 효율화에 집중하는 구조가 이어질 것으로 보입니다. 물론 화웨이도 가만히 있지 않고 어센드 신경망처리장치(NPU)와 이를 모아 구성한 클러스터인 아틀라스 슈퍼포드(Atlas SuperPod)를 꾸준히 업그레이드하고 있습니다. 최근 개최된 화웨이 커넥트 2026 행사에서는 앞으로 2029년까지 어센드 960DT/PR, 어센드 970, 어센드 980 칩에 대한 로드맵을 공개했습니다. 흥미롭게도 중국 딥시크의 최고경영자(CEO)인 량원펑(Liang Wenfeng)은 이전 컨퍼런스 콜에서 중국의 컴퓨팅 자원이 부족하지만, 화웨이의 ‘아틀라스 950 슈퍼포드’가 엔비디아의 ‘GB300 NVL72 랙’을 상당 부분 대체할 수 있다고 주장한 바 있습니다. 다만 4개의 어센드 칩이 있어야 GB300 한 개를 대체할 수 있는 수준이라는 점은 인정했습니다. 그런데 공개된 수치를 보면 화웨이 어센드 칩이 GB300을 따라잡기 위해서는 여전히 상당한 시간이 필요한 것으로 보입니다. 우선 내년 1분기에 화웨이는 차세대 제품인 ‘어센드 960DT’를 선보일 예정입니다. 이 칩은 새로운 SIMD/SIMT 아키텍처를 채택해 FP32, HF32, FP16, BF16, FP8, MXFP8, HiF8, MXFP4 등 다양한 데이터 포맷을 지원합니다. 이 칩은 최대 2 PFLOPS(페타플롭스)의 FP8 연산 능력과 4 PFLOPS의 FP4 연산 능력을 지니고 있으며, 288GB HBM 메모리와 9.6TB/s의 대역폭을 확보했습니다. 참고로 GB300의 dense FP4 연산 능력이 약 15 PFLOPS라는 점을 생각하면, 내년 출시할 어센드 960DT의 성능은 엔비디아 칩을 대체하기엔 아직 부족한 수준입니다. 따라서 화웨이는 수많은 어센드 NPU를 연결한 거대한 클러스터인 아틀라스 슈퍼포드를 개발했습니다. 엔비디아의 NVL72 랙 시스템이 72개의 GPU와 36개의 CPU를 사용하는 것과 달리, 아틀라스 960E 슈퍼포드는 무려 4096개의 NPU를 고속 인터페이스로 연결해 최대 16 EFLOPS의 연산 성능을 목표로 하고 있습니다. 화웨이 커넥트 2026에서 화웨이는 이렇게 많은 칩을 고속으로 연결해 하나의 거대한 연산 기계로 활용할 수 있는 신기술도 같이 공개했습니다. 예를 들어 고속 광학 인터페이스인 Hi-ONE 5500개를 적용해 기존 대비 전력을 550㎾나 절감했다고 합니다. 다만 그럼에도 전력 소모량은 상당히 많을 것으로 예상됩니다. 전기를 많이 먹는 HBM 메모리를 288GB나 장착한 데다, TSMC가 아닌 중국 파운드리인 SMIC의 공정을 사용할 수밖에 없어 성능 대비 전력 소모가 클 수밖에 없기 때문입니다. 따라서 어센드 칩을 사용한 아틀라스 슈퍼포드는 엔비디아의 NVL72 랙 시스템에 비해 전력 소모가 크고 유지비가 많이 들 것으로 예상됩니다. 이런 단점에도 불구하고 미국의 제재로 인해 엔비디아 칩 수급이 어려운 중국 내 AI 회사들은 선택의 여지가 제한된 상황에서 화웨이 칩을 사용할 수밖에 없고, 화웨이도 그 점을 잘 알고 있기 때문에 계속해서 어센드 시리즈를 개발할 예정입니다. 화웨이는 2027년 1분기에 어센드 960DT를 출시한 후 3분기에는 추론 특화 버전인 960PR을 출시하고, 2028년에는 어센드 970을 출시할 계획입니다. 어센드 970은 3.6 PFLOPS FP8/14 PFLOPS FP4의 연산 능력을 목표로 하고 있습니다. 2029년 출시 목표인 어센드 980에서는 다시 스펙을 두 배로 늘려 7.2 PFLOPS FP8/28 PFLOPS FP4까지 성능을 높인다는 계획입니다. 계획대로 된다면 GB300은 따라잡을 수 있지만, 2029년까지도 베라 루빈의 50 PFLOPS FP4 성능에는 미치지 못하는 수준입니다. 따라서 중국 AI 회사들은 다소 불리한 위치에 있지만, 앞서 이야기했듯이 놀라운 연산 효율화를 통해 미국 프런티어 AI 모델에 강력한 위협이 되고 있습니다. 여기에 화웨이 역시 느리지만 꾸준한 성장세를 보이고 있어, 미래에는 미국의 제재가 큰 힘을 발휘하지 못할 가능성이 높아지고 있습니다. AI 패권을 놓고 벌이는 싸움에서 쉽게 승자를 예측하기 어려운 이유입니다.
  • 오케스트로 클라우드-KT, AI 사업 확대 위한 MOU 체결

    오케스트로 클라우드-KT, AI 사업 확대 위한 MOU 체결

    클라우드 서비스 전문 기업 오케스트로 클라우드는 KT와 AI 사업 확대를 위한 전략적 업무협약(MOU)을 체결했다고 18일 밝혔다. 양사는 이번 협약을 통해 AI 전환(AX) 서비스부터 AI 데이터센터·GPU 인프라 구축·운영까지 AI 사업 전반에서 협력한다. 이번 협력은 AI 서비스 영역을 넘어 GPU 및 데이터센터 인프라 수요가 가파르게 증가하는 시장 상황에 맞춰, 두 회사가 지닌 기술력과 사업 노하우를 모아 신규 기회를 모색하고자 추진됐다. 이에 따라 양사는 클라우드, 네트워크, 데이터센터 등 고유의 인프라 자산과 AI 플랫폼 경쟁력을 융합해 공공·금융·기업 부문에서 사업 영역을 전방위로 넓혀갈 예정이다. 양사는 협약에 따라 ▲AX ▲AI 데이터센터(AIDC) ▲Managed AI GPU ▲AI 플랫폼·클라우드 ▲공동 영업 및 사업 개발 등 5개 분야에서 협력한다. 먼저 AX 분야에서는 생성형 AI, AI 에이전트, 검색증강생성(RAG), 업무혁신 플랫폼 등을 활용한 사업을 추진한다. 산업별 특성을 반영한 AI 서비스와 업무혁신 모델도 공동 개발한다. AIDC 분야에서는 데이터센터 구축·운영과 함께 GPU·NPU 클러스터, AI 팩토리, 소버린 AI 인프라 관련 사업을 공동 개발한다. 엣지 데이터센터(Edge DC)와 AI 전용 인프라의 기획·사업화도 추진한다. 특히 도심형 엣지 데이터센터와 kt cloud의 통합형 AI 인프라 서비스를 연계해 소버린 AI 기반 프라이빗 클라우드 환경을 구축하고, 금융권 등 보안 요구가 높은 고객을 대상으로 관련 서비스를 확대할 계획이다. Managed AI GPU 분야에서는 서비스형 GPU(GPUaaS)를 포함한 Managed AI GPU 서비스와 GPU 자원의 운영·관제·최적화 사업을 함께 추진한다. AI 모델 학습·추론에 필요한 GPU 인프라를 통합 서비스로 제공하고, 기업 고객의 AI 인프라 구축·운영까지 연계한다. AI 플랫폼 및 클라우드 부문에서는 KT가 보유한 인프라 역량과 오케스트로 클라우드의 AI 플랫폼·운영 노하우를 결합한다. 이를 기반으로 MLOps 및 AI 추론 플랫폼 분야의 공동 사업화를 도모하는 한편, 프라이빗 AI 클라우드와 소버린 AI 환경 조성을 위해서도 긴밀히 공조할 계획이다. 더불어 양사는 핵심 고객군을 겨냥한 공동 마케팅과 제안 활동을 전개하고, 공공·금융·기업 영역 전반에서 신규 AI 비즈니스 모델을 지속 발굴함으로써 중장기적 AI 사업 성장 기반을 견고히 다질 방침이다. 박소아 오케스트로 클라우드 대표는 “이번 협약은 AI 서비스부터 데이터센터·GPU 인프라까지 양사의 역량을 연결해 AI 사업 전반에서 협력할 수 있는 기반을 마련했다는 데 의미가 있다”며 “KT와 함께 공공·금융·기업 고객의 AI 전환을 지원하는 실질적인 사업 성과를 창출하고, 이를 바탕으로 AI 사업 영역을 지속 확대해 나가겠다”고 말했다.
  • 오케스트로, 탈VM웨어 넘어 AI 인프라 공략 강화… 상반기 윈백 매출 전년比 99.5% 증가

    오케스트로, 탈VM웨어 넘어 AI 인프라 공략 강화… 상반기 윈백 매출 전년比 99.5% 증가

    AI 인프라 소프트웨어 기업 오케스트로(공동대표 김범재·김영광)가 국내 VM웨어 윈백 시장에서 지난 3년간 쌓아온 가상화 전환 기술력과 다수의 고객 사례, 자체 풀스택 솔루션을 발판 삼아 AI 인프라 시장 진출을 본격 확대한다고 17일 밝혔다. 브로드컴의 VM웨어 라이선스 정책 개편 이후 국내 기업·기관의 가상화 솔루션 선택 기준이 달라지고 있다. 초기에는 BMT·PoC를 통해 대체 솔루션의 성능과 안정성을 검증하는 데 초점이 맞춰졌다면, 최근에는 클라우드 네이티브와 AI 도입이 확대되면서 전환 이후 인프라를 어떻게 확장할 수 있는지가 중요한 선택 기준으로 떠오르고 있다. 오케스트로는 탈VM웨어 수요가 형성된 초기부터 공공·금융·민간 고객을 대상으로 BMT·PoC와 구축·전환 사업을 수행해 왔다. 올해 상반기 VM웨어 윈백 매출은 전년 동기 대비 99.5% 증가했으며, 윈백 고객사 수는 2배로 늘었다. 같은 기간 금융 부문 매출은 216% 증가했고, 제조 등 민간 부문 매출도 약 15배 규모로 확대됐다. 오케스트로는 가상화 전환 이후 고객의 인프라 확장까지 주도하고 있다. 서버 가상화 솔루션 ‘콘트라베이스(CONTRABASS)’ 도입 고객 가운데 60% 이상이 ‘비올라(VIOLA)’와 ‘오케스트로 CMP(OKESTRO CMP)’ 등을 추가 도입해 컨테이너 운영과 멀티·하이브리드 클라우드 환경까지 적용 범위를 확대하고 있다. 실제 금융권에서는 콘트라베이스 기반 인프라에 비올라를 적용해 컨테이너 환경을 구성하고, 오케스트로 CMP로 가상화와 클라우드 자원을 통합 관리한다. 여기에 데브옵스 솔루션 ‘트롬본(TROMBONE)’을 적용해 CI/CD·DevSecOps 기반의 개발·배포 과정을 자동화하고, AI 추론 운영 플랫폼 ‘콘체르토 AI(CONCERTO A.I)’를 연계해 GPU 자원과 AI 모델, 추론 서비스까지 아우르는 운영 체계를 갖추고 있다. 이러한 인프라 확장의 핵심은 자체 개발한 AI 인프라 풀스택 소프트웨어에 있다. 고객은 자사 시스템 환경과 전환 우선순위, 운영 전략에 따라 가상화, 클라우드 네이티브, DevOps, AI 솔루션을 맞춤형으로 구성하며, 기술 도입 시점과 운영 방침을 주도적으로 설정할 수 있다. 오케스트로는 VM웨어 계약 갱신을 앞둔 기업 및 기관의 가상화 교체 수요에 적극 대응하는 한편, 윈백 성과로 입증된 고객 기반과 수행 노하우를 발판 삼아 클라우드 네이티브 및 AI 인프라 영역으로 사업 영역을 한층 넓혀갈 방침이다. 김범재 오케스트로 대표는 “3년 전에는 VM웨어를 안정적으로 대체할 수 있는지가 핵심이었다면, 이제는 전환 이후 인프라를 어떻게 확장할 것인지까지 함께 봐야 한다”며 “오케스트로는 검증된 가상화 전환 역량과 AI 인프라 풀스택 소프트웨어를 바탕으로 고객이 어떤 기술을 언제 도입할지 직접 결정하고, 인프라 운영 방향을 주도할 수 있도록 하겠다”고 말했다.
  • 새롭게 무장한 세레브라스 웨이퍼 스케일엔진, 엔비디아 독점 깰 수 있을까 [고든 정의 TECH+]

    새롭게 무장한 세레브라스 웨이퍼 스케일엔진, 엔비디아 독점 깰 수 있을까 [고든 정의 TECH+]

    현대적인 반도체 제조 공정은 ‘웨이퍼’라는 동그란 기판을 기반으로 진행됩니다. 최종적인 프로세서나 메모리 등은 웨이퍼에서 사각형 형태로 하나씩 떼어 내서 제조됩니다. 하지만 미국의 인공지능(AI) 반도체 기업 ‘세레브라스 시스템즈’(Cerebras Systems)는 전혀 다른 접근 방법으로 초대형 칩을 개발했습니다. 이들이 개발한 ‘웨이퍼 스케일 엔진’(WSE)은 실리콘 웨이퍼를 자르지 않고 하나의 거대한 프로세서로 사용합니다. 이렇게 하면 기존의 방식으로는 만들 수 없는 거대한 칩을 만들 순 있지만, 대신 제조 과정에서 오류가 난 부분으로 인해 프로세서에 결함이 생길 수 있습니다. 웨이퍼 스케일 엔진의 해결책은 매우 작은 프로세서 코어를 여러 개 만들고 이들을 서로 연결해서 중간에 몇 개 오류가 나더라도 전체 프로세서 기능에는 큰 영향을 미치지 않게 하는 것입니다. 세레브라스 시스템은 최근 ‘WSE-3T’를 공개했습니다. 흥미로운 사실은 2년 전 공개한 WSE-3와 동일한 TSMC 5㎚ 공정을 사용하고 동일한 4조 개의 트랜지스터를 집적했지만, 연산 성능과 대역폭을 대폭 개선했다는 점입니다. WSE-3T의 AI 연산 성능은 125 PFLOPS(희소성 적용 시 250 PFLOPS), 대역폭은 43.2 PB/s로 이전 대비 2배 정도 높아졌습니다. 참고로 WSE-3T 프로세서 하나에는 90만 개의 코어와 44GB의 초고속 SRAM이 통합돼 있습니다. 하지만 더욱 주목할 부분은 프로세서만 공개한 것이 아니라 데이터센터에서 바로 사용할 수 있는 랙 서버 시스템인 CS-4를 함께 공개했다는 것입니다. 각각의 CS-4는 3개의 WSE-3T 프로세서를 장착해 최대 750 PFLOPS의 AI 연산 능력을 지니고 있습니다. 세레브라스의 주장에 따르면 GPT-OSS 120B 모델 기준으로 단일 CS-4 랙이 초당 4400토큰 이상을 생성할 수 있으며, GPU와 비교해 최대 30배 정도 빠른 속도를 보일 수 있다고 합니다. 그러나 CS-4는 단독으로 쓰이기보다 AMD의 헬리오스 AI 랙과 함께 사용하는 것을 염두에 두고 설계됐습니다. 마치 엔비디아의 베라 루빈 시스템과 그록 시스템을 조합한 것과 비슷하게, AMD 그래픽처리장치(GPU)가 AI 연산의 앞 단계인 프리필 단계(입력 프롬프트 처리, 대규모 컨텍스트 윈도우 계산, KV 캐시 생성)를 담당하면, CS-4에 있는 WSE-3T는 최종 출력 단계인 디코드 단계, 즉 토큰 생성을 담당하는 것입니다. 마지막 단계는 메모리 대역폭이 속도에 큰 영향을 미치는데, 아예 프로세서에 메모리가 통합된 WSE-3T가 강점을 지닌 분야입니다. 이렇게 헬리오스 랙과 CS-4 랙으로 AI 파이프라인을 구축하면 전력 대비 토큰 생성 효율을 최대 5배까지 높일 수 있다는 것이 세레브라스의 설명입니다. 이를 통해 비용을 절감하면서도 성능을 최대화할 수 있고 엔비디아의 베라 루빈 + 그록 AI 파이프라인에 대항할 수 있습니다. 현재 AI 시장에서 엔비디아의 위치는 공고해 보이지만, 구글, 아마존, 마이크로소프트 같은 하이퍼스케일러들은 자체 칩을 개발해 엔비디아 의존도와 비용을 줄이기 위해 노력하고 있으며, 경쟁자인 AMD도 시장의 파이를 일부 차지하기 위해 노력하고 있습니다. AMD가 세레브라스와의 협업을 통해 엔비디아의 점유율을 얼마나 빼앗을 수 있을지 주목됩니다.
  • HDC랩스, 독자 AI ‘모티프 3’ 기반 AI 운영 Copilot 개발 착수…AI Ops 시장 공략

    HDC랩스, 독자 AI ‘모티프 3’ 기반 AI 운영 Copilot 개발 착수…AI Ops 시장 공략

    - Splunk와 AI Agent 결합… 장애 분석부터 대응까지 운영 자동화 구현- 금융권 데이터센터를 시작으로 스마트빌딩·AIoT 플랫폼 등 적용 범위 확대 HDC랩스(대표이사 이준형)가 국가 프로젝트로 진행 중인 독자 AI 파운데이션 모델 ‘모티프(Motif) 3(beta)’를 활용해 AI Agent 기반 ‘AI 운영 Copilot’ 개발에 본격 착수했다고 밝혔다. ‘AI 운영 코파일럿’은 서버 및 보안 시스템에서 발생하는 대규모 데이터를 AI가 실시간으로 분석해 이상 징후를 감지하고, 원인 파악 및 대응 가이드를 운영자에게 제시하는 솔루션이다. HDC랩스는 머신 데이터(비정형 데이터) 분석·시각화 플랫폼인 스플렁크(Splunk)와 AI 에이전트를 결합해 장애 탐지, 원인 분석, 대응 방안 제안은 물론 반복적인 운영 업무까지 자동화하는 차세대 AI Ops(AI Operations) 플랫폼을 구축할 계획이다. 개발에 앞서 HDC랩스는 AI 운영 코파일럿의 실제 환경 적용 가능성을 검증하기 위해 자체 성능 평가를 진행했다. 사용자가 일상적인 한국어로 입력한 질문을 스플렁크 전용 검색 명령어인 SPL(Search Processing Language)로 얼마나 정확하게 변환하는지 확인하는 방식이다. 동일한 한국어 질의 200문항을 대상으로 ▲문법 정확성 ▲실제 실행 가능 여부 ▲질문 의도와의 일치도 ▲보안 안전성 등 4개 항목을 평가한 결과, 단발 응답 기준 ChatGPT 기반 루나서비스와 딥시크 최신 모델은 각각 약 85점을 기록했다. 반면 모티프 3(beta)에 HDC랩스의 자체 최적화 기술을 적용한 모델은 87점을 기록한 것으로 나타났다. 이번 평가 항목은 2026년 8월 기준 HDC랩스 내부 기준에 따라 실제 스플렁크 환경에서 진행됐으며, 생성된 SPL이 오류 없이 실행되는지 여부를 중점 검증했다. AI 운영 Copilot은 기존 운영 방식과 달리 로그 데이터를 실시간 추적해 시스템 상태(CPU·메모리 이상, DDoS 공격 가능성 등)를 자연어로 안내하고 필요한 조치 방안을 제안한다. 향후에는 자연어 질의를 SPL로 변환하는 기능을 넘어 장애 원인 분석(Root Cause Analysis), 이상 징후 탐지, 보안 위협 예측, 운영 보고서 작성, ITSM 티켓 생성, 운영 절차(Runbook) 실행, 승인 기반 자동 조치 등 반복 업무를 단계적으로 자동화할 예정이다. 회사 측은 파트너사와 협력해 금융권 데이터센터 및 기업 전산센터를 시작으로 스마트빌딩, AIoT 플랫폼, AI CCTV 통합관제, 제조·산업 인프라 분야로 적용 범위를 단계적으로 확대해 나갈 계획이다.
  • 미래 기술 격차를 좌우할 특화 ‘AI Ready Data’, 민·관 협력으로 속도 높인다

    미래 기술 격차를 좌우할 특화 ‘AI Ready Data’, 민·관 협력으로 속도 높인다

    범용 인공지능(AI)의 현장 적용 한계를 보완하는 산업 맞춤형 ‘버티컬 AI’ 시장이 확대됨에 따라, AI가 스스로 이해하고 추론할 수 있도록 정제한 ‘AI 레디 데이터(AI Ready Data)’의 중요성이 제기되고 있다. 시장조사기관 그랜드뷰리서치 분석에 따르면 글로벌 버티컬 AI 시장은 연평균 약 28% 성장해 2026년 기준 130억 달러를 넘어설 것으로 전망된다. 버티컬 AI의 성패는 각 산업에 맞춰 구조화된 ‘AI 레디 데이터’ 확보 여부에 달려 있다. AI 레디 데이터는 AI가 스스로 이해하고 추론하도록 정제·가공한 데이터를 뜻한다. 의료·국방·법률·특허 등 도메인별 전문 데이터를 선점하려는 경쟁은 국가 간 주도권 다툼으로 확산되는 양상이다. 특히 특허 데이터는 기업의 기술 전략이 공개 논문보다 평균 18개월가량 앞서 담기는 기술 선행 지표로 평가되며, 특허 데이터의 AI 레디 데이터 전환 여부가 국가 간 기술 정보 격차로 이어질 수 있다는 지적이 나온다. 글로벌 시장에서는 앤트로픽, 메타, 마이크로소프트, IBM 등 빅테크 9개사가 AI 특허 공유 협력체 ‘SAIL’을 결성해 파운데이션 모델 관련 핵심 특허를 결집하고 있다. 회원사 간 AI 기술과 특허를 상호 라이선스하는 구조로, 회원사 보유 특허는 약 2만 건 이상으로 집계된다. 국내에서도 과학기술정보통신부가 ‘K-문샷’ 8대 분야 연구 데이터를 AI 레디 데이터로 변환하는 작업을 진행 중이며, 지식재산처는 AI 기반 지식재산 데이터 분석 체계 구축에 나섰다. 다만 도메인 맥락 이해가 필요한 특화 데이터 특성상 공공 역량만으로는 한계가 있다는 평가에 따라, 민간 기업과의 연계가 과제로 떠오르고 있다. 소버린 AI 국방 AI 풀스택 전략… 네이버클라우드 국방 영역은 무전 음성, 작전 문서, 드론 영상 등 다양한 형태의 데이터를 통합 처리하는 기술과 철저한 보안이 요구돼 외부 클라우드나 범용 AI 모델 적용이 어렵다. 네이버클라우드는 소버린 AI 기반 국방 AX 전담 조직을 신설하고 국방 특화 경량 옴니모달 AI 모델을 공개했다. 최근 공개한 ‘하이퍼클로바X 시드 4B’는 자체 개발한 비전 인코더 ‘하이퍼클로바X 클립’과 오디오 인코더를 적용해 텍스트·음성·영상을 동시에 처리하며, 경량화로 모델 크기를 절반으로 줄여 제한된 연산 환경에서도 저지연 추론이 가능하도록 설계됐다. 인프라부터 MLOps, 거대언어모델(LLM)까지 전 과정을 폐쇄망 환경에 배포·운영해 보안성을 확보했으며, 육·해·공군과 합동참모본부 데이터를 통합 학습하는 ‘중앙 데이터센터’와 통신 단절 상황에 대응하는 ‘엣지 데이터센터’를 연계한 국방 전용 AI 데이터센터도 제공한다. 네이버클라우드는 올해 국방 AX 기반을 구축하고 관련 사업에 참여하며, 2030년까지 국방 전 영역에 AI 에이전트를 확산한다는 계획이다. 국가 기술 경쟁력 견인하는 특허 AI Ready Data… 워트인텔리전스 특허 데이터는 복잡한 법률·기술적 언어로 구성돼 AI 레디 데이터로 가공하기 까다로운 영역으로 꼽힌다. 복잡한 권리 구조와 도면·텍스트 연결, 고난도 기술 용어 매핑에 전문성이 요구되며, 높은 진입 장벽으로 공공 주도만으로는 인프라 구축과 가공이 어렵다는 지적이 나온다. 특허 버티컬 AI 기업 워트인텔리전스는 106개국 1억 7000만 건의 특허 데이터를 AI 레디 데이터로 구조화하고 있다. AI가 특허 원문에서 직접 기술 맥락을 읽어내는 구조로 설계해 분석 과정의 주관적 판단 개입을 줄였다는 설명이다. 자체 AI 레디 데이터와 이를 학습한 특허 특화 모델 ‘플루토LM’을 결합한 ‘키워트 인사이트’를 통해 기술 탐색부터 분석, 인사이트 도출까지 이어지는 구조를 구현했다. 플루토LM은 특허 1억 7000만 건, 특허 문장 2500억 개를 학습한 LLM으로, 리서치 과정의 정보 왜곡을 최소화했다는 설명이다. 워트인텔리전스는 LG AI연구원과 기업 IP 조직의 AX 협력을 진행 중이며, IP팀과 외부 대리인 간 데이터 흐름·자동화 범위에 대한 운영 가이드를 단계적으로 구체화한 뒤 유사 산업군으로 협력 모델을 확장한다는 방침이다. 지식재산처 AX 프로젝트에 특허 특화 LLM과 AI 레디 데이터를 공급하고 있으며, 산업통상자원부 ‘AI+R&DI 추진전략’ 핵심 프로젝트 ‘테크-GPT’에 참여해 LLM을 개발했다. 최근에는 트릴리온랩스와 화학 특화 AI 모델 공동 개발을 위한 업무협약을 체결했으며, 해당 모델은 8월 키워트 인사이트에 탑재될 예정이다. 1500건의 프로젝트 레퍼런스 보유… 엔코아 금융·제조·유통 등 산업 전반에서 AX 도입이 늘고 있지만, 시스템별로 흩어진 데이터를 AI 모델에 곧바로 학습시키지 못하는 경우가 많아 고품질 데이터 거버넌스와 자산화 전략이 필요하다는 지적이 나온다. SK네트웍스 자회사 엔코아는 국내외에서 약 1500건 이상의 기업·공공 데이터 및 AI 프로젝트를 수행했다. 기업의 다양한 데이터를 의미 기반으로 연결해 데이터 간 관계와 맥락을 통합 관리하는 ‘데이터 맥락 지도’ 개념을 제시했다는 설명이다. 엔코아는 이 같은 기술력을 바탕으로 금융의 보안, 유통의 공급망 관리 등 산업 특성에 맞춘 모델로 영역을 확장하고 있다. 최근에는 국가데이터처가 엔코아를 방문해 AX 시대에 적합한 공공데이터 품질관리 고도화 방안을 논의했다. 엔코아는 공공데이터가 AI Ready Data 관점에서 재정비돼야 민간 활용과 산업 전반의 AX를 견인할 수 있다는 입장을 밝혔다. 이 같은 데이터 체계 구축 철학은 실무 인재 양성으로도 이어지고 있다. 엔코아는 오프라인 부트캠프를 통해 3500명 이상의 수료생을 배출했으며, 실무 훈련 역량을 인정받아 ‘2025 훈련성과 우수기관’으로 선정됐다. 이를 바탕으로 올해 고용노동부의 AI 특화 직업훈련 사업 ‘K-디지털트레이닝 AI 캠퍼스’ 운영기관에 선정돼 현장 수요에 맞춘 AI Ready Data 인재 양성에 집중할 계획이다.
  • 천안시, 중소·제조 기업 ‘AI 전환’ 지원

    천안시, 중소·제조 기업 ‘AI 전환’ 지원

    충남 천안시는 중소 제조기업의 인공지능(AI) 전환을 지원하는 ‘지역 주도형 AI 대전환’ 사업 참여 기업을 모집한다고 29일 밝혔다. 시에 따르면 중소벤처기업부 공모 사업 선정에 따라 공동 AI 인프라 구축과 기업 맞춤형 AI 솔루션 등을 도입해 중소 제조기업 현장의 AI 전환을 지원한다. 지원 대상은 본사가 천안시를 비롯한 충청남도 내 소재한 중소 제조기업이다. 지역 주력 산업인 디스플레이·모빌리티·반도체 분야 제조기업을 우대한다. 지원 분야는 △설비에 센서를 부착해 데이터를 수집하는 ‘리트로핏’ △제품 불량을 자동 판별하는 ‘AI 비전검사’ △작업현장의 위험 요인을 실시간 감시하는 ‘AI 산업안전’ △제조 데이터를 분석해 설비와 공정 운영을 개선하는‘AI운영관리(AIOPs)’ △사진·영상·음성 기반 공정 분석 및 의사결정을 지원하는 ‘옴니모달 sLLM’ 등 5가지다. 자세한 내용은 충남테크노파크 누리집에서 공고문을 통해 7월 17일 오후 6시까지 신청 서류를 전자우편(chaeunbae@ctp.or.kr)으로 제출하면 된다. 시 관계자는 “AI 도입을 검토하고 있는 관내 중소 제조기업들이 비용 부담을 줄이고 제조공정의 품질과 안전, 운영 효율을 높이길 기대한다”고 말했다.
  • SSSTC, 컴퓨텍스 2026서 AI 데이터 센터 열 관리 액침 냉각 SSD 솔루션 선보여

    SSSTC, 컴퓨텍스 2026서 AI 데이터 센터 열 관리 액침 냉각 SSD 솔루션 선보여

    키오시아 코퍼레이션(Kioxia Corporation)의 자회사인 솔리드 스테이트 스토리지 테크놀로지 코퍼레이션(SSSTC)이 액침 냉각(Immersion Cooling) 기술을 적용한 기업용 및 산업용 SSD 포트폴리오를 선보였다. 생성형 AI와 고밀도 컴퓨팅 인프라의 확산으로 데이터센터의 열 관리 중요성이 부각되는 가운데, SSSTC는 특수 소재, 부품 보호 기술, 구조 설계를 적용해 내식성을 확보하고 액침 냉각 환경에 대응할 수 있도록 SSD를 설계했다. 주요 제품군은 SATA ER3, ER4, ER5 시리즈와 PCIe® U.2 PJ1 및 EJ5 시리즈로 구성된다. 해당 SSD 제품군은 비전도성 유전체 유체 내부에서 작동할 수 있도록 설계됐다. 액체의 높은 열용량과 대류 특성을 활용해 유체 순환 및 열교환 과정에서 열을 방출하도록 함으로써, 공랭식 냉각 방식에 대한 의존도를 낮추고 전력 사용 효율(PUE)과 시스템 안정성 관리에 기여하도록 했다. SSSTC는 이와 함께 AI 및 엣지 컴퓨팅 환경에 대응하는 산업용 및 기업용 SSD 제품군도 공개했다. 산업용 SSD는 영하 40도에서 영상 85도까지의 작동 온도 범위를 지원하며, 실외 및 산업 현장 환경에 적합하도록 방진·내충격 설계를 적용해 엣지 AI 운영을 지원한다. 또한 pSLC 아키텍처를 기반으로 쓰기 작업 내구성을 강화했으며, 하드웨어 PLP, 펌웨어 PLP, PLN을 포함한 다계층 전력 손실 보호(Power Loss Protection) 체계를 통해 데이터 보호 기능을 제공한다. 기업용 eTLC SSD는 AI 워크로드 처리를 목표로 설계된 제품이다. 워크로드 강도에 따라 5년 기준 1 DWPD와 3 DWPD 내구성 옵션을 제공하며, 실제 워크로드 환경에서도 90% 이상의 랜덤 IOPS 성능을 유지할 수 있도록 설계됐다. 여기에 고밀도 컴퓨팅 환경에 최적화된 펌웨어를 적용해 지연 시간을 관리하고, 커패시터 기반 PLP와 액침 냉각 지원을 통해 운영 환경에서의 안정성을 높였다. SSSTC는 18년 이상 자체 펌웨어 개발을 통해 축적한 기술력을 바탕으로 다양한 스토리지 요구사항에 대응하고 있다. 제공되는 커스터마이징 옵션으로는 설정 가능한 오버 프로비저닝(Over-Provisioning), 수명 및 용량 최적화, 성능 및 전력 조정, 애플리케이션별 맞춤형 펌웨어 개발 등이 있다. SSSTC는 앞으로도 AI 스토리지 인프라 구축에 필요한 기술 지원을 지속하며, 다양한 산업 환경에 최적화된 SSD 솔루션을 확대해 나갈 방침이다.
  • 인텔 ‘아크 G3’…휴대용 PC 게임 시장에 새로운 다크호스가 나타났다 [고든 정의 TECH+]

    인텔 ‘아크 G3’…휴대용 PC 게임 시장에 새로운 다크호스가 나타났다 [고든 정의 TECH+]

    인텔이 팬서 레이크(Panther Lake) 아키텍처를 기반으로 한 휴대용 게임 기기 전용 시스템 온 칩(SoC)인 ‘인텔 아크 G3’ 시리즈를 공식 공개했습니다. 기본적으론 노트북용 팬서 레이크와 같은 프로세서이지만, 인텔은 단순한 하위 브랜드가 아니라 휴대용 PC(UMPC)의 특성에 맞춰 최적화된 특수 목적형 프로세서라고 강조하고 있습니다. 손으로 들고 다니는 휴대용 PC의 주요 목적은 게임입니다. 하지만 기존 노트북 프로세서로는 작은 휴대 기기에서 충분한 발열 제어가 힘들기 때문에 효율은 높이고 전력 소모는 줄여야 합니다. 그래서 아크 G3는 발열이 많은 고성능 P 코어는 4개에서 2개로 줄이고 고효율 E 코어 8개와 저전력 LP-E 코어 4개를 조합한 14코어 구성을 지니고 있습니다. 또한 최대 35W의 TDP에 맞춰 Xe 3 GPU의 전력 특성을 재설계하여 전력 소모를 대폭 줄였습니다. 구체적인 스펙을 살펴보면, 최상위 모델인 ‘아크 G3 익스트림’은 4.7GHz의 P 코어와 2.3GHz의 12코어 Xe 3 GPU(아크 B390)를 탑재했습니다. 반면 일반 모델인 ‘아크 G3’는 P 코어 클럭이 100MHz 낮은 4.6GHz이며, GPU는 10코어 구성의 아크 B370(2.2GHz)으로 약간 낮췄습니다. 두 제품 모두 인텔의 최신 18A 공정으로 제작됐으며, 12개의 PCIe 레인(x8 Gen4 / x4 Gen5), 듀얼 선더볼트 4 포트, Wi-Fi 7 R2 및 듀얼 블루투스 6.0 등 차세대 네트워크 스펙을 갖추고 있습니다. 메모리는 최대 96GB의 LPDDR5X-8533을 지원하지만, 현재 메모리 가격을 감안할 때 실제 시장에서는 16GB 또는 32GB 제품이 주를 이룰 것으로 예상됩니다. 휴대용 게임기에서 가장 중요한 부분인 내장 그래픽의 연산 능력은 AI 연산 (INT8 기준)으로 113 PTOPS, B370은 90 PTOPS입니다. 인텔이 전체 연산 능력이 아니라 AI 연산 능력을 강조한 점이 눈길을 끄는데, 이는 그만큼 최근 AI를 이용한 프레임 생성 및 이미지 향상 기술이 중요해졌기 때문입니다. 본래 인텔은 그래픽 분야에서는 엔비디아는 물론 AMD와 비교해도 후발주자라는 평가가 많았지만, 이번에 공개한 팬서 레이크에서는 달라졌다는 평가를 받고 있습니다. 특히 인텔 아크 G3는 가장 직접적인 경쟁 상대인 AMD의 라이젠 Z2 익스트림과 비교해서 게임 성능에서 우위가 예상됩니다. 왜냐하면 같은 Xe 3 내장 GPU가 이미 노트북에서 보여준 성능상의 우위가 있기 때문입니다. 인텔의 아크 B390은 AMD 라이젠 Z2 익스트림에 탑재된 라데온 890M(16 CU, RDNA 3.5)과 비교해서 기본 성능에서 약간 더 앞서 있을 것으로 보입니다. 하지만 더 중요한 대목은 AI 성능에서 꽤 앞선다는 것입니다. 특히 휴대용 기기는 화면 크기가 작고 전력 소비가 제한적이기 때문에, 낮은 해상도에서 게임을 구동할 때 업스케일링 기술의 완성도가 체감 성능에 많은 영향을 미칩니다. 인텔의 AI 기술인 XeSS 3는 전용 Xe 코어 및 XMX AI 가속기를 활용하여 텍스트 가독성과 미세 디테일을 선명하게 유지하면서도 성능을 크게 높인 것으로 평가받고 있습니다. 특히 라데온 890M의 FSR 기술이 실제적으로 x2 프레임 생성 정도가 한계인 반면 XeSS 3는 x4 생성이 가능해 체감 속도를 크게 높일 수 있습니다. 따라서 사이버펑크 2077 같은 고사양 게임에서도 1080 해상도에서 만족스러운 플레이가 가능할 것으로 기대됩니다. 현재 에이서 프레디터 아틀라스 8(Acer Predator Atlas 8), MSI 클로 8 EX AI+(MSI Claw 8 EX AI+), 원엑스플레이어 3(OneXPlayer 3) 등 6월 출시 예정인 기기들이 아크 G3를 탑재할 예정으로 실제 성능과 가격 등이 곧 공개될 예정입니다. 아마 흥행에 최대 변수는 가격이 될 것으로 보입니다. 어느 정도 게임도 설치하고 성능에서 손해도 보지 않으려면 넉넉한 메모리와 SSD가 필수인데, 현재 둘 다 가격이 천정부지로 치솟아 올라 가격이 저렴하진 않을 것으로 예상됩니다.
  • 오케스트로, GPU 활용률 높이는 AI 추론 운영 플랫폼 ‘콘체르토 AI’ 공개

    오케스트로, GPU 활용률 높이는 AI 추론 운영 플랫폼 ‘콘체르토 AI’ 공개

    - 분산 서빙 기반 추론 최적화… 보유 GPU 인프라 활용 효율 높여- 고부하 환경서 토큰 출력 속도 2.2배 향상… AI 서비스 응답 지연 완화- 국내 유일 GPU·국산 NPU 이기종 가속기 지원… 소버린 AI 인프라 선택권 확대 AI·클라우드 소프트웨어 전문 기업 오케스트로(대표 김범재, 김영광)는 보유 GPU 인프라의 활용 효율을 높여 기업 AI 서비스의 추론 병목을 줄이는 AI 추론 운영 플랫폼 ‘콘체르토 AI(CONCERTO A.I.)’를 선보였다고 29일 밝혔다. 생성형 AI 도입이 확산되면서 기업 AI 인프라의 핵심 과제는 GPU 확보에서 추론 운영 효율화로 전환되고 있다. AI 챗봇, 업무 자동화 에이전트, 검색증강생성(RAG) 기반 서비스 등 상시 운영 AI 서비스가 늘어나면서 모델 호출과 추론 연산 수요도 함께 증가하고 있다. 에이전트형 AI 환경에서는 단일 요청이 복수의 모델 호출과 반복 연산으로 이어져 추론 작업량이 단기간에 급증할 수 있다. GPU를 보유하더라도 추론 요청이 특정 자원에 집중되면 병목으로 인한 응답 지연과 자원 낭비가 동시에 발생하는 구조적 문제가 따른다. 콘체르토 AI는 분산 서빙 기반의 추론 최적화를 핵심 기술로 채택했다. 기존 단일 처리 방식은 질문 분석과 답변 생성을 동일 GPU 자원에서 처리해 요청 집중 시 전체 응답 속도가 저하된다. 콘체르토 AI는 두 작업을 분리해 각각에 적합한 자원을 배치함으로써 병목을 줄인다. 여기에 키-값 캐시(KV Cache) 최적화와 메모리 재사용 기술을 적용해 초기 응답 시간과 토큰 처리 속도를 개선하고, 실시간 대기열·자원 상태 기반 지능형 라우팅 기능을 결합해 고부하 환경에서도 응답 성능을 유지한다. 오케스트로가 자체 온프레미스 AI 인프라 환경에서 수행한 벤치마크 테스트에 따르면, 동시 요청이 집중되는 고부하 환경에서 콘체르토 AI의 분산 서빙 방식은 기존 단일 처리 방식 대비 토큰 출력 속도를 2.2배 높게 유지한 것으로 나타났다. 운영 자동화 기능도 탑재됐다. 콘체르토 AI는 AI 모델 배포부터 추론 요청 처리, 자원 배분, 성능 모니터링까지 LLMOps에 필요한 기능을 단일 플랫폼에서 제공한다. 표준화된 모델 패키징 기술을 기반으로 쿠버네티스 파드(Pod) 생성부터 엔드포인트 연결까지 배포 과정을 자동화하며, 배포 이후에는 초기 응답 시간·토큰 처리 속도·자원 사용량 등 주요 지표를 통합 모니터링 환경에서 확인할 수 있다. 인프라 호환성 측면에서는 엔비디아 GPU 외에 리벨리온·퓨리오사AI 등 국산 NPU 환경까지 지원하는 이기종 가속기 구조를 채택했다. 오케스트로 측은 GPU와 국산 NPU를 아우르는 상용화 수준의 AI 추론 운영 플랫폼은 국내에서 콘체르토 AI가 유일하다고 밝혔다. 이를 통해 기업·기관은 프라이빗 AI 및 소버린 AI 환경에서 특정 하드웨어 벤더 의존도를 낮추고 서비스 특성과 보유 인프라에 맞춰 추론 자원을 구성할 수 있다. 김범재 오케스트로 대표는 “기업 AI 인프라의 과제는 더 많은 GPU를 확보하는 것에서 보유 자원을 얼마나 효율적으로 운영하느냐로 옮겨가고 있다”며 “콘체르토 AI를 기반으로 기업이 보유한 AI 인프라의 활용 효율을 높이고, 프라이빗 AI 환경에서도 안정적인 AI 서비스 운영을 지원하겠다”고 밝혔다.
  • 엔비디아 대항마 ‘라이젠 AI 헤일로’ 내놓은 AMD…맥 미니처럼 인기 끌까 [고든 정의 TECH+]

    엔비디아 대항마 ‘라이젠 AI 헤일로’ 내놓은 AMD…맥 미니처럼 인기 끌까 [고든 정의 TECH+]

    현재 미니 PC 시장에서 가장 인기 있는 제품은 아마도 ‘맥 미니’일 것입니다. 특히 ‘로컬 인공지능(AI)’ 돌리기에 적합한 M4 프로 맥 미니가 큰 인기를 끌고 있습니다. 맥 미니는 LLM을 로컬로 장시간 돌릴 때 몇 가지 큰 장점이 있습니다. 우선 통합 메모리 구조로 메모리의 3분의2를 GPU에 할당해 큰 모델을 돌릴 수 있으며 데이터가 CPU와 GPU를 오가면서 시간과 연산 자원을 낭비할 필요가 없습니다. 여기에 매우 전력 소모량이 적어서 장시간 돌려도 전기료가 적게 나옵니다. 차지하는 면적이 매우 적은 것도 장점입니다. 이런 이유로 맥 미니는 24시간 돌릴 수 있는 인공 지능 비서인 ‘오픈 클로’(Open Claw)용으로 품귀 현상을 보일 정도로 인기가 좋습니다. 600만원이 넘는 그래픽 카드인 RTX 5090는 속도는 더 빠를지 몰라도 메모리는 32GB로 한정돼 돌릴 수 있는 모델 크기에 제한이 있고 엔비디아의 AI 미니 PC인 ‘DGX 스파크’는 128GB라는 대용량 메모리를 갖췄지만 최근 가격이 꽤 올라 맥 미니가 AI용으로 훨씬 더 가성비 있는 제품이 된 상태입니다. AI 미니 PC의 인기가 좋아지면서 또 다른 CPU 및 GPU 제조사인 AMD 역시 대항마를 출시해 이 시장에서 경쟁을 예고하고 있습니다. 최근 AMD는 자체 AI PC인 ‘라이젠 AI 헤일로 개발자 플랫폼’(Ryzen AI Halo Dev Platform, 이하 라이젠 AI 헤일로)을 선보였습니다. 최대 16코어 CPU와 라데온 8060S (40코어 RDNA 3.5) GPU, 50 TOPS XDNA 2 NPU를 지닌 라 데온 AI MAX+ 395를 대표 제품으로 내세운 라이젠 AI 헤일로는 최대 128 GB LPDDR5X-8000와 2TB SSD를 지원하면서도 맥 미니와 견줄 수 있는 작은 크기를 자랑합니다. 최대 TDP는 120W로 다소 높지만, 고성능 그래픽 카드와 비교하면 감당할 만한 수준입니다. AMD는 이 모델의 시작 가격이 3999달러이고 최대 128GB 메모리를 탑재해 200B의 큰 파라미터를 지닌 모델도 로컬로 구동할 수 있다고 설명하고 있습니다. 여기에 라이젠 AI 맥스 400 시리즈를 탑재한 2세대 모델의 경우 192GB 버전이 존재하고 최대 160GB나 되는 메모리를 GPU로 할당할 수 있어 최대 300B에 달하는 거대한 모델도 돌릴 수 있습니다. 또 AMD는 라이젠 AI 헤일로가 맥 미니보다 일부 생성형 AI에서 최대 4배 정도 빠르다고 주장하고 있는데, 훨씬 저렴한 제품과 비교하는 것이 과연 맞는 비교인지 궁금해지는 대목이기도 합니다. 오히려 비슷한 가격대인 맥 스튜디오와의 비교는 끝까지 보여주지 않는 점이 더 흥미롭습니다. 참고로 맥 스튜디오 M4 맥스 64GB 제품은 1TB SSD 기준 464만원이고 M3 울트라 96GB 1TB SSD 기준 659만원입니다. 시작 가격인 3,999달러를 현재 환율로 환산하면 600만원이 좀 넘는데 10% 부가세 가산 시 660만원 이상으로 M3 울트라 96GB와 비교가 맞지 않나 생각입니다. 여기에는 나름의 속사정이 있습니다. M3 울트라는 메모리 대역폭이 819 GB/s에 달해 토큰 생성 속도가 꽤 빠릅니다. 반면 AMD 라이젠 AI Max+ 395의 메모리 대역폭은 약 256 GB/s (쿼드 채널 LPDDR5x 8000 기준)으로 훨씬 느리기 때문에 직접 비교를 피한 것으로 보입니다. 오히려 M4 프로의 메모리 대역폭이 273 GB/s로 비슷합니다. 한편 비슷한 AI 미니 컴퓨터인 엔비디아 DGX 스파크와 비교해서는 일부 LLM 모델에서 토큰 속도가 더 빠르다고 주장하고 있습니다. 구체적으로 GPT OSS (120B)는 7% 이상, Qwen 3.5 (122B)는 12% 이상, Qwen 3.6 (35B)는 4% 이상, GLM 4.7 (30B)은 14% 이상입니다. 따라서 라이젠 AI 헤일로는 직접 경쟁 상태인 DGX 스파크보다 일부 모델에서 약간 더 나은 성능을 지니고 있으며 x86 CPU라 윈도우 OS도 구동이 가능하다는 것이 핵심이라고 하겠습니다. DGX 스파크는 개인용 컴퓨터보다는 미니 서버에 가까운 물건으로 일반 소비자용 PC처럼 사용이 어렵지만, 라이젠 AI 헤일로는 윈도우 OS를 설치해서 그런 식으로도 사용 가능합니다. 차라리 맥 미니와의 무리한 비교보다 이점에 초점을 맞춰 발표하는 게 더 낫지 않았나 하는 생각입니다. 가격 포지션으로 큰 차이가 나는데도 맥 미니를 주요 라이벌로 설정한 이유는 역설적으로 그만큼 맥 미니의 인기가 높다는 반증일 것입니다. DGX 스파크처럼 비싼 가격을 받아야 하지만, 맥 미니처럼 인기를 끌 수 있는 제품이 될 수 있을지 궁금해지는 발표입니다.
  • 오케스트로, 2026년 클라우드 네이티브 상세설계 1·2차 사업 모두 석권… 공공 클라우드 시장 독주 체제 굳혀

    오케스트로, 2026년 클라우드 네이티브 상세설계 1·2차 사업 모두 석권… 공공 클라우드 시장 독주 체제 굳혀

    AI·클라우드 소프트웨어 전문 기업 오케스트로(대표 김범재, 김영광)가 행정안전부와 한국지능정보사회진흥원(NIA)이 주관하는 ‘2026년 클라우드 네이티브 상세설계’ 1·2차 사업을 모두 수주했다고 20일 밝혔다. 이번 수주를 통해 오케스트로는 공공 클라우드 네이티브 전환 시장에서의 압도적인 기술력과 경쟁력을 다시 한번 입증했다. 오케스트로는 올해 클라우드 네이티브 전환 상세설계 대상인 7개 기관의 핵심 설계 컨설팅을 전담한다. 이를 위해 각 기관의 업무 특성과 시스템 구조를 정밀 분석하고, 마이크로서비스 아키텍처(MSA), 컨테이너, 데브옵스(DevOps) 등 핵심 기술을 적용한 상세설계를 수행한다. 특히 애플리케이션 설계뿐 아니라 데이터베이스(DB), 인프라, 보안 체계 수립까지 포함해 중단 없는 서비스 제공과 유연한 확장성을 고려한 실질적인 이행 전략을 제시할 계획이다. 이번 사업은 국민 생활과 밀접한 시스템부터 대규모 행정 서비스까지 폭넓게 아우른다. 1차 사업에는 ▲행정안전부 ‘상훈시스템’ ▲소상공인시장진흥공단 ‘소상공인24’ ▲한국토지주택공사(LH) ‘렌트홈’ ▲한국수자원공사 ‘국가상수도정보시스템’ 등이 포함된다. 2차 사업은 ▲근로복지공단 ‘노동보험시스템’ ▲한국농수산식품유통공사 ‘농식품수출정보’ ▲한국교통안전공단 ‘자동차 검사관리 시스템’ 등 대규모 트래픽 처리와 높은 수준의 안정성이 요구되는 핵심 서비스를 대상으로 한다. 이처럼 국민 생활과 밀접한 공공 서비스를 중심으로 클라우드 네이티브 전환이 빠르게 확대되고 있다. 레거시 시스템 중심의 운영 방식만으로는 안정성과 확장성, 서비스 연속성을 충분히 확보하기 어렵기 때문이다. 특히 AI 활용과 재해복구(DR) 체계 고도화를 위해서는 클라우드 기반의 유연한 구조가 필수적이다. 공공 분야에서 전환 효과가 확인됨에 따라 금융권을 비롯한 주요 산업에서도 클라우드 네이티브 전환은 더 이상 선택이 아닌 핵심 과제로 자리 잡고 있다. 이 같은 흐름 속에서 오케스트로는 지난 3년 동안 국내 최다 수준의 클라우드 네이티브 설계 및 전환 사업을 수행하며 대규모 공공 시스템 수행 역량을 축적해 왔다. 2024년 행정안전부 ‘클라우드 네이티브 전환 상세설계 2차 사업’과 ‘긴급신고 공동관리센터 전환 사업’을 주관한 데 이어, 2025년에는 국민재난안전포털, 안전디딤돌 등 국가 핵심 시스템이 포함된 3차·8차 상세설계 사업을 성공적으로 완수하며 공공 클라우드 네이티브 전환 분야에서 독보적인 기술력과 실행력을 입증했다. 특히 클라우드 네이티브 서비스 전문 계열사인 오케스트로 클라우드의 인프라 구축·운영 전문성을 더해 컨설팅부터 설계, 구축, 운영까지 전 과정을 아우르는 엔드 투 엔드(End-to-End) 서비스를 제공한다. 이러한 풀 사이클(Full-Cycle) 역량을 바탕으로 복잡한 레거시 시스템을 클라우드 네이티브 환경으로 안정적으로 전환하는 것은 물론, 기관과 기업의 전환 부담을 낮추고 실제 운영 단계까지 고려한 실행 로드맵을 신속하게 구체화할 수 있도록 지원한다. 오케스트로가 공공 핵심 시스템을 통해 입증한 클라우드 네이티브 역량을 금융권 등 민간 주요 산업군으로 본격 확대한다. 지난해 금융권 MSA(마이크로서비스 아키텍처) 전환 설계 등 대형 프로젝트를 성공적으로 수행하며 클라우드 네이티브 설계 및 구축 분야에서 가시적인 성과를 거둔 바 있다. 이번 사업을 발판 삼아 오케스트로는 공공 클라우드 네이티브 전환의 표준 모델을 고도화하고, 검증된 방법론을 기반으로 ‘AI 정부’ 구현을 위한 기술적 토대를 탄탄히 다질 계획이다. 나아가 국가 핵심 행정시스템은 물론 금융권과 주요 기업의 전환 수요에 선제적으로 대응함으로써, 국내 클라우드 네이티브 시장을 선도하는 리딩 기업으로서의 입지를 더욱 공고히 하겠다는 방침이다. 박소아 오케스트로 CDO는 “이번 1·2차 사업 동시 수주는 오케스트로의 독보적인 기술력과 공공 핵심 시스템 수행 경험이 결합된 성과”라며 “컨설팅부터 구축, 운영까지 이어지는 풀 사이클 역량을 바탕으로 공공기관과 금융권은 물론, 클라우드 네이티브 전환에 어려움을 겪는 기업들이 안정적으로 전환을 추진할 수 있도록 최적의 전환 청사진과 실행 방안을 제시하겠다”고 밝혔다.
  • 크롬북 플러스 대신 구글북 들고 나온 구글의 속사정 [고든 정의 TECH+]

    크롬북 플러스 대신 구글북 들고 나온 구글의 속사정 [고든 정의 TECH+]

    구글이 제미나이를 운영체제(OS)에 통합한 지능형 체제(IS)의 개념을 내놓으면서 크롬북 플러스를 업데이트 하는 대신 새로운 노트북 라인업인 ‘구글북’(Googlebook)을 공개했습니다. 상세 사양이나 제품에 대한 공개는 없었지만, 기존의 윈도우나 iOS/Mac에 맞설 수 있는 노트북 OS와 제품군을 만드는 것이 목표로 보입니다. 하지만 여기서 의문이 드는 대목은 과거 공개한 크롬북 플러스와의 차이점이 무엇이냐는 것입니다. 기본적으로 크롬 OS와 크롬북은 저가형 교육용 노트북 시장에서 나름 자신만의 입지를 굳힌 제품입니다. 국내에서는 널리 쓰이지 않지만, 미국, 유럽, 일본에서는 교육용 제품으로 많이 사용됩니다. 일단 OS 가격이 포함되지 않고 윈도우 보다 낮은 사양에서도 돌아가는 장점이 있어 가격이 중요한 교육용 시장에서 인기를 끌고 있는 것입니다. 특히 코로나19 대유행 시기에는 온라인 수업과 연계되면서 판매량이 연간 3000만대를 넘기도 했습니다. 하지만 그 이후에는 판매량이 하락세를 겪었습니다. 최근에는 다시 완만한 회복세를 보였으나 올해 메모리, SSD 가격이 큰 폭으로 상승하면서 다시 판매량이 줄어들 가능성이 큰 상태입니다. 크롬북의 문제점은 기본적으로 저가형이고 사양이 낮아서 업무용 및 게임 등 다양한 용도로 쓰기에는 다소 아쉽다는 것입니다. 따라서 구글은 크롬북 플러스라는 업그레이드 형을 이미 발표한 바 있습니다. 제조사 입장에서는 저가형만 만들다 보니 수익성이 낮고 구글 입장에서는 점유율을 늘려 생태계를 확장할 필요가 있어 나온 제품이지만, 실제 판매량은 많지 않았습니다. 크롬북 수요 자체가 300달러 이하의 교육용 노트북에 집중되어 있는데다, 약간 비용을 추가하면 모든 기능을 갖춘 맥북 에어나 윈도우 노트북을 살 수 있기 때문입니다. 따라서 구글북은 크롬북과 크롬북 플러스의 한계를 돌파하기 위한 제품으로 볼 수 있습니다. 구글에 따르면 구글북은 안드로이드, 구글 플레이, 그리고 크롬OS(ChromeOS)의 장점을 한데 모았습니다. 예를 들어 별도의 에뮬레이션 과정 없이 노트북에서 안드로이드 애플리케이션을 완벽하게 구동할 수 있습니다. 또 구글북은 인공지능(AI) 기술인 ‘제미나이’(Gemini)를 핵심 성능으로 내세우고 있습니다. 예를 들어 사용자가 마우스 포인터를 흔드는 동작(shake)을 통해 즉시 제미나이 모드를 활성화할 수 있는 새로운 인터페이스를 도입했습니다. 그리고 제미나이를 통해 자신만의 맞춤형 위젯을 생성하고 활용할 수도 있습니다. 하지만 이것만으로 소비자들의 지갑을 열게 할 수 있을진 미지수입니다. 구글 AI 서비스 확산과 주도권 확보를 위해서는 결국 모든 플랫폼에서 제미나이를 제한 없이 사용할 수 있게 해줘야 합니다. 이미 널리 보급된 윈도우 OS를 기반으로 한 코파일럿 기능처럼 OS나 플랫폼에 제한을 둘 수 없다는 이야기입니다. 더구나 사실 AI 기능 강조는 구글 크롬북 플러스에서도 똑같이 했던 이야기입니다. 구글 포토에서 사진에 불필요한 부분을 지워주는 매직 이레이저나 화상회의 AI, 제미나이와의 통합 등은 이미 크롬북 플러스에서 선보인 내용입니다. 구글북은 제미나이와의 더 깊은 통합을 강조하고 있는데, 통합하지 않아도 잘 쓸 수 있는 제미나이를 통합해 과연 시너지 효과를 볼 수 있을지 의문이 드는 대목입니다. 두 번째로 하드웨어 역시 기존의 AI 노트북보다 낮을 수 있습니다. 인텔의 와일드캣 레이크 (Wildcat Lake)를 사용할 것이라는 이야기가 나오고 있는데, 기본적으로 고성능 코어 2개에 저전력 코어 4개를 사용해 성능이 그렇게까지 뛰어나다고 보긴 어렵습니다. 내장 그래픽은 Xe3 iGPU 역시 2코어이고 NPU 성능 역시 코파일럿 기능을 지원하는 AI 노트북(40 TOPS 이상) 보다 훨씬 낮은 17 TOPS 정도로 알려져 있습니다. 물론 제조사에 따라 더 강력한 칩을 탑재할 수도 있으나 그러면 가격도 그만큼 올라가게 될 것입니다. 주요 경쟁 상대인 맥북 네오와 가격 경쟁이 힘든 것은 물론 맥북 에어, 윈도우 AI 노트북들과 가격이 비슷해질 수도 있습니다. 세번째 문제는 x86에 안드로이드 기반일 것으로 보이는 구글 OS를 돌린다는 것입니다. 과거에도 x86 안드로이드가 있긴 했지만 성능 최적화 측면에서 보면 Arm 만큼 성능과 호환성이 좋지 못했습니다. 설령 호환이 된다 해도 성능에서는 손해가 있을 수 있습니다. 지금 Arm 윈도우 시장에 나와 있는 퀄컴의 스냅드래곤 기반 AI 노트북과 비슷한 문제에 직면할 가능성이 있어 보이는데, 굳이 x86 프로세서를 채택한 배경 역시 궁금해지는 부분입니다. 마지막으로 지금 직면한 가장 큰 문제는 칩플레이션을 극복할 수 있느냐는 것입니다. 애플은 칩플레이션 상황에서 상대적으로 선전하고 있습니다. 기본적으로 맥북은 OS 자체가 메모리 절약 성능이 우수해 메모리를 상대적으로 적게 탑재해도 윈도우 노트북보다 유리한 상황입니다. 여기에 자체 프로세서와 OS를 통해 수직 계열화를 이룩해 가격 통제가 쉽고 본래 높은 가격의 프리미엄 이미지로 가격 인상 요인도 쉽게 흡수할 수 있습니다. 덕분에 애플은 올해 유일하게 판매량이 대폭 늘어날 대형 컴퓨터 제조업체로 지목되고 있습니다. 반면 구글북은 에이서, 델, HP, 레노버, ASUS 같은 기존 업체들이 참가하는 방식으로 보입니다. 이들은 애플처럼 자체 칩을 사용하지도 않고 공급망 장악력이 떨어지기 때문에 현재 칩플레이션으로 가격이 폭등하면서 판매가 줄어들고 있는 윈도우 노트북과 차이점이 과연 무엇인지 애매한 상황입니다. 그럼에도 구글이 구글북이라는 새로운 제품군을 들고나온 것은 결국 크롬북 플러스로는 일반 노트북 및 PC 시장에 진입하기가 쉽지 않다는 한계를 확인했기 때문일 것입니다. 2011년 크롬북도 처음에는 성공 여부가 불투명했으나 결국 교육 시장에서 자리를 잡은 것처럼, 구글북 역시 제미나이 AI 노트북이라는 새로운 정체성을 찾고 시장에 안착할 수 있을지 주목됩니다.
  • 오케스트로·한양대, AI 에이전트 클라우드 장애 분석 연구 ASPLOS 2026 워크숍 논문 채택

    오케스트로·한양대, AI 에이전트 클라우드 장애 분석 연구 ASPLOS 2026 워크숍 논문 채택

    - AI 에이전트 실패 원인 12가지 함정으로 체계화… 환각·불충분한 탐색이 주요 요인- 에이전트 간 통신 프로토콜 강화로… 오류 줄이고 실행 시간 22.3% 단축- IITP 국책과제 핵심 성과… MS 주도 AIOps 워크숍서 국내 산학 컨소시엄 유일 채택 AI·클라우드 소프트웨어 기업 오케스트로(대표 김범재, 김영광)와 한양대학교 분산데이터처리시스템 연구실(지도교수 이경용)이 공동 연구한 AI 에이전트 기반 클라우드 장애 분석 논문이 컴퓨터 시스템 분야 학술대회인 ‘ASPLOS 2026’의 AIOps 워크숍에 최종 채택됐다고 30일 밝혔다. ASPLOS(ACM International Conference on Architectural Support for Programming Languages and Operating Systems)는 컴퓨터 아키텍처, 운영체제, 프로그래밍 언어 등 시스템 분야 전반을 다루는 CORE 랭킹 A* 등급의 학술대회이며, 해당 워크숍은 2020년부터 마이크로소프트가 주도해 온 클라우드 지능화 분야 포럼이다. 이번 논문은 ‘Why Do AI Agents Systematically Fail at Cloud Root Cause Analysis?’를 주제로 거대언어모델(LLM) 기반 AI 에이전트가 클라우드 근본원인분석(RCA) 과정에서 겪는 한계를 공학적으로 분석했다. 연구팀은 5개 모델을 대상으로 총 1675회의 실행과 약 13억 8000만 개의 토큰을 투입하는 실험을 진행해 실패 원인을 12가지 유형으로 체계화했다. 분석 결과 AI 에이전트의 주요 실패 요인은 데이터 해석상의 환각(71.2%)과 불충분한 탐색(63.9%)으로 확인됐다. 이러한 문제는 모델의 성능과 무관하게 공통적으로 나타나, 에이전트 프레임워크의 구조적 결함이 주요 병목 지점임이 밝혀졌다. 연구팀은 프롬프트 수정 대신 에이전트 간 통신 프로토콜을 강화하는 구조적 개선을 통해 오류를 최대 15%포인트 감소시키고 실행 시간은 22.3% 단축하는 성과를 도출했다. 에이전트 간 코드, 실행 결과, 예외 정보 등을 더 풍부하게 공유하는 방식은 정확도와 효율 개선에 효과가 있는 것으로 나타났다. 학술대회 현장에서는 논문 발표 직후 마이크로소프트 리서치를 비롯한 글로벌 빅테크 연구진과 주요 대학 연구진의 질의가 이어졌으며, 산·학계 연구자들은 LLM 기반 근본원인분석의 핵심 실패 요인으로 꼽힌 ‘에이전트 파이프라인의 구조적 한계’와 이를 극복하기 위한 ‘멀티 에이전트 프레임워크’ 기반의 개선 방향에 주목했다. 모델 세대별 환각 추이와 컨텍스트 확장의 부작용 등 독창적인 실험 결과에도 질문이 집중됐으며, 자가 성찰 메커니즘과 RCA 특화 모델 등 차세대 AI 운영 기술을 둘러싼 의견 교류도 활발히 이뤄졌다. 이번 연구는 과학기술정보통신부와 정보통신기획평가원(IITP)이 주관하는 ‘클라우드 장애 극복을 위한 AI 어시스턴트 기반 운영·관리 자동화 기술 개발’ 과제의 핵심 성과다. 오케스트로와 한양대학교 이경용 교수 연구팀이 컨소시엄을 구성해 공동 수행했으며, 글로벌 빅테크가 주도해 온 AIOps 연구 분야에서 국내 연구팀이 치열한 경쟁을 뚫고 독보적인 연구 역량을 입증했다는 평가다. 김범재 오케스트로 대표는 “글로벌 빅테크 기업들이 주도하는 클라우드 인텔리전스 분야에서 오케스트로의 기술력이 세계 최고 수준임을 다시 한번 입증했다”며 “이번 연구 성과를 자사 플랫폼에 적용해 사람이 개입하지 않아도 장애를 스스로 해결하는 ‘자율 운영 클라우드’ 구현에 속도를 낼 것”이라고 밝혔다.
  • 진짜 상태는 엔비디아 아니다? 구글 8세대 TPU에 엿보인 구글의 AI 전략 [고든 정의 TECH+]

    진짜 상태는 엔비디아 아니다? 구글 8세대 TPU에 엿보인 구글의 AI 전략 [고든 정의 TECH+]

    구글이 지난해 8월 7세대 TPU인 아이언우드를 발표한 지 1년도 채 되지 않아 8세대 TPU를 공개하며 AI 가속기 시장에서 속도전을 벌이는 모습입니다. 이렇게 빠르게 차세대 칩을 내놓았다는 것은 7세대 공개 시점에서 이미 8세대를 개발 중이었다는 이야기입니다. 이는 두 개의 팀을 따로 만들어 비용을 더 투자하더라도 개발 경쟁에서 경쟁자를 앞서겠다는 강한 의지 없이는 불가능한 일입니다. 이번 8세대 TPU의 가장 큰 특징은 사상 처음으로 학습과 추론 전용 칩을 분리해 각각 TPU 8t와 TPU 8i로 이원화했다는 점입니다. 특히 이번 세대는 단순한 칩의 성능 향상을 넘어, 스스로 판단하고 행동하는 ‘에이전틱 AI(Agentic AI)’ 시대를 뒷받침하기 위한 ‘AI 하이퍼컴퓨터’ 아키텍처의 핵심 엔진으로 설계됐습니다. 학습 전용인 TPU 8t는 216GB의 HBM 메모리를 탑재하고 단일 슈퍼포드당 최대 9600개의 칩을 3D 토러스(Torus) 토폴로지로 연결해 압도적인 확장성을 자랑합니다. 이를 통해 최첨단 모델의 배포 기간을 수개월에서 수주 단위로 단축할 수 있으며, 포드당 총 121 ExaFlops의 FP4 연산 능력을 제공합니다. 추론 특화 칩인 TPU 8i는 에이전틱 AI의 핵심인 ‘추론(Reasoning)’ 성능을 극대화하기 위해 설계됐습니다. 288GB의 HBM과 더불어 이전 세대보다 3배 늘어난 384MB의 온 칩 (on chip) SRAM을 탑재했습니다. 이는 최근 엔비디아가 공개한 추론 가속기인 그록(Groq) LPU의 SRAM 전략과 유사한 것으로 평가됩니다. 결론적으로 세대별 성능 향상 측면에서 TPU8t 트레이닝 칩은 대규모 학습에서 전 세대 대비 2.7배 향상된 가격 대비 성능을 제공하며, TPU8i 역시 추론 환경에서 전 세대 대비 80% 향상된 가격 대비 성능을 제공합니다. 또 두 칩 모두 와트당 성능이 두 배 향상됐는데, 이는 전력 비용을 줄여 전체적인 AI 총소유비용(TCO)를 크게 줄일 수 있습니다. 이와 같은 비용 절감은 앞으로 AI 서비스의 수익화에 매우 중요한 요소입니다. 다만 기본적으로 엔비디아의 베라 루빈 플랫폼은 여전히 8세대 TPU보다 강력한 성능을 지니고 있습니다. 단일 칩 기준으로만 보면 루빈 GPU는 50 PFLOPS에 달하는 연산 능력을 지녀 8세대 TPU보다 몇 배 빠른 성능을 지니고 있습니다. 문제는 비싼 가격입니다. 엔비디아 플랫폼이 비싼 이유는 칩 자체의 생산 비용도 있지만, 높은 이윤을 남기면서 팔고 있는 것도 중요한 이유입니다. 그런데 여기서 구글이 자체 칩을 만들어 마진을 흡수하면 오픈 AI나 앤스로픽 같은 경쟁자보다 비용을 대폭 절감할 수 있습니다. 최근 칩플레이션과 에너지 비용 급상승으로 AI 서비스 비용은 비싸지고 수익화는 이를 따라가지 못하는 상황에서 구글이 누리는 비용 절감 효과는 결국 AI 경쟁에서 최종 승자가 될 가능성을 높일 수 있습니다. 언뜻 보기에는 구글 TPU가 엔비디아를 겨냥한 것 같지만, 사실은 엔비디아 플랫폼을 사용할 수밖에 없는 다른 경쟁자가 더 압박을 받을 수밖에 없는 셈입니다. 자체 TPU 개발의 또 다른 이점은 자체 서비스에 최적화된 플랫폼과 생태계입니다. 마치 애플의 A 시리즈 및 M 시리즈 프로세서가 iOS 및 맥 OS, 그리고 애플 서비스에 최적화된 기능을 제공할 수 있어 비용은 절감하고 서비스 품질과 사용자 경험은 높일 수 있는 것과 동일한 구조입니다. 사실 이런 이유 때문에 구글뿐 아니라 오픈 AI나 앤스로픽 역시 자체 칩 플랫폼을 개발하거나 타사 플랫폼 활용을 고려하고 있지만, 이미 10년 이상 개발해온 TPU의 노하우를 따라잡기는 쉽지 않습니다. 반대로 이야기하면 구글 입장에서는 앞선 TPU 설계와 이미 구축해 놓은 생태계가 이들과의 경쟁에서 매우 큰 무기인 셈입니다. 결국 TPU의 개발 목적은 엔비디아와의 직접적인 경쟁보다는, 자사 인프라에 최적화된 저비용·고효율 환경을 구축하여 AI 서비스 대중화 시대의 수익성을 선점하는 데 있습니다. 이러한 탄탄한 하드웨어 경쟁력과 기존의 방대한 서비스 플랫폼이 결합된 AI 생태계를 통해 구글이 최종적인 승자가 될 수 있을지 주목됩니다.
  • 루머만 무성한 인텔 차세대 프로세서 ‘노바 레이크’를 보는 4개의 관전 포인트 [고든 정의 TECH+]

    루머만 무성한 인텔 차세대 프로세서 ‘노바 레이크’를 보는 4개의 관전 포인트 [고든 정의 TECH+]

    “2026년 말 출시 예정인 차세대 노바 레이크와 함께 최고의 성능과 비용 최적화 솔루션을 결합한 고객 로드맵을 확보했습니다. 이를 통해 향후 몇 년간 노트북과 데스크톱 양측 모두에서 시장 점유율과 수익성을 강화할 수 있을 것이라 확신합니다.” 올해 초, 립부 탄 인텔 최고경영자(CEO)는 연말을 목표로 데스크톱과 노트북 시장을 겨냥한 차세대 중앙처리장치(CPU) ‘노바 레이크’(Nova Lake)의 출시 계획을 밝혔습니다. 하지만 지금까지 노바 레이크에 대한 구체적인 정보는 공개되지 않고 있습니다. 현재까지 확인된 마지막 공식 정보는 지난해 11월 발표된 인텔 ISA(Instruction Set Architecture) 프로그래밍 레퍼런스 문서(60th Edition)다. 해당 문서에서는 노바 레이크에서 AVX10.1, AVX10.2 및 APX 지원이 명확히 명시됐습니다. 참고로 AVX10(Advanced Vector Extensions 10)은 인텔이 기존 AVX-512의 단점을 극복하기 위해 설계한 통합 벡터 명령어 세트입니다. 기존 AVX-512는 P-코어(고성능 코어)에서는 512비트를 지원했으나 E-코어(효율 코어)에서는 기능이 제한돼 하이브리드 CPU 구조에서 소프트웨어 호환성 문제가 발생하곤 했습니다. 노바 레이크부터는 128/256/512비트 벡터 길이를 하나의 프레임워크로 통합해 P-코어와 E-코어 모두에서 동일한 명령어 동작을 보장합니다. 또 다른 주요 변화는 APX(Advanced Performance Extensions)입니다. 이는 벡터 연산이 아닌 스칼라 및 일반 연산의 성능 강화를 목표로 하는 확장 규격으로, 2023년 처음 발표된 이후 노바 레이크를 통해 소비자용 CPU에는 최초로 도입됩니다. APX는 전력 효율과 코드 밀도 개선으로 이어져 게임이나 브라우저 같은 일상적인 작업부터 서버급 고성능 작업까지 전 영역의 효율성을 끌어올릴 것으로 기대됩니다. 다만 이 외의 세부 사항은 여전히 불투명한 가운데 온갖 루머가 양산되고 있습니다. 실제 어떤 모습으로 나올지는 곧 알게 되겠지만 여기서 흥미로운 관전 포인트를 몇 개 짚어 보겠습니다. ●파운드리: 인텔 vs TSMC 인텔은 팬서 레이크(Panther Lake)에 18A 공정을 도입하며 인텔 파운드리의 최신 미세 공정에 대한 의구심을 어느 정도 해소했습니다. 하지만 현재 데스크톱 프로세서는 여전히 TSMC 공정에 의존하고 있어 자체 파운드리 사업 강화를 천명한 인텔의 전략과는 상충되는 모습을 보입니다. 인텔이 자사 공정 사용을 권유해야 하는 입장에서 타사(TSMC) 공정을 사용하는 것은 대외적인 명분 면에서 곤혹스러운 상황이기 때문입니다. 따라서 노바 레이크에는 18A 혹은 그 이후의 차세대 공정이 도입되는 것이 가장 이상적입니다. 그러나 아직 18A의 수율과 생산량이 충분치 않아 TSMC의 N2P 공정을 채택할 것이라는 루머가 끊이지 않고 있습니다. 만약 이번에도 TSMC 공정을 사용한다면 인텔 파운드리의 지속 가능성에 대한 의구심은 다시 수면 위로 떠오를 것입니다. ●코어 숫자: 52코어 시대의 도래? 인텔은 과거 하이퍼스레딩 기술을 통해 코어당 두 개의 스레드를 구현했으나 이후 코어 숫자를 늘리면서 다시 싱글 스레드로 회귀했습니다. 물리적 코어 숫자를 24코어까지 확장하며 스레드 부족 문제는 해결했지만 최대 16코어 32스레드를 지원하는 AMD 라이젠과 비교해 논리 코어의 숫자가 작다는 약점을 안고 있습니다. 이 약점은 만약 AMD가 코어 숫자까지 늘리면 더 커질 수 있습니다. AMD 역시 올해 말에서 내년 출시될 차세대 라이젠에서 24코어 48스레드를 지원한다는 루머가 돌고 있습니다. 이것이 사실이라면 인텔 역시 코어 수를 대폭 늘릴 가능성이 높습니다. 특히 루머 가운데는 52코어에 달하는 프로세서가 나올 수 있다는 이야기도 있습니다. 다만 이는 사실상 서버급 프로세서에 가까운 수준으로 막대한 전력 소모와 발열 문제를 고려할 때 다소 회의적인 의견도 존재합니다. 다음 세대에는 인텔과 AMD 모두 코어 숫자를 늘릴 가능성이 높아 얼마나 숫자가 늘어날지 이목이 집중되고 있습니다. ●가격: 얼마나 올릴까? 인텔은 최근 애로우 레이크 리프레시(코어 울트라 270K/250K 플러스)를 통해 매우 공격적인 가격 정책을 선보였습니다. 24코어 제품을 299달러, 18코어를 199달러 수준으로 책정했는데 이는 코어당 단가가 약 10달러 초반에 불과한 파격적인 수치입니다. 최신 미세 공정이 적용된 복잡한 프로세서의 생산 원가를 고려하면 손익 분기점은 넘을 수 있는지 의구심이 드는 수준입니다. 인텔 역시 계속 손해 보고 장사할 수 없는 만큼 차세대 제품에서는 제값을 찾으려 할 가능성이 높습니다. 다만 이미 저가형 24코어 제품군이 시장에 각인된 상황에서 급격한 가격 인상은 구형 모델 선호 현상을 초래할 수 있습니다. 이로 인해 코어 수를 대폭 늘려 가격 상승에 따른 반발을 줄이려 한다는 루머가 힘을 얻고 있는 것으로 보입니다. ●코파일럿: 이번에 데스크톱으로 올까? 애로우 레이크는 AI 연산을 위한 NPU를 탑재했으나 13 TOPS라는 낮은 성능 탓에 실질적인 활용도가 떨어진다는 평가를 받습니다. 반면 팬서 레이크는 최대 50 TOPS 성능을 갖춘 5세대 NPU를 탑재해 윈도우 코파일럿(Copilot) 기능을 원활히 수행할 수 있게 설계됐습니다. 데스크톱 환경에서도 노트북과 동일한 수준의 AI 경험을 제공하려면 NPU 성능 개선은 필수적입니다. 최근 루머에 따르면 노바 레이크에는 최대 74 TOPS에 달하는 강력한 NPU가 탑재될 예정입니다. 인텔 프로세서 라인업이 노트북과 데스크톱으로 재통합된다는 점을 고려하면 노트북은 물론 데스크톱에서도 동일하게 AI PC로 활용할 수 있을 가능성이 높습니다. 이렇게 파운드리, 코어 수, 가격, 코파일럿까지 4가지 관전 포인트를 짚어 봤지만 사실 노바 레이크에 대한 대부분의 정보는 아직 추측과 루머 단계에 머물러 있습니다. 확실한 것은 노트북과 데스크톱 시장을 아우르는 통합 프로세서를 목표로 2026년 말 출시를 향해 나아가고 있다는 점입니다. 출시 시점을 감안하면 오는 6월 대만 컴퓨텍스(Computex)가 정보를 공개하고 소비자들의 이목을 집중시킬 수 있는 가장 좋은 기회다. 이때 자세한 정보가 공개될 수 있을지 주목됩니다.
  • SKT·Arm·리벨리온, ‘AI 동맹’ 결성…“추론 최적화 데이터센터 잡는다”

    SKT·Arm·리벨리온, ‘AI 동맹’ 결성…“추론 최적화 데이터센터 잡는다”

    ‘전기 먹는 하마’ GPU 대신 NPU ‘관제탑 CPU-타격대 NPU’ 원팀 구축 글로벌 ‘소버린 AI’ 시장 정조준 SK텔레콤과 영국 반도체 설계회사 Arm, 국내 인공지능(AI) 반도체 선두주자 리벨리온이 차세대 AI 데이터센터(AIDC) 시장 선점을 위해 손을 맞잡았다. AI 산업의 무게중심이 대규모 학습에서 실제 서비스 단계인 ‘추론’으로 급격히 이동함에 따라, 저전력·고효율 인프라를 무기로 글로벌 시장을 공략하겠다는 포석이다. SK텔레콤과 Arm, 리벨리온 3사는 차세대 AI 인프라 혁신을 위한 전략적 파트너십(MOU)을 체결했다고 10일 밝혔다. 이번 협력의 핵심은 Arm의 데이터센터용 중앙처리장치(CPU)인 ‘Arm AGI CPU’와 리벨리온이 오는 3분기 출시 예정인 차세대 신경망처리장치(NPU) ‘리벨카드(RebelCard™)’를 하나의 서버에 통합하는 것이다. 그동안 AI 연산은 그래픽처리장치(GPU)가 주도해왔으나, 365일 24시간 가동되는 AI 추론 서비스 특성상 GPU의 막대한 전력 소모와 비용은 데이터센터 운영의 최대 걸림돌로 지목되어 왔다. 3사가 내놓은 해법은 ‘이종 컴퓨팅’(Heterogeneous Computing)이다. 시스템 운영과 데이터 관리를 총괄하는 ‘관제탑’ 역할의 CPU와, 실제 AI 추론 연산을 전담하는 ‘타격대’ 역할의 리벨리온 NPU를 결합해 효율을 극대화한다는 전략이다. 특히 리벨카드는 한국 최초로 서버급 고성능 AI 반도체인 ‘리벨100’을 탑재해 아시아 유일의 페타플롭스(PetaFLOPS)급 연산 능력을 갖췄다. 이번 연합은 단순히 기술 협력에 그치지 않고 데이터 주권 확보를 위한 독자 AI인 ‘소버린 AI’ 및 글로벌 통신사 특화 인프라 시장을 정조준한다. 국가나 기업이 독자적인 AI 인프라를 구축할 때, 성능과 가성비를 동시에 잡은 ‘검증된 패키지’를 공급해 표준을 선점하겠다는 구상이다. 이미 Arm과 리벨리온은 지난 3월 ‘Arm 에브리웨어’ 행사에서 양측의 칩을 결합해 오픈AI의 대규모 언어모델(GPT OSS 120B) 기반 에이전틱 AI 서비스를 실시간 시연하며 상용화 가능성을 입증한 바 있다. SK텔레콤은 이렇게 개발된 서버 설루션을 자사 AIDC에 도입해 실전 검증에 나선다. 특히 SKT가 독자 개발한 AI 파운데이션 모델 ‘에이닷엑스 케이원(A.X K1)’을 해당 인프라에서 직접 운영하며 안정성을 테스트할 계획이다. 이러한 협력 체계는 각 분야의 ‘정점’이 만나 하나의 완성된 설루션을 제안한다는 점에서 시장의 주목을 받고 있다. 오진욱 리벨리온 최고기술책임자(CTO)는 “압도적 성능과 전력 효율을 갖춘 리벨카드가 차세대 AIDC를 지탱하는 핵심 축이 될 것”이라며 “각 분야 전문가들이 ‘원팀’으로 뭉친 이번 사례는 업계에서도 유의미한 이정표”라고 자신감을 내비쳤다. Arm은 범용 인프라로서의 확장성을 강조했다. 에디 라미레즈 Arm 부사장은 “Arm 네오버스 기반 CPU는 대규모 AI 구축에 필수적인 성능을 갖췄다”며 “리벨리온, SKT와 함께 소버린 AI 및 통신 시장에서 실제 작동하는 확장성 있는 인프라를 실현할 것”이라고 말했다. 이재신 SK텔레콤 AI 사업개발 담당은 “추론 최적화 인프라에 독자 파운데이션 모델인 ‘A.X K1’을 얹은 ‘풀 패키지’를 제공할 것”이라며 “이를 통해 글로벌 AIDC 시장에서의 주도권을 확실히 쥐겠다”고 강조했다.
  • 쿠도커뮤니케이션, Black Duck과 ‘ICON 2026’ 성료… ‘Polaris’ 기반 DevSecOps 보안 전략 제시

    쿠도커뮤니케이션, Black Duck과 ‘ICON 2026’ 성료… ‘Polaris’ 기반 DevSecOps 보안 전략 제시

    금융·공공·엔터프라이즈 고객 대상 통합 AppSec 전략 소개… 현장 관심 집중 ICT 전문기업 쿠도커뮤니케이션(대표 김용식)은 글로벌 애플리케이션 보안 기업 Black Duck과 함께 지난 4월 2일 열린 ‘ICON 2026’에 참가해 DevSecOps 환경에 최적화된 통합 애플리케이션 보안 플랫폼 ‘Polaris™ Platform’을 선보였다고 밝혔다. ‘ICON’은 메가존클라우드가 주최하는 기술 컨퍼런스로, 글로벌 파트너 네트워크를 기반으로 AI, 클라우드, 보안 기술을 한자리에서 소개하는 국내 대표 행사다. 이번 행사에는 다양한 글로벌 파트너가 참여했으며 보안 분야에서는 Black Duck이 주요 기술 기업으로 참여해 최신 애플리케이션 보안 전략을 공유했다. 쿠도커뮤니케이션은 행사 기간 Polaris Platform을 중심으로 DevSecOps 환경에서 요구되는 통합 애플리케이션 보안 전략을 소개했으며, 금융·공공·엔터프라이즈 고객들의 높은 관심을 받았다. 특히 개발 단계에서 보안을 내재화하는 ‘Shift Left’ 접근 방식과 소프트웨어 공급망 보안 대응 전략에 대한 문의가 이어졌다. Polaris Platform은 SaaS 기반 통합 AppSec 플랫폼으로 SAST, SCA, Fuzzing 등 개별적으로 운영되던 보안 기능을 하나의 대시보드에서 통합 관리할 수 있는 것이 특징이다. 이를 통해 개발과 보안 간 충돌을 최소화하고 실제 공격 가능성과 비즈니스 영향도를 기준으로 위험을 우선순위화할 수 있다. 또한 ▲핵심 리스크 중심의 우선순위화 및 노이즈 감소 ▲정책 기반 중앙 집중형 거버넌스 및 컴플라이언스 관리 ▲AI 기반 보안 분석 및 자동화된 대응 기능 등을 통해 SDLC(소프트웨어 개발 생명주기) 전반에 걸쳐 일관된 보안 체계를 지원한다. 쿠도커뮤니케이션은 이번 전시를 통해 DevSecOps 기반 통합 보안 전략을 제시하고 실제 서비스 운영 환경에서 발생하는 보안 및 거버넌스 이슈에 대한 대응 방안을 공유하며 고객 접점을 확대했다. 김철봉 쿠도커뮤니케이션 정보보안 사업부장(부사장)은 “소프트웨어 공급망 보안과 DevSecOps는 기업 경쟁력을 좌우하는 핵심 요소”라며 “Black Duck과의 협력을 통해 국내 기업들이 개발 속도를 유지하면서도 글로벌 수준의 보안 체계를 구축할 수 있도록 지원하겠다”고 밝혔다.
위로