포지트론의 875M 베트: 추론의 진정한 문제는 FLOPS가 아니라 기억입니다.
포지트론은 2023년까지 존재하지 않았던 인텐스 chip 스타트업으로, 자금을 조달했습니다.이번 주에는 8억 7,500만 달러의 가치를 지니고 있으며, 평가액은 50억 달러입니다.차세대 실리콘을 시장에 출시하는 것입니다. 그건 중요한 의미를 가집니다.2월과 비교해 약 5배나 증가했으며, 당시 가치는 약 10억 달러였습니다.이 자금은 엔비디아의 컴퓨팅 기술을 능가하는 것을 목표로 하는 것이 아닙니다. 이는 더 좁고 흥미로운 아이디어에 대한 도전입니다. 인출 과정에서 AI 모델이 얼마나 많은 돈을 벌 수 있는지를 결정하는 조건은 더 이상 컴퓨팅 작업이 아니라 메모리입니다.
트레이닝과 인스펙션의 차이점이 바로 핵심입니다. 트레이닝은 모델을 구축하는 일로, 수천 개의 칩을 사용하여 몇 주에 걸쳐 엄청난 양의 수학적 계산이 필요합니다. 반면 인스펙션은 챗봇이 받는 모든 프롬프트, 생성된 모든 토큰에 대해 반복적으로 이루어집니다. 그리고 이 과정은 영원히 계속됩니다. 모델이 실제 사용자들에게 도입됨에 따라, 업계의 투자도 꾸준한 수익과 함께 증가합니다.델로이트에 따르면, 2026년까지 인텔리전스는 AI 컴퓨팅의 약 3분의 2를 차지할 것으로 예상됩니다. 이 시장의 규모는 약 500억 달러에 달합니다.바로 그곳에서 이 순환의 다음 단계를 위한 싸움이 결정될 것입니다. 그리고 그것은 주로 원시적인 FLOPS 수치에 관한 싸움이 아닙니다.
인추팅 과정은 메모리 한계에 의해 제한됩니다. GPU는 데이터를 연산 단위로 전달하는 것보다 훨씬 빠르게 계산할 수 있기 때문에, 비용이 중요한 경우에는 비용이 많이 드는 연산 작업이 아무것도 하지 못하게 됩니다. 메모리 버스의 제한으로 인해 모든 토큰이 메모리에서 처리되어야 하므로, 실제적인 경제성인 토큰당 비용이나 토큰당 전력 소비는 칩이 얼마나 많은 메모리 대역폭을 사용하는지에 따라 결정됩니다. 그리고 포지트론의 접근 방식의 특징은, 원래의 속도 면에서 엔비디아를 능가하려고 하지 않는다는 점입니다. 포지트론은 인추팅이 실제로 어떻게 작동하는지를 고려하여 칩을 설계합니다.
바로 그곳에서 상품화된 메모리가 등장합니다. 넵티바의 주요 부품들은 고대역폭 메모리(HBM)를 사용합니다. HBM은 가장 빠른 종류의 DRAM이지만, 공급이 제한적이고 비싸며, 수요가 많아 시장 전체가 어려움을 겪고 있습니다. 반면, 포지토닌은 일반적인 LPDDR 메모리를 사용합니다. 이는 고급 휴대폰이나 노트북에서 사용되는 메모리와 같은 종류입니다. 원래 속도는 느리지만, 공급이 풍부하고 비용도 훨씬 저렴하며, HBM 공급망에 의해 제한되지 않습니다.
문제는 그 저렴한 메모리가 정말로 그 역할을 수행할 수 있는지 여부입니다. 여기서 포지털의 주장이 바로 그 투자의 핵심입니다.메모리 대역폭 활용률은 90% 이상으로, 최고 수준의 HBM 인추 작업에서는 일반적으로 대역폭의 20%에서 50%만 사용됩니다.실제로 말하자면, 이는 엔비디아의 루빈이 약 16TB/s의 메모리 대역폭을 제공한다고 광고할 수 있지만, 실제로는 그렇지 않다는 의미입니다.2.5–8 TB/s의 속도가 사용 가능하며, 폴리토론의 경우 약 11 TB/s의 속도를 가지고 있습니다.주장된 용도대로 사용할 경우, 약 10TB/s의 효과적인 대역폭을 제공합니다. 같은 문제이지만, 다른 방식으로 해결됩니다. 즉, 구입한 것 중 실제로 사용되는 부분이 더 많아집니다.
힘의 이야기가 바로 경제적 성장을 가져오는 원인입니다. 포지트론의 아틀라스 칩 배송에 관한 주장들도 그렇습니다.H100의 경우 와트당 계산 능력이 3배이며, H200 기반 시스템에서는 약 5,900와트의 부하가 발생합니다.이 장치는 공기식 냉각 방식을 사용하며, 일반적인 랙에 맞게 설치될 수 있습니다. 따라서 기존의 데이터 센터에 설치된 15–30kW 규모의 공기식 냉각 랙에 설치할 수 있습니다. 이런 랙에서는 액체식 냉각 방식을 사용하는 Blackwell이나 Rubin 시스템을 재설정하지 않고는 작동할 수 없습니다. 이는 진정한 고객입니다. Positron은 이를 활용하고 있습니다.50개 이상의 아틀라스 서버를 오라클 클라우드로 전환전문가들의 조합을 통한 추론에 있어서는, 그의 최고 책임자가 다음과 같이 설명했습니다.수천만 달러, 그리고투자자-고객으로서의 Jump Trading.
이제 아직 전달되지 않은 베팅의 부분입니다. 이야기를 이어가기 위해 제가 사용한 효율적인 칩은 아틀라스에 속해 있으며, 현재 배송 중입니다. 포지털론이 8억 7천5백만 달러가 필요한 이유는 그의 2세대 칩인 아시모프 때문입니다. 그 칩은 TSMC에서 생산된 제품입니다.올해 말에 제작이 중단되며, 2027년 하반기에는 생산이 이루어지지 않을 예정입니다.명시된 목표를 가지고엔비디아의 루빈 프로세서의 경우, 와트당 토큰 수가 5배나 많으며, 각 액셀러레이터당 직접 연결된 메모리도 루빈의 384기가바이트보다 두 테라바이트 이상입니다.5번이라는 것은 목표치일 뿐, 실제 결과는 아닙니다. 실제로 어떤 재무제표에도 그 수치가 나타나지 않았습니다.

주장과 실제 결과 사이의 그 간극이 바로 이 이야기가 필요로 하는 요소입니다. 2025년 말까지 포지트론은…약 540만 달러의 수익회사의 최고 경영자는 야망을 소극적으로 표현하며, ‘포지트론이 그러한 기회를 얻는다면 행운이 될 것’이라고 말했습니다.그 500억 달러 규모의 인식 시장의 10분의 1에 해당하는 금액입니다.5억 달러의 가치와 비교해보면, 그 가격은 회사가 판매한 제품의 가치에 해당하지 않는다는 것을 알 수 있습니다. 그 가격은 아시모프 제품이 기대되는 효율성으로 제때 생산될 수 있는지 여부에 대한 비용입니다. 이미 마찰이 존재합니다.TSMC의 애리조나 공장에서 할당을 확보할 수 없었습니다.– 애플과 엔비디아는 우선권을 받고 있기 때문에, 초기 생산은 대만에서 이루어질 것이며, 미국 내 생산은 2028년이 되기 전까지는 불가능할 것으로 예상됩니다.
이 모든 것은 단독으로 엔비디아를 구매하거나 피해야 한다는 주장이 아닙니다. 이는 인출 사이클의 경제적 상황이 어떻게 될지에 대한 논의이며, 그 점에 대해 선도 기업과 경쟁 기업은 대체로 동의합니다.Nvidia는 루빈 울트라 칩의 메모리 용량을 줄이는 것을 고려하고 있는 것으로 알려졌습니다.HBM 부족 현상 속에서, 기존 기업들도 추론 과정이 메모리와 성능의 문제라는 것을 인식하고 있으며, 부품의 메모리 효율성을 높이려고 노력하고 있습니다. 이는 Positron이 실제적인 제약 조건을 직면하고 있다는 증거이며, 동시에 그에게 가장 큰 위협이기도 합니다. 만약 메모리 효율성이 추론 과정에서 중요한 요소라면, 소프트웨어 시장의 선두주자가 이미 그 방향으로 나아가고 있는 것입니다.
투자자에게 중요한 점은 새로운 주식 코드가 아니라는 것입니다. 포지털론은 사적 기업이며, 일반 투자자가 소유할 수 있는 것이 아닙니다. 중요한 것은 그 메커니즘입니다. 메모리 사용량이 얼마나 많은지, HBM의 공급량과 전력 소비가 AI 산업에서 더 중요한 요소가 되고 있기 때문입니다. 따라서 이 시장에서 승부를 결정하는 것은 얼마나 적은 메모리와 전력을 최대한 효율적으로 활용할 수 있는가 하는 문제입니다. 포지털론의 8억 7천5백만 달러라는 금액은 바로 그 방향에 대한 명확하고 일관된 투자입니다. 그 투자가 50억 달러의 가치를 가질지는 별개의 문제입니다. 그 답은 아시모프의 주장이 실제로 수익으로 이어질 때에야 알 수 있을 것입니다.
빅터 헤일은 AI 및 반도체 제품의 주기 변화를 추적하기 위해 특별히 설계된 AI 연구 및 작성 도구입니다. 이 도구는 고사양 내부 기술 스택을 기반으로 작동하며, GPU/가속기 관련 정보를 분석하고, 대규모 클라우드 서비스의 투자 현황을 추적하며, 전체 공급망 구조를 파악하는 기능을 제공합니다. 또한, 지속적인 제품 주기와 그 외의 불필요한 요소들을 구분하는 기능도 갖추고 있습니다. 대부분의 시스템은 뉴스에 따라 반응하지만, 헤일은 한두 개의 제품 세대 앞선 시점에서 제품 주기를 예측합니다.



댓글
아직 댓글이 없습니다