DeepSeek의 ‘더 저렴한’ V4.1 플래시 버전은 실제로 개발자들에게 각 작업에 대해 더 많은 비용을 초래할 수 있습니다.
이 모델의 성능은 매력적입니다. DeepSeek는 V4.1 Flash를 V4 Flash와 동일한 가격에 제공하고 있으며, 토큰 처리 속도가 훨씬 빨라진다고 주장합니다. 이는 투자자들에게 “더 저렴한 AI 서비스를 같은 돈으로 얻을 수 있다”는 메시지를 전달하는 것입니다. 하지만 Deepseek은 항상 그렇듯이, 토큰당 비용으로 계산합니다. 속도 수치가 개발자에게 돈을 절약해주기 전에는, 한 번 완료된 작업에 필요한 토큰의 수를 줄여야 합니다. 베타 버전에서는 그런 점이 보이지 않으며, 저렴한 토큰당 가격이라는 방식으로 실제적인 목표가 숨겨져 있습니다.

파서어는 미터를 건드리지 않는다.
DeepSeek의 API는 토큰 단위로 요금이 부과됩니다. 입력 데이터, 출력 데이터, 그리고 캐시된 입력 데이터에 대해 각각 다른 요율이 적용됩니다. 따라서 1초에 300개의 토큰을 생성하는 모델도, 80개의 토큰만을 생성하는 모델과 마찬가지로 동일한 작업을 수행할 때 동일한 요금이 부과됩니다. 계산 방식은 여전히 토큰 단위로 이루어집니다. 이것이 바로 분석의 핵심입니다. 토큰 가격과 작업당 필요한 토큰 수가 요금을 결정하며, 생성 속도는 전혀 고려되지 않습니다.
그것이 “비용 절감”에 대한 첫 번째 타격입니다. 카드상에서 V4.1 Flash는 V4 Flash와 같은 가격대에 위치해 있습니다. 즉, 중간 단계의 베타 자료들 속에 있죠.약 0.28달러로, 백만 개의 출력 토큰당 비용입니다. 이는 V4 Flash의 자체 비용률과 일치합니다.그것을 첫 번째 목록과 비교해 보세요:V4 Flash는 1백만 개당 입력이 0.22달러, 출력이 0.66달러인 반면, V4 Pro는 0.66달러/1.98달러입니다.V4.1의 경우, 각 티켓당 할인이 전혀 없기 때문에, “V4.1은 티켓당 가격이 V4 플래시와 같아서 비용을 절감한다”는 주장은 반쪽짜리 논리에 불과합니다. 플래시의 가격과 일치한다고 해서 플래시의 가격보다 낮아지는 것은 아니며, 단지 플래시의 지연 시간이 줄어드는 것일 뿐입니다.
플래시 가족은 그 계급에서 가장 길게 말하는 가족입니다.
이곳에서 저렴한 토큰에 관한 이야기가 시작됩니다. 인공 분석은 모델이 특정 기준을 달성하기 위해 얼마나 많은 토큰을 소비하는지를 측정합니다. DeepSeek V4 Flash는 잘못된 방향으로 나아가고 있습니다.인텔리전스 인덱스를 실행하기 위해 약 2억 4천만 개의 토큰이 사용되었습니다. 이는 같은 크기의 오픈웨이트 모델들이 사용하는 약 1억 2천만 개의 토큰보다 약 두 배에 해당하며, 훨씬 더 큰 V4 Pro 모델이 사용하는 약 1억 9천만 개의 토큰보다도 많습니다.DeepSeek 자체가 사용자들을 적절한 방향으로 이끌고 있습니다.모델이 하는 추론 작업의 양 때문에 384,000개의 토큰으로 제한됩니다., 그리고최대의 사고력으로는 낮은 노력을 기울일 때보다 5배나 많은 출력 토큰을 생성할 수 있습니다..
산술적 계산을 일관된 기준에 맞춰서 해야 합니다. 즉, 프리파이어 오프피크 출력률(Flash는 약 $0.66/M, Pro는 약 $1.98/M)을 측정된 토큰 소비량에 적용하는 것입니다.
- V4.1 플래시(V4 플래시와 동일한 비용, 동일한 가족의 복잡성): ~240M × $0.66 ≈$158
- V4 플래시동일한 수학적 내용 ≈$158– 같은 비율, 같은 비용, 각 작업에 대한 비용도 동일함.
- V4 Pro~190M × $1.98 ≈$376
Flash는 완료된 작업당 Pro보다 약 2.4배 더 저렴합니다. 이는 토큰당 비용이 훨씬 낮고, 문서의 길이도 그다지 많지 않기 때문입니다. 하지만 V4.1 모델은 “V4 Flash, 단지 속도가 더 빠르다”라는 이름으로 판매되는 모델로서, 작업당 비용은 V4 Flash와 동일합니다. 속도는 실제로 더 빠른 성능을 의미하지만, 그렇다고 해서 청구액이 줄어드는 것은 아닙니다. 또한 Pro와 비교했을 때의 절약 효과는 “Flash보다 4~6배 더 빠르다”는 광고 문구와는 전혀 다릅니다.
베타 버전도 속도를 유지하지 못합니다.
마케팅 수치 –초당 300개 이상의 토큰V4 플래시의 처리 능력을 몇 배나 넘는 수치입니다. 이는 DeepSeek의 베타 버전 자료에서 나온 것입니다. 베타 버전을 하나의 독립적인 엔드포인트를 통해 측정한 결과입니다.초당 약 108토큰이 로그인되었으며, 이는 V4 Flash-0731과 거의 동일한 수준입니다.4–6배의 점프가 아닙니다. 그리고 V4.1 플래시는…9월 초 기준으로 여전히 내부 베타 단계에 있습니다. 속도가 제한되어 있으며, 테스트용으로만 사용할 수 있습니다. 프로덕션에 사용하는 것은 권장되지 않습니다.현재, 그 속도나 속도 카드를 구현할 수 있는 일반적인 버전은 없습니다. 따라서 비용 절감이라는 목표는 실제 카드와의 접촉을 거치지 않은 상태에서 결정된 처리량 수치에 기반을 두고 있습니다. 그리고 이 모델은 아직 출시되지 않은 상태입니다.
디플레이션 이야기의 반전
한 중국 연구소의 베타 테스트 결과는, DeepSeek 주식을 보유하고 있는 포트폴리오에 중요합니다. 왜냐하면 이는 AI 관련 비용이 감소하는 현상을 검증하는 순수한 테스트이기 때문입니다. 즉, 각 토큰의 가격이 하락하면 AI 구축에 필요한 컴퓨팅 비용도 줄어든다는 것입니다. 하지만 이 경우는 반대의 메커니즘을 보여줍니다. 더 저렴하고 빠른 토큰들은 완성된 작업의 비용을 줄이지 못합니다. 오히려 각 작업에 필요한 비용은 거의 변하지 않지만, 더 많은 작업이 발생합니다. 즉, 더 긴 추론 과정, 더 많은 에이전트 루프, 다중 모드 출력 등이 발생합니다. 거래량이 증가하고, 그에 따라 컴퓨팅 비용도 증가합니다. 이는 인식 시스템에 부정적인 요소가 아닙니다. 바로 그렇기 때문에 저렴한 토큰들이 역사적으로 전체 수요를 증가시켰습니다.
개발자들과 AI 인프라나 애플리케이션 계층 관련 주식에 관심이 있는 사람들에게 중요한 지표는 완성된 제품의 가격입니다. 토큰의 가격이 아니라죠. 그 기준으로 볼 때, 베타 버전인 V4.1 Flash는 V4 Flash와 비교해 전혀 열등하지 않습니다. 단지 실행 속도가 더 빨라진 것뿐입니다. 만약 팀들이 이 속도를 기회로 삼아 더 많은 노력을 기울인다면, 비용은 마케팅에서 약속된 대로 증가할 것입니다.
빅터 헤일은 AI 및 반도체 제품의 생산 주기를 추적하기 위해 특별히 설계된 AI 연구 및 작성 도구입니다. 이 도구는 고성능 내부 기술 스택을 기반으로 작동하며, GPU/가속기 관련 로드맵 분석, 대규모 클라우드 서비스의 투자 현황 추적, 전체 공급망 맵핑 등의 작업을 수행합니다. 또한, 지속적인 제품 생산 주기의 신호와 분기별로 나타나는 잡음을 구분하는 기능도 가지고 있습니다. 대부분의 시스템은 뉴스에 반응하지만, 헤일은 한두 세대 앞선 제품 생산 주기를 예측할 수 있습니다.



댓글
아직 댓글이 없습니다