snow · 2026.8.15 06:07 · 조회 0
프랑스 스타트업 Kog, GPU 추론 속도 3000 토큰/초 돌파…"GPU는 에이전트 워크플로우에 최적"
프랑스 스타트업 Kog가 기존 데이터센터 GPU에서 더 많은 추론(inference) 성능을 뽑아내는 소프트웨어를 개발해 초당 3,000 토큰의 단일 요청 디코딩 속도를 달성했다. GPU가 에이전트 워크플로우에 적합하지 않다는 업계의 통념과 달리, Kog는 GPU 최적화만으로도 실시간에 가까운 AI 추론 성능을 끌어낼 수 있음을 보여주고 있다.
배경
Kog의 가엘 델랄로 CEO는 "GPU는 밝은 미래를 갖고 있다"고 강조하며, 최근 업계 일각에서 제기되는 'GPU는 에이전트형 AI 워크플로우에 근본적으로 부적합하다'는 주장에 반박한다. 이 회사는 지난 5월 해커뉴스 1위에 오른 기술 데모를 통해 AMD MI300X와 엔비디아 H200 같은 데이터센터급 GPU에서 초당 3,000 토큰의 단일 요청 디코딩 성능을 시연하며 주목받았다.
델랄로 CEO는 에콜 폴리테크닉에서 고체물리학을 전공하고 화이트해커로 활동하며 DEFCON 해킹 대회 결선에 네 차례 진출한 이력을 갖고 있다. 이러한 배경은 Kog의 기술 철학에도 영향을 미쳐, 팀원들에게 어셈블리어와 바이너리 코드 수준까지 GPU 동작 원리를 깊이 이해하는 접근을 강조하고 있다.
영향
Kog에 따르면 5월 기술 데모 이후 약 200건의 실질적인 사업 문의를 받았다. 초기 피드백에서 가장 두드러진 활용 사례는 소프트웨어 엔지니어링 분야로, 특히 Claude Code와 같은 AI 코딩 도구 사용자들이 겪는 지연 시간 문제를 해결하는 것이 Kog의 주요 타깃이다. 또한 프롬프트 기반으로 게임과 앱을 생성하는 설계 파트너사들과도 협업하고 있다.
GPU 추론 최적화 기술이 실제로 상용 서비스 수준의 응답 속도를 크게 끌어올릴 수 있다는 점이 확인되면서, AI 에이전트나 코딩 어시스턴트처럼 빠른 응답 속도가 사용자 경험을 좌우하는 서비스들에 직접적인 영향을 미칠 것으로 보인다. 이는 새로운 전용 하드웨어 없이도 기존 GPU 인프라의 활용도를 극대화할 수 있는 방안으로 주목받고 있다.
향후 전망
다만 Kog는 11명 규모의 소규모 팀으로 운영되고 있어, 새로운 GPU 아키텍처마다 최적화에 수 주에서 수개월이 걸리는 개발 주기의 한계도 안고 있다. 회사는 Varsity VC가 주도한 시드 투자를 유치했으며, 스케일웨이(Scaleway)의 지원과 프랑스 정부 산하 Bpifrance, French Tech 2030 프로그램의 지원도 받고 있다. 델랄로 CEO는 오는 9월 첫 대규모 모델에서 10배의 속도 개선을 달성한 뒤 시리즈 A 투자 유치에 나설 계획이라고 밝혔다.
자주 묻는 질문
Q. Kog가 개발한 기술은 정확히 무엇을 하나요? A. 별도의 전용 하드웨어 없이 기존 데이터센터 GPU에서 AI 모델의 추론 속도를 극대화하는 소프트웨어 최적화 기술로, AMD MI300X와 엔비디아 H200에서 초당 3,000 토큰의 단일 요청 디코딩을 달성했습니다.
Q. GPU가 AI 에이전트 워크플로우에 부적합하다는 통념은 사실인가요? A. Kog는 이를 오해라고 주장합니다. 소프트웨어 수준에서 GPU를 깊이 최적화하면 에이전트형 워크플로우에서도 충분히 빠른 응답 속도를 낼 수 있다는 것을 자체 데모로 입증했습니다.
Q. Kog는 어떤 투자를 받았나요? A. Varsity VC가 주도한 시드 라운드를 유치했으며, 클라우드 기업 스케일웨이와 프랑스 정부 지원 프로그램인 Bpifrance, French Tech 2030의 지원도 받고 있습니다. 9월 추가 성과를 바탕으로 시리즈 A를 추진할 계획입니다.
출처 - https://techcrunch.com/2026/08/14/kog-is-going-deeper-to-squeeze-more-inference-out-of-gpus/
댓글
아직 댓글이 없습니다.
댓글을 작성하려면 로그인이 필요합니다.