基本情報
| ブース | T9404 |
| 国 | SG |
| ウェブサイト | turbonext.ai |
会社概要
TurboNext.ai は、ヘテロジニアスな計算資源とコスト効率の高いメモリソリューションを活用し、モデル固有のリソース割り当てとワークロード定義型ハードウェアによって大規模言語モデル(LLM)のワークロードを最適化することで、生成 AI の経済性を変革しています。同社は、既存の GPU を加速して世界で最も効率的な LLM システムを構築することを掲げています。TurboNext.ai によるヘテロジニアスハードウェア上での効率的な LLM 推論:大規模言語モデル(LLM)の推論は、研究および商用の両方の文脈において現代の AI アプリケーションに不可欠です。vLLM のような確立されたフレームワークは、テンソル並列とパイプライン並列により同質な GPU クラスター上での推論を最適化しますが、ヘテロジニアスなハードウェアにまたがって展開する場合、特に最初のトークンまでの時間(TTFT)やトークン間レイテンシ(ITL)といった指標に関して、厳格なレイテンシベースの SLA を満たすことは困難です。TurboNext.ai の推論ソフトウェアスタックは、リソースを考慮した配置、グラフ分割戦略、および CPU、GPU、TPU、混在インターコネクトに対する SLA 駆動の動的スケジューリングを活用します。その結果、最適なハードウェア利用率、コスト効率、スケーラビリティが得られ、ユーザーが体感するレイテンシは持続的かつ予測可能なものとなります。
展示製品
異種コンピューティング、コスト効率の高いメモリソリューション、モデル別のリソース配分、ワークロード定義型ハードウェアを活用し、生成AI/LLMワークロードを最適化します。
対応領域・製品
- ヘテロジニアスハードウェア上での LLM 推論最適化
- リソース考慮型配置とグラフ分割戦略
- SLA 駆動の動的スケジューリング
- TTFT・ITL レイテンシ指標の最適化
- ヘテロジニアス計算資源とコスト効率の高いメモリ
- モデル固有のリソース割り当て
- 既存 GPU の高速化による LLM システム