基本資料
| 攤位 | T9404 |
| 國別 | SG |
| 網站 | turbonext.ai |
公司簡介
TurboNext.ai 透過運用異質運算資源與高性價比的記憶體方案,並以針對特定模型的資源配置與由工作負載定義的硬體來最佳化大型語言模型(LLM)的工作負載,正在改變生成式 AI 的成本結構。公司的定位是為你既有的 GPU 加速,打造全世界最有效率的 LLM 系統。以 TurboNext.ai 在異質硬體上進行高效 LLM 推論:大型語言模型(LLM)推論對於研究與商業情境中的現代 AI 應用都至關重要。雖然 vLLM 等既有框架透過張量平行與管線平行最佳化同質 GPU 叢集上的推論,但在跨異質硬體部署時,嚴格的延遲型服務水準協議(SLA)難以滿足,尤其是首字回應時間(TTFT)與字元間延遲(ITL)等指標。TurboNext.ai 的推論軟體堆疊運用資源感知的配置、圖分割策略,以及針對 CPU、GPU、TPU 與混合互連的 SLA 驅動動態排程。成果是最佳的硬體使用率、成本效率與可擴充性,並維持穩定且可預期的使用者端延遲。
展出產品
提供生成式 AI/LLM 工作負載最佳化能力,運用異質運算、具成本效益的記憶體方案、依模型配置資源,以及依工作負載定義硬體。
能力與產品項目
- 異質硬體上的 LLM 推論最佳化
- 資源感知配置與圖分割排程
- SLA 驅動動態排程
- TTFT 與 ITL 延遲指標最佳化
- 異質運算與記憶體成本最佳化
- 模型專屬資源配置
- 既有 GPU 效能提升方案