Skip to main content
vLLM 是一个快速易用的 LLM 推理和服务库,专为高吞吐量和内存高效的 LLM 服务设计。

先决条件

安装 vLLM 并开始服务模型:
install vLLM
start vLLM server
这将启动一个具有 OpenAI 兼容 API 的 vLLM 服务器。
默认的 vLLM 服务器 URL 是 http://localhost:8000/

示例

基本 Agent

高级用法

使用工具

vLLM 模型可与 Agno 工具无缝协同工作:
with_tools.py
在此处查看更多示例:here
支持模型的完整列表,请参阅 vLLM 文档

参数

vLLM 还支持 OpenAI 的参数。
vLLMModel 类的子类,可以访问相同的参数。