















一、LangChain
LangChain 是一个用于构建基于大型语言模型(LLM)应用程序的开源框架,旨在帮助开发者将语言模型与其他数据源、工具和计算资源结合,创建更复杂且实用的应用。
.
二、LLAMA Factory
LLAMA Factory 是一个基于 Hugging Face Transformers 的开源项目,专注于为大型语言模型(Large Language Models, LLMs)提供高效、灵活且用户友好的微调(Fine-tuning)框架。它旨在简化模型训练流程,支持多种模型架构(如 LLaMA、BART、T5 等)和训练任务(如文本生成、对话系统、指令遵循等),同时优化资源利用效率,适合研究者和开发者快速实验和部署。
?三、Dify
Dify是一个开源的大语言模型应用开发平台,支持GPT、Mistral、Llama3等数百种模型。平台提供声明式开发环境(通过YAML定义应用)、模块化设计、LLMOps功能(监控和优化应用性能)以及私有化部署能力。其定位是简化复杂AI应用的开发流程,特别适合需要深度定制化或企业级部署的场景。
四、FasterTransformer
FasterTransformer 是 NVIDIA 推出的一个用于加速 Transformer 模型推理的库。该库主要通过使用 NVIDIA 的深度学习加速库 cuBLAS、cuDNN 和 TensorRT,以及深度学习框架 TensorFlow 和 PyTorch 的扩展,对 Transformer 模型进行优化和加速。
五、TensorRT
TensorRT是可以在NVIDIA各种GPU硬件平台下运行的一个C++推理框架。我们利用Pytorch、TF或者其他框架训练好的模型,可以转化为TensorRT的格式,然后利用TensorRT推理引擎去运行我们这个模型,从而提升这个模型在英伟达GPU上运行的速度。
六、Ollama
Ollama 是一个开源框架,专为在本地机器上便捷部署和运行大型语言模型(LLM)而设计。Ollama 是 Omni-Layer Learning Language Acquisition Model 的简写,这代表一种新颖的机器学习方法,承诺重新定义我们对语言习得和自然语言处理的看法。
.
七、VLLM
VLLM 是⼀个专⻔为 (LLM) 推理设计的开源加速框架,通过创新的内存管理和并⾏化技术,显著提⾼了推理速度和吞吐量。其中,PagedAttention是VLLM 的核⼼技术,专⻔⽤于解决 LLM 推理中的内存瓶颈问题,尤其是⾃回归⽣成任务中的键值 (KV) 缓存管理。
#大模型 #人工智能 #AI #多模态人工智能 #人工智能发展 #大模型应用 #人工智能发展 #LLM #AI大模型 #大语言模型
LangChain 是一个用于构建基于大型语言模型(LLM)应用程序的开源框架,旨在帮助开发者将语言模型与其他数据源、工具和计算资源结合,创建更复杂且实用的应用。
.
二、LLAMA Factory
LLAMA Factory 是一个基于 Hugging Face Transformers 的开源项目,专注于为大型语言模型(Large Language Models, LLMs)提供高效、灵活且用户友好的微调(Fine-tuning)框架。它旨在简化模型训练流程,支持多种模型架构(如 LLaMA、BART、T5 等)和训练任务(如文本生成、对话系统、指令遵循等),同时优化资源利用效率,适合研究者和开发者快速实验和部署。
?三、Dify
Dify是一个开源的大语言模型应用开发平台,支持GPT、Mistral、Llama3等数百种模型。平台提供声明式开发环境(通过YAML定义应用)、模块化设计、LLMOps功能(监控和优化应用性能)以及私有化部署能力。其定位是简化复杂AI应用的开发流程,特别适合需要深度定制化或企业级部署的场景。
四、FasterTransformer
FasterTransformer 是 NVIDIA 推出的一个用于加速 Transformer 模型推理的库。该库主要通过使用 NVIDIA 的深度学习加速库 cuBLAS、cuDNN 和 TensorRT,以及深度学习框架 TensorFlow 和 PyTorch 的扩展,对 Transformer 模型进行优化和加速。
五、TensorRT
TensorRT是可以在NVIDIA各种GPU硬件平台下运行的一个C++推理框架。我们利用Pytorch、TF或者其他框架训练好的模型,可以转化为TensorRT的格式,然后利用TensorRT推理引擎去运行我们这个模型,从而提升这个模型在英伟达GPU上运行的速度。
六、Ollama
Ollama 是一个开源框架,专为在本地机器上便捷部署和运行大型语言模型(LLM)而设计。Ollama 是 Omni-Layer Learning Language Acquisition Model 的简写,这代表一种新颖的机器学习方法,承诺重新定义我们对语言习得和自然语言处理的看法。
.
七、VLLM
VLLM 是⼀个专⻔为 (LLM) 推理设计的开源加速框架,通过创新的内存管理和并⾏化技术,显著提⾼了推理速度和吞吐量。其中,PagedAttention是VLLM 的核⼼技术,专⻔⽤于解决 LLM 推理中的内存瓶颈问题,尤其是⾃回归⽣成任务中的键值 (KV) 缓存管理。
#大模型 #人工智能 #AI #多模态人工智能 #人工智能发展 #大模型应用 #人工智能发展 #LLM #AI大模型 #大语言模型


