首页
学习
活动
专区
圈层
工具
发布
    • 综合排序
    • 最热优先
    • 最新优先
    时间不限
  • 来自专栏大模型应用

    模型应用:模型本地部署实战:从零构建可视化智能学习助手.2

    相比按使用量付费的云端API服务,本地部署只需一次性硬件投入。 topic: str) -> Dict: """学习示例生成方法""" # 实现结构化内容生成我们首先需要明确LocalLearningAssistant类的核心作用:它负责加载模型 with gr.Blocks(theme=gr.themes.Soft()) as demo: # 标题区域 gr.Markdown("# 模型本地部署 编程助手2. 科学助手3. 数学助手4. 学习助手五、总结 这个项目成功实现了在消费级硬件上部署智能学习助手,基于Qwen1.5-1.8B模型在CPU环境稳定运行。 with gr.Blocks(theme=gr.themes.Soft(), title="本地AI学习助手") as demo: gr.Markdown("# 模型本地部署

    71232编辑于 2026-01-30
  • 来自专栏机器学习与统计学

    纯离线安装模型推理引擎,部署量化模型

    大家好,我是 Ai 学习的老章 继续介绍模型推理引擎+Llama.cpp,前文我写了# 内网部署 llama.cpp,运行量化模型,详细介绍了 llama.cpp 这个推理引擎,内网离线 cmake 本文我们用个更省事儿的内网离线部署方式——Docker,然后用其部署量化模型,其中踩坑若干,才有如此精炼、极简教程 1、联网环境拉取 llama.cpp 镜像并保存 选择镜像最好是官方,比如 llama.cpp server-cuda https://github.com/ggml-org/llama.cpp/blob/master/docs/docker.md 市面上有很多个人打包的镜像,大多都是阉割版 费老大劲搞进去,发现模型无法加载 ggml-org/llama.cpp:server-cuda # 保存镜像到tar文件 docker save ghcr.io/ggml-org/llama.cpp > llama.cpp.tar 2、 5、启动模型 docker run --rm --runtime nvidia -e TZAsia/Shanghai --gpus "device=2" -v /opt/data/ai/GGUF:/models

    2.7K10编辑于 2025-10-11
  • 来自专栏开源项目搭建

    简单3步部署本地国产模型DeepSeek模型

    简单3步部署本地国产模型DeepSeek模型DeepSeek是最近非常火的开源模型,国产模型 DeepSeek 凭借其优异的性能和对硬件资源的友好性,受到了众多开发者的关注。 本文将介绍如何通过简单 3 步在本地部署 DeepSeek 模型,让你能够轻松体验这一强大的 AI 工具。 GeForce RTX 4070Ti可以运行模型deepseek-r1的哪个版本的模型? 提供了类似OpenAI的API接口和聊天界面,可以非常方便地部署最新版本的GPT模型并通过接口使用。支持热加载模型文件,无需重新启动即可切换不同的模型。 命令2:/show(在会话界面中使用)列出所有模型命令1:ollama list命令2:ollama ls功能:列出本地所有可用的模型,可以在这里查找模型名称。

    7.1K33编辑于 2025-02-06
  • 来自专栏小陈运维

    使用Ollama部署deepseek模型

    使用Ollama部署deepseek模型 前置条件 使用英伟达显卡下载cuda驱动 https://developer.nvidia.com/cuda-downloads Ollama Ollama 的安装方式去安装 若你的显卡是在Linux上面 可以使用如下命令安装 curl -fsSL https://ollama.com/install.sh | sh 当然Ollama不只是可以启动deepseek模型 ,也可以启动他的模型 https://ollama.com/search # 模型的安装命令 # 1.5B Qwen DeepSeek R1 # 所需空间大约 1.1G ollama run deepseek-r1 open-webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:main 2.

    3K20编辑于 2025-02-04
  • 来自专栏AllTests软件测试

    本地部署AI模型DeepSeek

    DeepSeek的核心产品,是一系列强大的语言模型。 官方网址: https://www.deepseek.com/ 本篇讲解如何快速的在本地部署AI模型DeepSeek。 2、本地部署DeepSeek 1、首先要下载安装Ollama。 Ollama是一个开源的大型语言模型本地部署框架。 特点: 多平台支持,如Windows、macOS、Linux,还支持Docker,方便跨平台部署2、搜索并安装DeepSeek模型。 搜索语言模型: https://ollama.com/search 可以看到DeepSeek-R1。 它支持多种语言模型运行程序,如Ollama和兼容OpenAI的应用程序编程接口(API),还内置了用于检索增强生成(RAG)的推理引擎,使其成为一个强大的人工智能部署解决方案。

    1K11编辑于 2025-02-10
  • 来自专栏小陈运维

    使用Ollama部署deepseek模型

    使用Ollama部署deepseek模型前置条件使用英伟达显卡下载cuda驱动https://developer.nvidia.com/cuda-downloadsOllamaOllama 官方版: 的安装方式去安装若你的显卡是在Linux上面 可以使用如下命令安装curl -fsSL https://ollama.com/install.sh | sh当然Ollama不只是可以启动deepseek模型 ,也可以启动他的模型https://ollama.com/search# 模型的安装命令# 1.5B Qwen DeepSeek R1 # 所需空间大约 1.1Gollama run deepseek-r1 v open-webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:main2.

    3.7K12编辑于 2025-01-26
  • 来自专栏.Net Core技术分享

    Ollama本地部署模型总结

    今天计划对之前ollama系列做个回顾,从如何部署到API使用,整理到一篇内容中,提供给大家参考。 ollama run deepseek-r1:1.5b 下载完成后,ollama会为我们运行刚下载的模型。下面是我运行成功的截图: 第三步:使用模型 恭喜你已经在本地成功安装了第一个私有模型。 Token:字符块,是模型的最小输出单位,同时也是模型的计费单位。 在内容生成API中,我们仅传入了prompt,模型仅对我们本地的prompt进行回答,而在生成对话API中,我们还可以传入messages参数,包含我们多轮对话内容,使模型具备记忆功能。 \n2. **下雨天**:云层覆盖天空,可能导致颜色较为阴郁或变黑。\n3. **雨后天气**:雨后的天空可能恢复为明亮的色调。

    5.8K11编辑于 2025-03-30
  • 来自专栏数据挖掘

    模型高效下载部署方式

    下载 hfdwget https://hf-mirror.com/hfd/hfd.shchmod a+x hfd.sh 2. 下载模型sh hfd.sh gpt2 --tool aria2c -x 44.下载数据集sh hfd.sh wikitext --dataset --tool aria2c -x 4 二、国内魔塔社区下载下面以 cogvlm2-llama3-chinese-chat-19B 为例子SDK下载#模型下载from modelscope import snapshot_downloadmodel_dir = snapshot_download ('ZhipuAI/cogvlm2-llama3-chinese-chat-19B')git下载git lfs installgit clone https://www.modelscope.cn/ZhipuAI /cogvlm2-llama3-chinese-chat-19B.git

    93910编辑于 2024-07-15
  • Baichuan2模型部署运行

    模型介绍 Baichuan 2 是百川智能推出的新一代开源语言模型,采用 2.6 万亿 Tokens 的高质量语料训练。 -13B-Chat Baichuan2-13B-Chat-4bits Benchmark 结果 我们在通用、法律、医疗、数学、代码和多语言翻译六个领域的中英文和多语言权威数据集上对模型进行了广泛测试 Gaokao 是一个以中国高考题作为评测语言模型能力的数据集,用以评估模型的语言能力和逻辑推理能力。 我们只保留了其中的单项选择题,并进行了随机划分。我们采用了与 C-Eval 类似的评测方案。 HumanEval 中的编程任务包括模型语言理解、推理、算法和简单数学,以评估模型功能正确性,并衡量模型的问题解决能力。 13B-Base 30.61 22.11 17.27 2.39 14.17 11.58 14.53 16.09 推理和部署 推理所需的模型权重、源码、配置已发布在

    97610编辑于 2024-03-26
  • 来自专栏GiantPandaCV

    模型部署框架 FastLLM 简要解析

    前言 本文主要是对FastLLM做了一个简要介绍,展示了一下FastLLM的部署效果。 0x2. FastLLM chatglm-6b模型导出解析 首先解读一下FastLLM是如何导出huggingface的chatglm-6b模型的。 要在FastLLM中自定义一个模型,需要实现的核心部分就是这个模型文件了,从目前FastLLM提供的组件来看,基于Transformer架构的开源模型支持的难度和工作量会比较小,而对于新的架构比如RWKV 比较期待FastLLM推出ONNX的支持,这样就可以更方便的和各种类型的模型对接起来。 0x4. 总结 本文主要是对FastLLM做了一个简要介绍,展示了一下FastLLM的部署效果。

    1.6K20编辑于 2023-08-22
  • 来自专栏微言码道

    本地部署模型的几种方式

    这之中当然有诸如GhatGPT, Gemini这样的私有化模型, 更吸引人关注的可能是开源的可私有化部署的一些模型. 比如Meta前两天开放的Lamma 3, Google的Gemma开源模型, 国内也有Qwen以及YI等. 无论私有的模型, 还是开源的可私有化部署模型, 各有优缺点. 相对而言, 一些开源的可私有化部署模型, 可能更令人关注. 因为只要有足够的硬件资源, 你就能私有化部署这些模型. 今天我就介绍几种常见的, 方便的私有化模型的方式, 这些方式都是开源或免费的. 私有化部署方式 Ollama 要说私有化部署模型最方便的方式, 我认为非Ollama莫属了. 总结 开源模型, 或者说本地化运行一个开源模型, 现在已经越发的简单与低门槛了. 只要有足够的GPU硬件, 本地化部署与运行开源模型非常简单及易于实现. 想部署一个本地大模型玩玩?

    9.1K21编辑于 2024-04-23
  • 来自专栏陈冠男的游戏人生

    使用ollama本地部署开源模型

    chatGPT 刚出来没多久的时候,openai 时不时的限制使用频率,当时我想要是能本地部署一个模型,无限制的使用该多好哇。 后来有很多团队/公司陆陆续续在 github 开源了他们自己训练的模型,但是部署使用的操作门槛比较高,曾经试图部署过一个,报了几个错也没时间折腾就放弃了 前几天我发现了一个叫 ollama 的项目,根据介绍 ,一条命令就能跑起来一个模型,因此实际体验了一下,项目地址: https://github.com/ollama/ollama 先说一下使用体验,极其丝滑,完全没有报错,感觉就像是刚开始学 web 安全 ollama/ollama/releases 安装好之后直接在命令行执行ollama run llama2就会自动去下载并运行 llama2 这个模型,下载甚至不需要挂代理,很舒适: 等模型下载结束后会自动进入命令行的交互模式 ,此时就已经部署结束了 可以在:https://ollama.com/library 找到更多的模型 但是在命令行中直接交互里很多格式解析不出来,看起来怪怪的,可以使用 chatbot-ollama 这个项目部署一个

    3.3K20编辑于 2024-03-05
  • 来自专栏云原生知识宇宙

    在 TKE 上部署 AI 模型

    概述本文介绍如何在 TKE 上部署 AI 模型,以 DeepSeek-R1 为例,使用 Ollama、vLLM 或 SGLang 运行模型并暴露 API,然后使用 OpenWebUI 提供交互界面。 是一个运行模型的工具,可以看成是模型领域的 Docker,可以下载所需的模型并暴露 Ollama API,极大的简化了模型部署。 vLLM 的特点:推理性能更好,也更节约资源,适合部署到服务器供多人使用,还支持多机多卡分布式部署,上限更高,但能适配的 GPU 硬件比 Ollama 少,且需要根据不同 GPU 和模型来调整 vllm 选型建议:如果有一定的技术能力且愿意折腾,能用 vLLM 或 SGLang 成功跑起来更推荐用 vLLM 和 SGLang 将模型部署到 Kubernetes 中,否则就用 Ollama ,两种方式在本文中都有相应的部署示例 AI 模型数据如何存储?

    1.6K01编辑于 2025-02-20
  • 来自专栏Java技术进阶

    基于LMDeploy部署模型和量化

    背景 模型具有庞大的参数量,内存开销,7B模型仅权重就需要14+G内存,采用自回归生成token,需要缓存Attention 的k/v带来巨大的内存开销;动态shape,请求参数不固定,Token逐个生成 LMDeploy介绍 LMDeploy 是LLM在英伟达设备上部署的全流程解决方案。包括模型轻量化、推理和服务。 如果遇到lmdeploy: command not found 或其他问题,移步 QA 文档 2 服务部署 这一部分主要涉及本地推理和部署。我们先看一张图。 接下来,我们看一下lmdeploy提供的部署功能。 2.1 模型转换 使用 TurboMind 推理模型需要先将模型转化为 TurboMind 的格式,目前支持在线转换和离线转换两种形式。 我想直接在自己的 Python 项目中使用模型功能。推荐使用 TurboMind推理 + Python(2.5)。 我想在自己的其他非 Python 项目中使用模型功能。

    3K00编辑于 2024-03-01
  • 来自专栏Python与算法之美

    Ollama 本地CPU部署开源模型

    Ollama可以在本地CPU非常方便地部署许多开源的模型。 如 Facebook的llama3, 谷歌的gemma, 微软的phi3,阿里的qwen2模型。 ollama run qwen2 #跑qwen2模型,如果本地没有,会先下载 ollama pull llama3 #下载llama3模型到本地 ollama list #查看本地有哪些模型可用 二, 命令行交互 可以在命令行中用 ollama run qwen2 运行一个模型,然后在命令行中和它对话。 下面的gif动画没有做任何加速。 这个回复速度还是非常的感人的~ 三,Python接口交互 在命令行运行 诸如 ollama run qwen2,实际上就会在后台起了一个qwen2模型服务。 import subprocess #后台启动一个qwen2模型服务,相当于 在命令行中运行 `ollama run qwen2` cmd = ["ollama","run qwen2"] process

    4.3K11编辑于 2024-06-26
  • 来自专栏AI智能体开发

    AI模型本地化部署

    AI模型本地化部署是将大规模人工智能模型(如GPT、LLaMA、DeepSeek等)部署到本地服务器或设备上,以满足数据隐私、安全性和性能需求的过程。 确定是否需要微调或直接使用预训练模型2.模型选择与优化选择适合任务的预训练模型(如DeepSeek、Llama3、GPT等)。通过量化、剪枝、蒸馏等技术压缩模型,降低计算资源需求。 二、技术难点及解决方案1.计算资源需求高难点:模型需要高性能GPU和大量内存。解决方案:使用模型压缩技术(如量化、剪枝)和分布式计算。2.模型优化与效率难点:模型推理速度慢,资源利用率低。 国产化适配:国产AI算力和模型(如DeepSeek)将加速普及。边缘计算:模型将更多部署到边缘设备,满足实时性需求。 通过以上步骤和解决方案,AI模型本地化部署可以更好地满足行业需求,推动AI技术的广泛应用。

    5.9K10编辑于 2025-03-08
  • 来自专栏AI智韵

    模型部署实战】VLLM+OpenWebUI实现DeepSeek模型部署,文末有福利

    摘要 vLLM(Very Large Language Model Serving)是由加州大学伯克利分校团队开发的高性能、低延迟语言模型(LLM)推理和服务框架。 该框架支持连续批处理、动态显存分配和多GPU并行推理,能够高效处理8k+长上下文请求,并兼容OpenAI API接口,开发者可快速部署Hugging Face模型。 vLLM 灵活性与易用性 模型生态集成 无缝支持 Hugging Face 模型库,支持 LLaMA、GPT、DeepSeek 等主流架构2,9。 多 LoRA 微调支持 同时部署基础模型的多个微调版本,提升资源利用率7,9。 VLLM部署 有两种部署方法,第一种使用vllm serve,我们使用1.5B的模型举例,执行命令: vllm serve deepseek/DeepSeek-R1-Distill-Qwen-1.5B

    3.6K11编辑于 2025-03-17
  • 来自专栏素质云笔记

    模型时代的模型运维与部署:LLMops

    这意味着 LLMOps 是一组工具和最佳实践,用于管理 LLM 支持的应用程序的生命周期,包括开发、部署和维护。 LLM(大型语言模型)是可以生成人类语言输出的深度学习模型(因此称为语言模型)。 2 LLMOps实现步骤 几个LLMops的步骤: 基础模型的选择 迭代和提示Prompt管理 测试 部署 监控 持续改进和微调 2.1 数据管理 2.1.1 数据清洗和预处理技术 原始数据可能存在噪声和结构混乱 专有模型提供商的示例是: OpenAI (GPT-3, GPT-4) AI21 Labs (Jurassic-2) Anthropic (Claude) 开源模型通常在作为社区中心的Hugging Face 测试和训练数据分布差异:实际使用的数据分布总是不同于训练数据的分布。 难以用一个核心指标去衡量:指标不那么直接,可能无法捕捉模型的不同行为。语言模型需要对行为和定性输出测量有更多样化的理解。 2.5 部署 部署LLM(语言模型)API可能很简单,但是如果API调用背后有很多逻辑,则会变得更加复杂。 提高LLM输出质量的技术包括自我评价、采样多个输出和集成技术。

    7.9K21编辑于 2023-07-09
  • 来自专栏k8s技术圈

    玩转70亿参数模型!使用Walrus在AWS上部署Llama2

    Llama 2 是 Meta 的下一代开源语言模型。它是一系列经过预训练和微调的模型,参数范围从 70 亿到 700 亿个。 访问 Llama-2 web UI 您可以在 Llama-2 服务的详情页中看到它的部署和运行状态。 等待 Llama-2 服务完成部署后,可以通过 Walrus UI 点击该服务的访问链接来访问它的 web UI。 从零开始构建 Llama-2 镜像的关键步骤 本教程中使用了打包好的 Llama-2 镜像,这样在创建一个新的 Llama-2 实例时,您就不再需要花费时间下载语言模型(通常有着可观的文件大小)以及构建推理服务 -2-7b-chat 模型,然后构建并使用 text-generation-webui 来启动 Llama-2 服务。

    82010编辑于 2023-09-11
  • 来自专栏喔家ArchiSelf

    部署一个模型应用

    【引子】“千里之行,始于足下”,边走边记,这是模型系列文字的第38篇文字了。 部署模型应用从开发环境迁移到生产环境的最后一步。 模型应用的部署关注点如下: 可伸缩性: 可伸缩性指的是系统处理不断增加的工作量的能力,或者为了适应这种增长而扩大其潜力的能力。在生产环境中,模型应用必须能够处理来自用户的潜在的大量请求。 用户访问: 用户访问是指最终用户与模型应用交互并利用其功能的能力。部署使得最终用户可以访问模型应用,无论他们是内部利益相关者还是外部客户。 一般地,部署一个模型应用会遵循如下步骤。 1. 2. 设置版本控制 在 GitLab 上创建和设置一个存储库,提供一个集中的版本控制系统来管理和跟踪对代码和模型文件的更改。 小结 在生产环境中部署模型应用涉及到几个关键步骤,从模型准备和版本控制到使用 K8S 进行容器化部署

    2.8K10编辑于 2024-11-07
领券