📈 预期目标

在 Windows 系统中,部署一个开源的大模型并运行,提供 URL 供工具类软件如沉浸式翻译(immersive translate),NextChat等使用。需要兼顾速度与质量。

📝 什么是 ollama ?

ollama 是一个开源的 LLM (Large Language Model)运行平台,用于在本地运行各种各样的 LLM。也就是说我们可以下载模型后,通过 ollama 部署运行,我们可以在本地与这个模型展开对话、完成要求,也就是模型的推理在本地运行。

📝 ollama 的安装

ollama 的安装没有提供安装路径与模型路径的选择,我们需要在环境变量中,添加几条用于 ollama 存储模型文件与提供服务的变量。
⚠️ 添加完环境变量后,我们需要重启 ollama。

📝 模型下载与运行

在官网上,我们可以找到琳琅满目的开源大模型(像gpt-4o等是闭源模型,自然是没有的),比较出名的有阿里的 qwen,Meta 的 llama,deepseek,均可以下载尝试。
特别是针对某一类特定场景时,某些模型有着天然的优势,比如在编程领域的 coder 类模型。
这里尝试的是 Qwen2.5 模型,参数量上根据自己的显存大小来选择,可以根据下图来参考。
notion image
这里选择 7b 参数量的模型,显存 12G 的3060应该是吃得消的。这时网页也会生成对应的模型拉取指令 ollama run qwen2.5 这个指令,需要我们在 cmd 窗口中以指令的形式输入。
 
此时模型的拉取就开始了,等待片刻,模型就会自动加载到显存,等待你的下一步指令了。
 
这里尝试性提问了它关于“天空为什么是蓝色的”的问题,模型也是很快地给出了答案。
notion image
到这里,模型已经被我们成功部署在了本地平台了,下一步就是使用了。

📝 量化与上下文

模型量化是指将神经网络模型中的参数(如权重和激活值)从一个大的值域(通常是连续值域)映射到一个较小的有限值域的过程。 这种技术可以降低模型的大小和计算复杂度,提高模型在移动设备或嵌入式系统等资源受限环境中的运行效率。 模型量化通过减小参数的精度来实现压缩,但同时也会引入一定的精度损失。——什么是模型量化?
我将其粗略地理解为,模型量化是一个降低性能需求,引入噪声的过程。经过量化后的模型体积大大缩小,使得运行高参数量低位数的模型成为可能。如下图,qwen2.5:7b 模型在 q2_k 量化方法下,体积缩减了36%,而在 fp16 量化下模型的体积达到了惊人的 15GB。
notion image
 
在运行qwen2.5:7b时,我发现显存占用仅有 6.8G 左右,这意味着我可以尝试更高量化精度的模型来提升模型的输出质量。
根据这篇文章的建议GGML 或GGUF的14种不同量化模式说明,我选择使用 q5_k_m 量化方法的模型,模型大小达到 5.4 G,运行后显存占用来到了7.3 GB。
 
上下文窗口是模型能够记住的输入范围,超出这个范围的内容,模型将无法直接关联。 传统的语言模型上下文窗口较小,比如只有几百到几千个标记。 因此在处理长文档或复杂对话时,模型容易丢失前面的上下文信息,导致生成的内容出现逻辑不连贯或者缺乏相关性的问题。——什么是大语言模型的上下文窗口?
在使用过程中,虽然使用的是精度更高的模型,但文章翻译的通顺来说,还是欠缺了一点,主要体现在前后连贯上。偶然中得知 ollama 在默认情况下,其上下文窗口仅设置为 2k,这对于模型理解需要翻译的内容上是不够的,也就导致了文章翻译得不太通顺。
 
此时我们需要修改 ollama 运行模型时的上下文窗口长度。
  1. 复制一份底座模型的 Modelfile,ollama show --modelfile qwen2.5:7b-instruct-q5_K_M > CustomModelfile
  1. 参考 ollama config PARAMETER 在 Modelfile 中添加 PARAMETER num_ctx 的设置,这里设置的是32k
    1. notion image
  1. 创建运行新模型并命名,ollama create qwen2.5-ctx-32k -f CustomModelfile
  1. 查看新模型信息 ,ollama show qwen2.5-ctx-32k,可以看到此时上下文窗口长度已经被调整为32k
notion image
此时运行模型,其模型占用来到了 10.3GB。

📝 微软实时字幕翻译

微软在 Win11 的 24H2 更新中,带来了实时字幕的功能,这个功能完全基于本地实现,可以识别多达44种语言并显示。但翻译功能当且仅当显示为英语时启用。
 
LiveCaptions-Translator
SakiRinnUpdated Jun 10, 2025
通过 LiveCations-Translator 项目,为字幕提供基于 ollama 或 openAI API 的实时翻译并显示。这里使用其通过 ollama 翻译来演示
notion image
notion image

🤗 总结归纳

大模型知识深似海,这里仅仅是大模型的一角,如何使用,如何用好,如何让其真正成为我们工作和生活的 Agent,我想无论是我们还是大模型,都还有一段不短的路要走。

📎 参考文章

💡
有关 ollama 安装或者使用上的问题,欢迎您在底部评论区留言,一起交流~
 
PID 控制算法初探:从零理解P、I、D的作用先练武功再上山
Loading...