📈 预期目标
在 Windows 系统中,部署一个开源的大模型并运行,提供 URL 供工具类软件如沉浸式翻译(immersive translate),NextChat等使用。需要兼顾速度与质量。
📝 什么是 ollama ?
ollama 是一个开源的 LLM (Large Language Model)运行平台,用于在本地运行各种各样的 LLM。也就是说我们可以下载模型后,通过 ollama 部署运行,我们可以在本地与这个模型展开对话、完成要求,也就是模型的推理在本地运行。
📝 ollama 的安装
ollama 的安装没有提供安装路径与模型路径的选择,我们需要在环境变量中,添加几条用于 ollama 存储模型文件与提供服务的变量。
⚠️ 添加完环境变量后,我们需要重启 ollama。
📝 模型下载与运行
在官网上,我们可以找到琳琅满目的开源大模型(像gpt-4o等是闭源模型,自然是没有的),比较出名的有阿里的 qwen,Meta 的 llama,deepseek,均可以下载尝试。
特别是针对某一类特定场景时,某些模型有着天然的优势,比如在编程领域的 coder 类模型。
这里尝试的是 Qwen2.5 模型,参数量上根据自己的显存大小来选择,可以根据下图来参考。

这里选择 7b 参数量的模型,显存 12G 的3060应该是吃得消的。这时网页也会生成对应的模型拉取指令
ollama run qwen2.5 这个指令,需要我们在 cmd 窗口中以指令的形式输入。此时模型的拉取就开始了,等待片刻,模型就会自动加载到显存,等待你的下一步指令了。
这里尝试性提问了它关于“天空为什么是蓝色的”的问题,模型也是很快地给出了答案。

到这里,模型已经被我们成功部署在了本地平台了,下一步就是使用了。
📝 量化与上下文
模型量化是指将神经网络模型中的参数(如权重和激活值)从一个大的值域(通常是连续值域)映射到一个较小的有限值域的过程。 这种技术可以降低模型的大小和计算复杂度,提高模型在移动设备或嵌入式系统等资源受限环境中的运行效率。 模型量化通过减小参数的精度来实现压缩,但同时也会引入一定的精度损失。——什么是模型量化?
我将其粗略地理解为,模型量化是一个降低性能需求,引入噪声的过程。经过量化后的模型体积大大缩小,使得运行高参数量低位数的模型成为可能。如下图,qwen2.5:7b 模型在 q2_k 量化方法下,体积缩减了36%,而在 fp16 量化下模型的体积达到了惊人的 15GB。

在运行qwen2.5:7b时,我发现显存占用仅有 6.8G 左右,这意味着我可以尝试更高量化精度的模型来提升模型的输出质量。
根据这篇文章的建议GGML 或GGUF的14种不同量化模式说明,我选择使用 q5_k_m 量化方法的模型,模型大小达到 5.4 G,运行后显存占用来到了7.3 GB。
上下文窗口是模型能够记住的输入范围,超出这个范围的内容,模型将无法直接关联。 传统的语言模型上下文窗口较小,比如只有几百到几千个标记。 因此在处理长文档或复杂对话时,模型容易丢失前面的上下文信息,导致生成的内容出现逻辑不连贯或者缺乏相关性的问题。——什么是大语言模型的上下文窗口?
在使用过程中,虽然使用的是精度更高的模型,但文章翻译的通顺来说,还是欠缺了一点,主要体现在前后连贯上。偶然中得知 ollama 在默认情况下,其上下文窗口仅设置为 2k,这对于模型理解需要翻译的内容上是不够的,也就导致了文章翻译得不太通顺。
此时我们需要修改 ollama 运行模型时的上下文窗口长度。
- 复制一份底座模型的 Modelfile,
ollama show --modelfile qwen2.5:7b-instruct-q5_K_M > CustomModelfile
- 参考 ollama config PARAMETER 在 Modelfile 中添加 PARAMETER num_ctx 的设置,这里设置的是32k

- 创建运行新模型并命名,
ollama create qwen2.5-ctx-32k -f CustomModelfile
- 查看新模型信息 ,
ollama show qwen2.5-ctx-32k,可以看到此时上下文窗口长度已经被调整为32k

此时运行模型,其模型占用来到了 10.3GB。
📝 微软实时字幕翻译
微软在 Win11 的 24H2 更新中,带来了实时字幕的功能,这个功能完全基于本地实现,可以识别多达44种语言并显示。但翻译功能当且仅当显示为英语时启用。
LiveCaptions-Translator
SakiRinn • Updated Jun 10, 2025
通过 LiveCations-Translator 项目,为字幕提供基于 ollama 或 openAI API 的实时翻译并显示。这里使用其通过 ollama 翻译来演示


🤗 总结归纳
大模型知识深似海,这里仅仅是大模型的一角,如何使用,如何用好,如何让其真正成为我们工作和生活的 Agent,我想无论是我们还是大模型,都还有一段不短的路要走。
📎 参考文章
- qwen2.5 模型
- 引用文章
- LLM显存占用快速计算法
- modelfile 语法格式
- ollama 运行指令参考
- 修改 num_ctx 参考
- 一些延伸
- LLM量化笔记
- 基于本地大模型的工具本搭建
有关 ollama 安装或者使用上的问题,欢迎您在底部评论区留言,一起交流~



