我有一块RTX 5060 Ti 16GB显卡,搭配英特尔酷睿Ultra 7 270K Plus处理器和32GB DDR5内存。

我使用本地Qwen模型(Kunj0195/qwen3.6-35b-a3b:latest——通过Ollama运行的Qwen3.6 35B-A3B模型)时的主要问题是经常会触及上下文令牌/显存上限,所以我想知道配置相近的人是如何实现更高上下文限制(例如128K)的,以及他们使用了哪些Qwen模型/量化版本/设置。

我曾尝试将其接入Godot引擎,但即便是一个简单的提示词,几乎立刻就会因令牌耗尽而报错。

我还想知道这套配置实际能流畅运行哪些不错的本地图像生成和视频生成模型。如果你测试过的话,请分享具体的模型、量化版本、上下文大小、显存占用、速度以及设置。

🙏🙏🙏