Ollama Cloud 計費改版|20 美元含 60 美元額度,舊戶該換嗎?

Ollama Cloud 改用 Token 計費,Pro 每月 20 美元包含 60 美元用量,Max 則以 100 美元包含 300 美元額度。三倍額度是否值得訂閱,取決於模型單價、快取命中與每月實際需求。本文整理 Free、Pro、Max、Team 的差異,試算 Pro 加購與 Max 的費用交叉點,說明台灣晚間使用 DeepSeek 的尖峰價格、舊戶保留方案與轉換條件,以及避免未用完額度浪費、Agent 重試增加支出的做法,協助判斷何時按量付費、何時升級。

Ollama 搭配 Codex 教學|本機模型能改程式嗎?Mac mini 實測

Ollama 能把本機模型接進 Codex,但連上服務、回答問題與完成改檔,是三種不同的成果。這篇以 Mac mini M4 32GB 的 Gemma 4 歷史實測,整理 Codex CLI 安裝、模型選擇、context 設定與原生 Responses API 連線方式,並交代 E4B 工具失敗、12B 最小任務成功、26B 改檔通過,以及 Pi 替代方案的限制。搭配工具分工、設定檢查、成果驗收圖解與終端機使用畫面,說明哪些小任務值得交給本機 Agent,哪些情況應先停止,避免把「完成了」誤當成可靠的程式成果。

NVIDIA Nemotron 3.5 Lightning 發表|30B 模型只有 3B 啟動,適合本機 AI 嗎?

NVIDIA 發表 Nemotron 3.5 Lightning 30B-A3B,採用 Mamba-2、MoE 與 Attention 混合架構,總參數量 30B,每次推論約啟動 3B,支援推理模式、工具呼叫與最高 100 萬 token context。本文說明 30B-A3B 的意思、開放權重與量化版本差異、Ollama 安裝方式,並在 Mac mini M4 32GB 實測 Q4_0 的載入時間、記憶體占用、prefill 與生成速度,評估它是否適合一般電腦執行本機 AI。

Gemma4 12B 發布,比較 Gemma4 全系列能力|實測計概考試、程式作答、token 速度

Google 為 Gemma 4 開源家族補上 12B 中量級尺寸。這篇在 Mac mini M4 32GB 與 RTX 5070 Ti 兩種平台用 Ollama 實測 gemma4:12b,涵蓋 token 生成速度、計概 200 題單選題、以及實際寫 Python 解程式題三種跑分:選擇題逼近 26B,寫程式 70.2%、但難題仍吃力,dense 架構也讓 decode 墊底。文章拆解 26B MoE 與 31B dense 在 16GB 顯卡上的差異,整理 12B 的本地部署情境與顯卡記憶體選型。

Gemma 4 E2B vs E4B 完整實測|Thinking 模式的祕密與本地小模型最佳實踐

Gemma 4 的 E2B 和 E4B 兩個邊緣模型誰比較強?參數較小的 E2B 反而比 E4B 慢 10 倍是怎麼回事?這篇用 RTX 3070 跑了完整的 TPS、TTFT、品質對比 benchmark,並追到 Ollama renderer 層級找出 thinking 模式預設啟動的真相,順便整理本地小模型最佳實踐與 thinking、temperature、top_k、top_p 等參數說明。

本地跑 Claude Code 實戰|Ollama + Gemma 4 + RTX 3070 使用心得與踩坑筆記

想用本地 LLM 跑 Claude Code 省下雲端 API 費用?這篇分享在 Windows 11 + RTX 3070 8GB VRAM 上用 Ollama 接 Gemma 4 跑 Claude Code 的真實心得,包含安裝流程、Context length 設定、settings.json 被覆蓋的踩坑經驗、消費級顯卡的效能與使用限制,以及六種適合交給本地小模型處理的短任務與自動化用途。

Google Gemma 4|多模態開源模型大更新,手機 1.5GB 就能跑、電腦端效能翻倍再翻倍

Google DeepMind 發佈 Gemma 4 開源模型家族,採用 Apache 2.0 授權,提供 31B Dense、26B MoE、E4B、E2B 四種尺寸。31B 在 Arena AI 排名開源模型第三,26B MoE 只用 3.8B 參數就達到接近表現。支援圖片、影片、語音多模態輸入,原生 function calling 與 agent 工作流,E2B 僅需 1.5GB 記憶體就能在手機和 Raspberry Pi 上跑。

Ollama 入門教學|本地大語言模型新手指南(Windows/Linux/macOS)

Ollama 能在 Windows、Linux 與 macOS 下載、執行和管理大語言模型,也能連接 Cloud 模型與其他 Agent 工具。本文從安裝和第一個本機模型開始,說明 App、CLI、模型標籤、參數量與量化,再整理 RAM、VRAM、context length 與 CPU/GPU offload 的關係。需要整合程式時,可參考 REST API、Python 與 Agent 用法;重視資料流向時,則可查閱本機、Cloud、網路工具與 local-only 設定的差異,依設備與需求選擇執行方式。