ローカルLLM
Ollama Cloudの料金、レガシーProと新プランは別物だった
Ollama Cloudの「Pro」は週次セッション上限のレガシーと、月次クレジット+トークン課金の新プランが並存する。公式ブログと料金ページ、2026年9月20日のUsage画面実測から違いを整理します。 ローカルLLM
27Bを6GBに潰すBonsai 2を16GB Macで回した
16GB Macで27BクラスのローカルLLMは動くのか。Q4のQwen3.8-27Bはスワップ死した実測から、三値量子化のBonsai 2 27B(5.95GB)なら14.6 tok/sで動くまでを形式別ベンチ3種で解説。llama.cpp fork必須の落とし穴も。 AI-Tools
654KBのSanoTTS-JPを3GBのIrodoriと聴き比べた
マイコンで動く0.65MBの日本語TTS「SanoTTS-JP」と3GBのIrodori-TTSを同じ13文で聴き比べ。速さは約270倍、聞き取り誤りは10.7%対0.25%。半角の数字と英字が無音で消える落とし穴と、全角化での回避法まで実音声つきで紹介。 AI・テクノロジー
NVIDIAのKVキャッシュ移植が25倍速い理由を解剖する
LLMが2回目から速いのはKVキャッシュのおかげ。Qを保存しない理由、メモリ量の計算式、実測761倍の再利用まで平易に解説し、NVIDIAがキャッシュをモデル間で移植する新論文(2.7〜25倍速)まで読み切ります。 AIツール
DeepSeek Harnessのキャッシュヒット率はOllamaで出ない
DeepSeek Harnessのキャッシュヒット率がOllamaで表示されない理由を実測と一次情報で解説。prompt_eval_countは不変、prompt_eval_durationは31.983秒→0.042秒。vLLM・SGLangでの計測フラグも紹介します。 AI・テクノロジー
AIエージェントが夜間障害を13分で切る条件はMarkdown 107枚
AWS KiroがAIエージェントに本番障害の一次調査を任せた事例を情シス視点で解説。月250件を中央値13.6分で無人処理、コストは上位サブスク9個分。鍵はMarkdown 107枚の運用知識でした。 AI-Tools
ビル・ゲイツの警告を読んで、役割を変えると決めた
ビル・ゲイツのAI警告を、自分のキャリアと業務変革へ引き寄せて考えました。AIの最新機能を追うだけでも、上流工程へ逃げるだけでも足りません。作業者からオーナー側へ移るという結論、会社内外と身体性を含む3つの選択肢、明日から続ける行動を整理します。 AI-Tools
Irodori-TTSの自分専用ニュースを61日間毎日車で聞いた
ローカルTTS(Irodori-TTS v4.1-Small)で自分専用のAIニュースPodcastを61日間運用した実測ログ。41本・12.2時間・台本173,399字。英字残存20.8%の失敗と、生成が音声長の2.5〜3倍かかる現実まで公開。 ローカルLLM
FreeTokenは8GB GPUで35B動く、RAM 32GBなら
FreeTokenをarXiv論文とGitHub公式ドキュメントで検証。8GB GPUで35Bが39.3 tok/s動くのは事実ですが、同じ機材にhost RAM 32GBが載っています。報道の速度比較表が別モデルの数値だった件と、macOS非対応の現状を実測ベースで解説します。 AI-Tools
Ox Alphaの正体を16プローブで特定した検証手法
※本記事の情報は2026年8月時点のものです。 「契約したのは最上位モデルのはずだけど、本当にそれが動いてるのかな」 APIの向こう側は見えません。レスポンスが返ってくるだけで、そこで何が動いているかを確かめる手段を、私たちはほとんど持っていません...

さぁ、始めよう。

















