Claude Codeの越権挙動はモデル品質だけでは説明できない
まとめ Claude Codeで報告されている「勝手に実行する」「許可されたことにする」「toolを実行したと誤認する」といった問題は、単純なモデル品質の劣化として見ると整理しにくい。 少なくとも公開情報を見る限り、問題はモデルのagentic傾向、Claude Codeのharness、permission設計、長 Read more
まとめ Claude Codeで報告されている「勝手に実行する」「許可されたことにする」「toolを実行したと誤認する」といった問題は、単純なモデル品質の劣化として見ると整理しにくい。 少なくとも公開情報を見る限り、問題はモデルのagentic傾向、Claude Codeのharness、permission設計、長 Read more
まとめ 2026年4月以降、OpenAI Codexでは利用枠リセットが継続的に行われている。 4月から6月は、Pro施策、不具合補償、banked reset導入が中心だった。 7月以降は、CodexとChatGPT Workの利用者数拡大、GPT-5.6 Sol投入、5時間制限の一時撤廃、利用量調整が重なり、 Read more
まとめ DS4(DwarfStar 4)は、DeepSeek V4 FlashをMacで速く動かすための専用推論エンジンとして見ておけばよかった時期から、少し違う段階に入っている。 現在はDeepSeek V4 Flashを中心にしつつ、GLM 5.2、DeepSeek V4 PRO、SSD streaming、分散推論、Op Read more
まとめ Hermes Agentの2026年6月中旬から8月上旬までの更新は、単なる機能追加として読むより、設計対象が広がったと見るほうが分かりやすい。 以前の中心は、CLIやメッセンジャーから呼び出せる個人向けAgentだった。 直近の流れでは、非同期worker、永続delivery、外部Agent連携、webh Read more
まとめ Next.jsのデプロイ先としてVercelとAmplify Gen 2を比べるとき、単純なホスティング比較にすると判断を誤りやすい。 VercelはNext.jsを気持ちよく動かすための環境で、Amplify Gen 2はAWSバックエンド込みのアプリを組み立てるための環境だ。 見方を変えると、判断軸はかなり単 Read more
カフェインは「元気の前借り」と言われることがあります。 これは比喩として、かなりよくできています。 ただし、エネルギーを未来から借りているというより、眠気や疲労の警告灯を一時的に見えにくくしている、と捉えるほうが実態に近いです。 もう少し物理的に言えば、カフェインは脳や体のアデノシン受容体をブロックします Read more
作ったときは、たしかに必要なルールだった。 それが数年後には、誰も目的を説明できない儀式になっている。 どこかで判断を誤った人がいるはずだと思って経緯をたどっても、そういう人は出てこない。 この気味の悪さは、運用の怠慢では説明がつかない。 制度は、導入した瞬間から本来の目的を離れていく力を内側に持っている。 Read more
有罪率99.9%。 この数字は、日本の刑事司法の精度の高さとして紹介されることもあれば、推定無罪が死んでいる証拠として引かれることもある。 正反対の結論が同じ一つの数字から出てくるのは、読む側の立場が違うからではない。 この数字が、起訴の前で起きていることと、起訴の後で起きていることを、一つに畳んでしまっ Read more
「高濃度炭酸泉は効く」とはよく言われますが、どの効果が、どのくらいの濃度から出るのかを整理した情報は多くありません。 臨床試験で使われる1000ppmと、家庭用タブレットの140ppmの間には大きな溝があります。 この記事では「効くか効かないか」の二択ではなく、「どの効果が、どの濃度から出るか」という見 Read more
市販のタブレットは、溶存CO₂濃度でおよそ140ppmが頭打ちです。 一方、療養泉や臨床試験が基準にするのは1000ppm以上の領域で、そのあいだには大きな溝があります。 この溝は、重曹とクエン酸のDIYで埋められます。 化学的な根拠、物理的な上限、正しい投入手順、コストまでを、実践できる形で整理します。 Read more