Claude Codeの越権挙動はモデル品質だけでは説明できない
まとめ Claude Codeで報告されている「勝手に実行する」「許可されたことにする」「toolを実行したと誤認する」といった問題は、単純なモデル品質の劣化として見ると整理しにくい。 少なくとも公開情報を見る限り、問題はモデルのagentic傾向、Claude Codeのharness、permission設計、長 Read more
まとめ Claude Codeで報告されている「勝手に実行する」「許可されたことにする」「toolを実行したと誤認する」といった問題は、単純なモデル品質の劣化として見ると整理しにくい。 少なくとも公開情報を見る限り、問題はモデルのagentic傾向、Claude Codeのharness、permission設計、長 Read more
まとめ 2026年4月以降、OpenAI Codexでは利用枠リセットが継続的に行われている。 4月から6月は、Pro施策、不具合補償、banked reset導入が中心だった。 7月以降は、CodexとChatGPT Workの利用者数拡大、GPT-5.6 Sol投入、5時間制限の一時撤廃、利用量調整が重なり、 Read more
まとめ DS4(DwarfStar 4)は、DeepSeek V4 FlashをMacで速く動かすための専用推論エンジンとして見ておけばよかった時期から、少し違う段階に入っている。 現在はDeepSeek V4 Flashを中心にしつつ、GLM 5.2、DeepSeek V4 PRO、SSD streaming、分散推論、Op Read more
まとめ Hermes Agentの2026年6月中旬から8月上旬までの更新は、単なる機能追加として読むより、設計対象が広がったと見るほうが分かりやすい。 以前の中心は、CLIやメッセンジャーから呼び出せる個人向けAgentだった。 直近の流れでは、非同期worker、永続delivery、外部Agent連携、webh Read more
まとめ Next.jsのデプロイ先としてVercelとAmplify Gen 2を比べるとき、単純なホスティング比較にすると判断を誤りやすい。 VercelはNext.jsを気持ちよく動かすための環境で、Amplify Gen 2はAWSバックエンド込みのアプリを組み立てるための環境だ。 見方を変えると、判断軸はかなり単 Read more
まとめ Azure API Management(APIM)のAI Gateway機能が、OpenAIのResponses APIをどこまでカバーしているかを棚卸しした。 結論を先に言うと、対応は「リクエスト/レスポンスが通過する瞬間に処理できる機能」に偏っている。 トークン計測・診断ログ・content safetyの対応は Read more
response idは、ただの識別子に見える。 ログにも、URLにも、エラーメッセージにも、気軽に載せてしまう。 APIキーなら決して置かない場所に、平気で現れる。 ところが、共有AIゲートウェイの構成では、そのIDを知っているだけで、他人の会話が読める。 継続もできる。 つまりresponse idは、識別子の顔をした、権 Read more
UUIDは、世界に一つだけのIDだ。 絶対にかぶらない。 だから安心して、システムAかBのどちらかに登録する。 一意なのだから、これで十分な気がする。 だが、この構成には、どこか筋の悪さがつきまとう。 IDを見ても、それがAにあるのかBにあるのか、分からない。 一意ではあるのに、居場所を教えてくれない。 この「な Read more
同じ内容でも、Markdownで出すと流し読みされ、HTMLで出すと実際に読まれる。 AIエージェントの出力を眺めていると、この差がはっきり出る。 フォーマットを変えただけで、読まれ方が変わる。 はじめは、単なる見た目の問題に見える。 だが、なぜHTMLだと読まれるのかを追っていくと、話はフォーマットを離れ Read more
2026年5月、マネーフォワードのGitHub認証情報が漏れ、リポジトリが丸ごとコピーされた。 本番データベースは無事だったのに、銀行連携は全面停止し、復旧は長引いた。 壁の内側は守れていたのに、壁の外の一点が抜かれただけで、サービスは止まった。 この事案を掘っていくと、妙なことに気づく。 SaaSへの依存 Read more