所有文章

2026

Qwen3.8-27B 换上 DFlash2 草稿,单流提速 36%:DGX Spark 实测与反转

在 DGX Spark(GB10)上给 Qwen3.8-27B-NVFP4 接入 DFlash2 块扩散草稿的实测:单流 20.9→28.4 tok/s(+36%),接受长度翻倍到 4.23。但并发一过 16,DFlash2 反被 MTP 甩开——它绕开了 EAGLE 的线性叠加成本,却撞上了另一面更硬的墙。

· 3 分钟阅读 · #speculative-decoding #dflash2 #dflash

npm 七天两起投毒:18 个包藏了 92 天,868 个包只用了几小时

一次定向、一次蠕虫。被投毒的 keyv 带着有效的 sigstore 签名发布,蠕虫把自己装进了开发者的 .claude 目录。两起事件暴露同一个盲区。

· 21 分钟阅读 · #npm #supply-chain #keyv

GLM-5.1-FP8 部署调优复盘:8 卡 H20 从 31 tok/s 到 122 tok/s

一次 GLM-5.1-FP8 在 SGLang 上的部署和调优记录:先给结论,再拆测试方法、参数取舍、性能对照和踩过的坑。

· 10 分钟阅读 · #glm #sglang #fp8

LLM 中的人格张力、情绪表征与社会心理镜像

一个关于 personality tension prompting 的工程假设:模型如何响应角色、评价、责任、挑战、反迎合和社会心理结构。

· 16 分钟阅读 · #llm #prompt #claude

我 25 天在 Cursor 大号上花了 3018.98 美元

记录一份 Cursor 使用分析报告:个人用量、AI 给出的诊断,以及我准备怎么调整模型和上下文使用习惯。

· 7 分钟阅读 · #cursor #ai #productivity

SenseNova-U1-8B 统一多模态模型实测:单卡 H20 跑通端到端图像生成

商汤 2026 年 4 月开源的 NEO-Unify 架构统一多模态模型,在 H20 上的完整部署 + 13 个测试用例 + 性能数据 + 横向对比。

· 12 分钟阅读 · #aigc #multimodal #sensenova

重启 · 把这里改造成新版博客

旧的 MkDocs 站封存,新版用 Astro 5 重建。简单记一笔为什么、怎么做。

· 2 分钟阅读 · #meta #blog #astro