最近终于有空余时间发博客,也是打算聊一下 TDM 是什么。之前在短视频平台上,看到那些 AI 生图的过程。不是 Prompt 的过程,也不是本地部署的过程,作者直接在手机上本地部署 SD 模型,并关闭了遮罩。AI 先是将整块画布涂成了灰色,这一步就是在画布上摆满噪声。紧接着,AI 逐渐解析这些噪声,画面看着越来越清晰:最开始还是只有一个影子,结果越到后面影子越清楚,居然成了一个抱着苹果啃的美少女!这着实把我看得一愣一愣的,虽然说,我在 AI 画不好手的那段时期就了解过 Stable Diffusion。但如今真正看到它的作画过程,还是有点小惊讶的。你真的很难想象:一堆毫无看头的落叶,能够逐渐成为一幅画。

紧接着我又想,既然 Diffusion 可以将图片上的像素这样一步一步扩散成一幅画。那有没有一种可能,同样的技术也能够在一段长度相同的字符里面慢慢扩散成一篇文章?抱着好奇的心态,我请教了恩师 DeepSeek。它搜索了现有资料,给出了我答案:能,还真能!我勒个,这不是在吓我吧?尤其是 DeepSeek 还向我描述了更加详细的工作原理。TDM 不同于以往的 LLM 模型,它直接就是生成字符范围,逐渐修改这个范围的文字到合理的程度。这个过程就像生成图片那样有二十步:第一到第十步,就是填充文字;第十一到十五步,逐渐修改文字;第十六到二十步,直接把文字修改到合理为止。LLM 是一个字一个字吐出来,根据上下文思考和输出内容。

而且得益于 Diffusion 的生成过程,这家伙的文本处理方式居然是同时看到所有内容并处理。这意味着它不会像 LLM 一样写着写着就忘了什么,而是一步一步改那些结果输出,真的很令人改变三观了。但又因为 Diffusion 的实现缺陷,可能会导致出现一些小 Bug。大伙应该都记得 SD 刚出来那会,学习技术不是很成熟,遇到画手的地方直接多画了一根手指,对吧?没错的,TDM 大概率出现这些问题。DeepSeek 给我打了个比喻:就像是写一篇独生女的家庭文章,文中处处都在刻画到底有多么幸福,结果最后文中突然出现一个哥哥。你猜为什么出现哥哥?因为家庭幸福和哥哥这个词离得特别近,但内容确实是家庭幸福了。

你想现在就用上这些模型吗?非常简单,去部署一个 DiffusionGemma 就可以了,这是谷歌 DeepMind 最新开源的文本扩散模型。虽然目前在编程任务、个人聊天方面还是一地鸡毛,但是玩却是真的能玩了。目前在互联网上发布 Text Diffusion Model 的文章特别少,包括本文章在内可能都没几个文章,甚至可能大部分都是论文。因为 TDM 还和另外一个同名图像技术有关,所以你也可能在搜索结果看到图像技术的相关内容。但不管怎么说,这片新领域还是很有看头的(不是说赚钱啊,别喷我),谁不想二十步内就生成一篇字数接近一千多文章。慢慢等 LLM 一个一个联想还是太久了,写小说肯定是越快越好,多来几个修仙神文就棒极了!