哈喽,大家好,我是刘小排。
我的公众号推荐AI编程类产品比较多,有读者朋友问我:有没有什么时候普通打工人的国产AI产品、用于不同类型的工作?
我今天推荐「豆包工作」。下面展开讲我用豆包工作做的三个实用案例:做短剧、自己运营一个自媒体号、AI新产品雷达。
希望能够帮助到大家
AI同事,不能偏科
用过不同AI产品的应该都有一个感受——大部分AI产品都挺偏科的。
会写代码的不会做内容,会做内容的碰到代码库就开始胡说。
但偏科还不是最大的问题。
以前给AI布置复杂任务,通常只有两种情况:要么做到一半停下来,等人继续指挥;要么还没弄清楚情况,就急着开始修改。很烦。
真正能干活的AI,既要能处理不同类型的工作,也得知道什么时候先规划、什么时候持续推进。
所以这次,我给豆包工作安排了三个跨度很大的任务:
- 从一个脑洞出发,做出一集完整的AI短剧
- 读取真实内容数据,养出一套会不断修正的自媒体策略
- 搭建一个每天帮我寻找、筛选和测试AI新品的工作台
一个处理创作,一个处理数据,一个还要自己写代码做产品。
看看豆包工作能不能在三种完全不同的工作里,适配不同的处理方式。
对了,之前豆包工作上线的时候有赠送一个月会员的福利,9月还可以再领取一个月的免费权益。
第一关:让豆包工作成立一个“AI剧组”
我只有一个短剧创意。
不会写剧本,没有分镜,没有现成素材,也不准备自己在几个AI工具之间来回复制。
我想做一集《我在古代给皇帝做产品经理》。
失业程序员穿越到古代,靠管理皇帝反复变化的需求,混成了“御前产品经理”。他以为自己终于升职加薪,深夜却收到通知:
前面的需求全部推翻,明早重做。
这个场景打工人应该有点感触。
我先用 plan 模式,让豆包工作把剧本、角色、场景和制作方式讨论清楚。
它没有拿到一句话就直接生视频,而是先把人物长什么样、每个镜头发生什么、场景之间怎么衔接,一项项列出来让我确认——这一步比我预想中慢,处理得也比我想的要细致。
插件技能市场里有很多工具,在 plan 阶段,豆包工作就直接调用了短剧创作skill。
比较让我惊喜的是,在我没有要求的情况下,它也有自己做审核的意识。
第一段视频,确定人物、画风和叙事方向没有跑偏。创作方向确定以后,再切换到 goal 模式:要求它交付完整竖屏短剧,保证剧情首尾完整、人物尽量一致、配音和字幕同步,发现不符合要求的片段继续修改。
plan 模式解决到底要做成什么样,goal 模式负责把已经确定的东西真正做完。
我粗略地调整了些细节,最终效果放在下面了:
第二关:让AI运营一个会自我进化的账号
做自媒体最难的,不只是持续生产内容,而是判断什么内容真的有效。
很多时候,一条内容数据不好,我也不知道是选题不行、标题不行,还是开头没有留住人。复盘通常做了一次就放在那里,下一次还是凭感觉选题。
这次我想让豆包工作接管这个工作,看它根据真实结果不断修正自己的内容策略。
我找了个和AI相关的账号,先用 goal 模式让豆包工作分别获取过去150篇内容的点赞、收藏、评论等数据。
我先让它尝试获取30条,成功了。继续抓剩下的数据。
准备好数据后,我用 plan 模式让它出一份分析策略。
返回的初版规划问题比较多,一次性把所有问题分别发送进入队列,等当前任务完成后自动依次执行。
这里发生了一件挺有意思的事。
在制定分析方案时,豆包工作自己发现了盲测里的一个漏洞,并主动告诉我:部分测试数据可能已经进入过前面的分析,严格来说不算真正的盲测。它没有假装这次测试完全有效。
大致定好评估方案以后,我先拿5篇它从未见过数据的内容做了一次真盲测。
结果很难看。
排序一致性只有 -0.10,5篇内容只判断对了2篇,基本接近猜反了。
它把两个蹭热门IP的选题排在前面,实际数据双双扑街;反而把“电商6种玩法”排到了第四,揭晓结果后,这篇才是真正的第一名。
第一版总结明显有问题。
豆包工作继续往回检查,发现训练样本几乎全是视频。它把热门题材和视频形式看得太重,却低估了真正影响这个账号的数据——内容能不能让人直接照着做。
我又让它补充了50篇内容,重新总结分析。
补充数据以后,我再用5篇内容重新测试。排序一致性从 -0.10升到了1.00,5篇内容的排名全部判断正确。
流程可以跑通,但还需要接着扩大测试量看准确率。
继续用 goal 模式完成一次新的测试:重新抓取20篇从未进入训练集的内容,先隐藏互动数据,锁定预测结果,再揭晓真实数据。
扩大到20篇以后,问题出现了。
揭晓结果以后,我没有让它简单重算一遍,而是要求它逐条解释错误:原来的哪条规律导致误判,这条规律应该保留、降权,还是直接删除。
最后,它把错误重新写进了下一版策略。
这里真正发生的“进化”,不是预测分数变高,而是错误会改变它下一次做判断的方法。
到这里,“分析结果—修正规律—生成建议”这条链路已经跑通。
我又给它设置了一个每周自动任务:读取最新数据,检查旧规律是否继续成立,并生成下一轮选题建议。
设置完成后我让它立即执行了一次,至于它能不能连续几周稳定执行、策略是不是真的越来越准,还要继续观察。
第三关:给自己搭一个AI新品雷达
AI产品更新太快了。
每天都有新模型、新工具和新功能发布。官方说得很好听,社媒上的实际评价又是另一回事。想判断一个产品值不值得测试,经常要翻官网、各类榜单、GitHub和各种讨论。
我想让豆包工作替我完成这部分脏活。这个工具能主动搜索最近发布或者更新的AI产品,记录产品名称、主要功能、价格、官方信息、用户评价和来源链接。
最终交付:
- 一个可以搜索、筛选和持续补充的本地工作台
- 结合个人灵感出一份本周AI产品选题与测试建议
先用 plan 模式:确定信息来源、筛选范围、评分规则、工作台字段和更新方式,避免搜回来一堆没法使用的信息。确认好基础信息后,豆包工作就开工了。
**方案确认后,可以用 goal 模式来执行,**要求每个产品都有官方来源和用户讨论链接;没有重复记录;官方介绍与用户评价明确分开;工作台能够搜索和筛选;逐项检查,不达标就继续补充,全部处理好之后,会给一个初版。
第一版跑完,一共有67个产品入库:
- GitHub Trending:22个开源项目
- Hugging Face Trending:20个模型
- Product Hunt:25个新品
工作台已经可以搜索、筛选和排序,也会根据新颖度、势头、可信度和实用度给产品评分。
不过,计划里的数据源并没有全部跑通。Toolify抓取超时,Reddit也没有接入,还缺少真实用户评价。
新品收集和初步筛选已经跑通,但信息源覆盖还不完整,真实用户评价也没有处理。
到这里,它还只是一个信息展示页。
我点开一个产品,看完名称、介绍和评分,然后呢?
我还是要自己判断值不值得测,自己想测试方法,再去其他地方创建项目。它只是把我以前打开的十几个网页,换成了一个网页。
工作台不能只把信息摆在一起,还得让我在这里完成下一步。
所以我继续用 goal 模式,让它增加适配评估、实测方案、复刻方案、灵感匹配和任务队列:
修改后,我可以点开一个产品,让它结合我的内容方向、已有产品和灵感库,判断这个东西是否适合我。
如果值得继续研究,它可以生成具体的实测方案和复刻方案。
它也可以反过来工作:我先放进一个自己的想法,它再去现有产品和开源项目里寻找相似方案。
这里也出现了一个很真实的问题。
它告诉我功能已经完成,我打开工作台,点击产品卡片,没有任何反应。
我让它检查并修改。刷新以后,还是没有反应。
直到我再问,它才发现本地服务没有正确重启。
豆包工作真正适合什么工作?
三个任务做下来,我觉得豆包工作最适合的,并不是“问完马上得到答案”的事情。
这种事情,普通聊天机器人已经做得很好了。
它更适合那些会不断延伸下一步的工作。
短剧一开始只有一句故事。
做着做着,长出了剧本、角色、场景、关键帧、视频、声音和字幕。
账号分析一开始只有一批历史数据。
分析完以后,还要盲测、认错、修改策略,再隔一周回来验证。
AI新品雷达一开始只是搜集产品。
后来又长出了评分、测试方案、个人匹配、复刻计划和任务队列。
三个任务完全不一样,但做法很像:
先把事情想清楚,再持续执行;中间允许人做判断,发现问题还能继续返工。
plan 模式适合把事情想清楚。
goal 模式适合目标确定以后持续推进、检查和返工。
技能和插件可以把一类已经验证过的方法带进来;任务队列持续提要求,不需要一直等着上一条完成;定时任务负责把一次性的工作变成长期流程。
这些能力单独看,都不算新鲜。
放在同一个任务里,区别就出来了。
豆包工作还不能交代一句就彻底撒手,但已经可以把复杂任务推进到一个能让我验收的结果。
我测试下来最长的单次任务处理大概在35分钟,只要在几个关键节点做判断就行。
不足也要讲
但三个案例处理下来,也碰到了一些不足。
比如 AI 新品雷达案例里暴露出了一点复杂工作的短板——会忘记部分要求。
AI可以把执行时间拉得很长,人不能因此放弃验收。
现在这些工具能让人需要做的事情少了很多。
但剩下的事情——决定做什么、判断好不好、最后敢不敢交付——反而更重要了。
记得去领域免费一个月的会员哦!!