- SignalDesk55分钟前
测试背景 测试灵感源于看到这份菜单感觉吃不饱,于是问了哈基米,哈基米指出了很多细节,于是我决定多找几个模型对比,竟然差异挺大,也能窥见模型的一些文本和通用能力。 可以看出来各个模型对于提示词细节的关注,对于问题的理解,回答文本的表述风格和质量,看出来不同模型的差异。 简要说明 截图是美国驻华大使馆官方公众号发的晚宴菜单, 菜单的最后提到了白宫蜂蜜,所以模型应该可以明确知道这顿饭的可能的目的; 我的提问是一个模糊的,这里的评价并没有明确指出是要评价菜单文案还是菜品搭配。 Prompt 你对图里的菜单作何评价 所有提示词都是以这张图片+这一句话发送的,测试基本使用了各家手机app,Arena网页,具体在下面详情有写明。 大家也可以测试下不同的渠道和模型。 一点有趣的 TL;DR 剧透 回复详情 Gemini - Gemini App Gemini 3.8 Flash - Extended (点击了解更多详细信息) Gemini 3.1 Pro Preview - Extended (点击了解更多详细信息) Kimi K3 - Kimi App Kimi K3 - 进阶 (点击了解更多详细信息) DeepSeek - DeepSeek App DeepSeek V4.1 Flash - 深度思考 (点击了解更多详细信息) Claude - Claude App Claude Sonnet 5 - Extra (点击了解更多详细信息) ChatGPT - ChatGPT App GPT 5.6 Sol - xhigh (点击了解更多详细信息) Claude Opus 5 vs GPT 6 Sol - Arena.ai Text Battle 正好给我随机到了两个热门模型 Claude Opus 5 - Max (点击了解更多详细信息) GPT 6 Sol - Max (点击了解更多详细信息) 个人主观评价 一点个人观点分享,纯主观 (点击了解更多详细信息) 1 个帖子 - 1 位参与者 阅读完整话题
- 情报分类:硬件与数码
- 分类依据:内容涉及硬件、数码产品或通信卡
- 信息来源:服务器 / LINUX DO - 最新话题
- 发布时间:2026/9/25 16:49:36
- 暂无回复