火星链 火星链
Ctrl+D收藏火星链

WEB3:方法论、工具与团队:如何成为一名Web3数据分析师?

作者:

时间:1900/1/1 0:00:00

本文假设你是一个刚接触web3的数据分析师,开始组建你的 web3 分析团队,或者刚刚对 web3 数据产生兴趣。无论采用哪种方式,你都应该已经大致熟悉了 APIs、数据库、转换和模型在 web2 中的工作方式。

在这本新指南中,我将尽量简明扼要地阐述我的三个观点:

思考:为什么开放的数据渠道会改变数据发挥效用的方式

工具:web3 数据栈中的工具概述,以及如何利用它们

团队:web3 数据团队的基本考虑和技能

让我们先总结一下如何在 web2 中构建、查询和访问数据(即访问 Twitter 的 API)。我们有四个步骤来简化数据渠道:

触发 API 事件(发送了一些推文)

更新到数据库(连接到现有的用户模型/状态更改)

特定产品/分析用例的数据转换

模型训练和部署(用于管理你的 Twitter feed)

当数据是开源的时候,唯一需要的步骤是在转换完成之后。Kaggle(1000个数据科学/特征工程竞赛)和 hugs Face(26,000 个顶级 NLP 模型)等社区使用一些公开的数据子集来帮助企业构建更好的模型。有一些特定领域的情况,比如在前面的三个步骤中开放数据的开放街道地图,但是它们仍然有写权限的限制。

OpenAI发文介绍保障AI安全的方法:金色财经报道,ChatGPT 研发者 OpenAI 在其官方博客中发布了题为《Our approach to AI safety》(《我们保障 AI 安全的方法》)的文章,介绍了该公司确保 AI 模型安全性的部署。该文章介绍了六个方面的部署,一是构建越来越安全的 AI 系统,二是从实际使用中积累经验以改善安全措施,三是保护儿童,四是尊重隐私,五是提高事实准确性,六是持续研究和参与。

该文章介绍,OpenAI 要求用户必须年满 18 周岁,或年满 13 周岁经父母批准,才能使用其 AI 工具,该公司正在研究验证选项。OpenAI 不允许其技术用于生成仇恨、骚扰、暴力或成人类别的内容,并阻止儿童性虐待等材料上传到其图片工具中等。[2023/4/6 13:47:56]

我想声明的是,我只是在这里谈论数据,我并不是说 web2 完全没有开源。像大多数其他的工程角色一样,web2 数据有大量的开源工具来构建他们的管道(dbt, apache, TensorFlow)。我们仍然在 web3 中使用所有这些工具。总之,他们的工具是开放的,但他们的数据是封闭的。

Web3 也将数据开源,这意味着不再只有数据科学家在开放环境下工作,分析工程师和数据工程师也在开放环境下工作!每个人都参与到一个更连续的工作流程中,而不是一个几乎是黑盒的数据循环。

Iron Fish:社区流传的代币奖励计算方法并不准确:金色财经报道,隐私网络Iron Fish发推称:“我们了解到社区中正在流传一个非官方版本的(代币)奖励计算方法,该方法并不准确,用户不应以此为参照。随着主网的临近,我们将分享更多关于奖励的信息。”[2023/3/2 12:37:23]

工作的形式已经从 web2 数据大坝到 web3 数据河流、三角洲和海洋。同样重要的是需要注意,生态系统中的所有产品都会同时受到这个循环的影响。

让我们看一个 web3 分析师如何一起工作的例子。有几十家交易所使用不同的交易机制和费用,允许你将代币 A 交换为代币 B。如果这些是典型的交易所,如纳斯达克,每个交易所将报告自己的数据在 10k 或一些 API,然后其他一些服务,比如 capIQ,会把所有交换数据放在一起,然后收取费用,让你访问他们的 API。也许有时候,他们会举办一次创新竞赛,这样他们就可以在未来收取额外的数据/图表功能。

在 web3 交易所中,我们有这样的数据流:

dex.trades 是 Dune 上的一个表格(由许多社区分析工程师随着时间的推移整理而成),所有的 DEX 交换数据都被聚合在一起,所以你可以很容易地在所有交易所中搜索单个代币的交易量。

科学家学术论文描述针对以太坊PoS链的3种攻击方法:10月31日消息,来自斯坦福大学和以太坊基金会的计算机科学家Caspar Schwarz-Schilling、Joachim Neu、Barnabé Monnot、Aditya Asgaonkar、Ertem Nusret Tas、David Tse最近撰写一份新白皮书,描述了针对以太坊PoS(权益证明)链的3种攻击方法。该白皮书揭示了最近出现的两次以太坊网络攻击,并且该论文的作者改进了这些技术。

除了前两种方法(理论上会造成“短程重组”和“对抗性网络延迟”)的改进之外,计算机科学家还提出了第三种攻击。“结合两种改进的攻击技术,我们获得了第三种攻击,它允许拥有极少权益(stake)且无法控制网络消息传播的对手进行甚至是远程(long-range)共识链重组。”作者们补充说,“诚实但理性或有意识形态动机的验证者可以利用这种攻击来增加他们的利润或阻塞协议,从而威胁到PoS Ethereum的激励一致性和安全性。该攻击还可能导致投票处理拥堵导致共识不稳定。”

同时,以太坊网络批评者使用这篇论文强调当网络过渡到完整的PoS系统时与这些攻击相关的潜在漏洞。Chia创始人、Bittorrent创建者Bram Cohen发布关于这项新研究的推文。Chia支持者回应称,“让我们在一年后重温你的推文,看看Chia与ETH相比取得了什么成就。请考虑你的态度,正在拒绝像我这样的社区成员。”

该论文的作者总结道,“我们的攻击也使得可能出于意识形态动机的先天性恶意行为者推迟并在某些情况下彻底拖延达成共识的决定。第4.2节的改进攻击为攻击者提供了一种工具来做到这一点,即使攻击者无法控制消息传播延迟(这被认为是概率性的)。”(Bitcoin.com)[2021/10/31 6:23:20]

一名数据分析师通过社区开源查询创建了一个仪表盘,所以现在我们对整个 DEX 行业有了一个公开的概述。即使所有的查询看起来都是由一个人写的,你可以猜测这是在discord上经过大量的争论,才准确地将其拼凑在一起得。

分析:替代币表现良好,大多数加密货币针对该问题已经找到更有效的方法:机构分析:在亚洲早盘的加密货币抛售中,小市值加密货币受影响程度较小。香港数字资产公司Diginex销售经理Justin d'Anethan表示,“替代币表现良好,马斯克给出(暂停比特币支付)的理由是因比特币开采对化石燃料的消耗,但大多数加密货币针对该问题已经找到更有效的方法,因此表现更佳。”[2021/5/13 21:57:20]

DAO 科学家查看仪表板,并开始在他们自己的查询中分割数据,查看特定的对,比如稳定币。他们会观察用户行为和商业模式,然后开始建立假设。由于科学家可以看到哪个 DEX 在交易量中占据了更大的份额,他们将提出一个新的模型,并提议改变治理参数,以便在链上进行投票和执行。

之后,我们可以随时查看公众查询/仪表板,看看提案如何创造出更具竞争力的产品。

在未来,如果另一个 DEX 出现(或升级到一个新版本),这个过程将重复。有人将创建插入查询来更新这个表。这将反过来反映在所有的仪表板和模型(没有任何人必须回去和手动修复/更改任何东西)。任何其他分析师/科学家都可以以别人已经完成的工作为基础。

由于共享的生态系统,讨论、协作和学习在一个更紧密的反馈循环中发生。我承认这有时会让人难以承受,我认识的分析师基本上都在轮换数据耗尽。然而,只要我们中的一个人继续推动数据向前(例如,某人创建了插入 DEX 查询),那么其他人都会受益。

现场 | SiO2对冲基金创始人:坚持是应对不确定性的最好方法:金色财经现场报道,1月24日,在由金色财经主办的金色沙龙深圳站第一期活动上,CoinXP联合创始人& SiO2对冲基金创始人梁亮发表了主题演讲,他分享了多年在量化市场积累的经历。他说,第一不管是否量化,都要关注一致性,就是坚持。坚持是应对不确定性的最好方法。第二黑天鹅事件是完全无法预测的事件,不管是传统金融市场,还是数字资产领域,这是不能避免的。第三关注滑点,这点比较专业,不管你策略回撤有多好,演示有多好,滑点反应却很差,这就是有问题的,这也让很多人做实盘的时候没有想到死在滑点上。最后,他总结了风险问题,他说系统性风险避免不了,分散非系统分享很重要。[2019/1/24]

它并不总是必须是复杂的抽象视图,有时它只是实用功能,如使它容易搜索 ENS 反向解析器或工具的改进,如自动生成大多数 graphQL 映射与一个 CLI 命令!所有这些都可以被每个人重用,并且可以在某些产品前端或您自己的个人交易模型中进行 API 的使用。

虽然这里开启的可能性是惊人的,我确实承认,轮子还没有平稳地运行。与数据工程相比,数据分析师/科学领域的生态系统仍然很不成熟。我认为有以下几个原因:

数据工程是web3多年来的核心焦点,从客户端 RPC API 的改进到基本的 SQL/graphQL 聚合。像 theGraph 和 Dune 这样的产品就是他们在这方面所付出努力的例证。

对于分析师来说,要理解 web3 独特的跨协议关系表是非常困难的。例如,分析人员可以理解如何只分析 Uniswap,但却很难在混合中添加聚合器、其他 DEXs 和不同的代币类型。最重要的是,实现这一切的工具直到去年才真正出现。数据科学家通常习惯于收集原始数据并独自完成所有的工作(建立他们自己的管道)。我认为他们不习惯在开发初期与分析师和工程师进行如此密切和公开的合作。对我个人来说,这花了一段时间。

除了学习如何协同工作之外,web3 数据社区还在学习如何跨这个新的数据堆栈工作。你不再需要控制基础设施,或者慢慢地从 excel 构建到数据池或数据仓库,只要你的产品上线,你的数据就会到处上线。你的团队基本上是被扔到了数据基础设施的最深处。

以下是一些数据工具汇总:

下面我们看看每种类型以及用法:

交互+数据源:这主要用于前端、钱包和较低层次的数据摄取。1

客户端:虽然以太坊的底层实现是相同的,但每个客户端都有不同的额外特性。例如,Erigon 对数据存储/同步进行了大量优化,Quorum 支持隐私链。

节点即服务:你不必选择运行哪个客户端,但使用这些服务将为你节省维护节点和 API 正常运行的麻烦。节点的复杂性取决于你想要捕获多少数据(轻节点→全节点→归档节点)。

查询+数据映射:这一层中的数据要么作为 URI 在合约中引用,要么来自使用合约 ABI 将交易数据从字节映射到表模式。合约 ABI 告诉我们合约中包含哪些函数和事件,否则,我们只能看到部署的字节码(没有这个 ABI,你无法反向工程/解码合约交易)。

交易数据:这些是最常用的,主要用于仪表板和报告。theGraph 和 Flipside API 也在前端中使用。有些表是合约的 1:1 映射,有些表允许模式中额外的转换。

元数据“协议”:这些并不是真正的数据产品,而是用于存储 DIDs 或文件存储的。大多数 NFT 将使用其中的一个或多个数据源,我认为今年我们将开始越来越多地使用这些数据源来增强我们的查询。

专业提供商:其中一些是非常健壮的数据流产品,Blocknative 用于 mempool 数据,Parsec 用于链上交易数据。其他的聚合链上和链外数据,比如 DAO 治理或国库数据。

高维度数据提供商:你不能查询/转换他们的数据,但是他们已经帮你完成了所有繁重的工作。

如果没有强大的、杰出的社区来配合这些工具,web3 就不会出现!我们可以看到每种类型对应的杰出社区:

Flashbots:专注于 MEV 上,提供从保护交易的自定义 RPC 到专业白帽服务的所有事宜。MEV 主要指的是跑问题,当有人支付比你更多的 Gas(但直接给矿商),这样他们就可以抢先执行他们的交易。

Dune 数据精英:专注于为 Dune 的数据生态做贡献的数据分析精英。

Flipside 数据精英:专注于为 Web3 数据升天做贡献的数据分析精英。

MetricsDAO:跨生态工作,处理多个链上的各种数据奖励。

DiamondDAO:专注于 Stellar 的数据科学工作,主要在治理、财政库以及代币管理方面。

IndexCoop:专注于代币等特定领域的分析,以制定加密货币行业最好的指数。

OurNetwork:每周对各类协议以及 ?Web3 的数据覆盖。

注:以上 DAO 的参与联系方式详看原文。

每个社区都做了大量的工作来改善 web3 的生态系统。毫无疑问,拥有社区的产品将以 100 倍的速度增长。这仍然是一个被严重低估的竞争优势,我认为除非人们在这些社区中建立了一些东西,否则他们不会获得这个优势。

不用说,你也应该在这些社区中寻找可以加入你的团队的人。让我们进一步分析重要的web3数据技能和经验,这样你就能真正知道你在搜索什么。如果你想被雇佣,把这看作是你追求的技能和经验!

至少,分析师应该是 Etherscan 侦探,知道如何阅读 Dune 仪表盘。这可能需要 1 个月的时间来适应悠闲的学习,如果你真的要疯狂学习,则需要2周的时间。

除此之外,你还需要考虑更多的内容,特别是时间分配和技能转移。

时间方面:在 web3 中,数据分析师大约有 30-40% 的时间将花在与生态系统中的其他分析师和协议保持同步上。请确保你不会气晕他们,否则,这将成为对每个人的长期损害。与更大的数据社区一起学习、贡献和构建是必要的。

可转移性方面:在这个领域,技能和领域都是高度可转移的。如果使用不同的协议,可能会减少上手时间,因为链上数据的表模式都是一样的。

记住,知道如何使用这些工具并不重要,每个分析师或多或少都应该会写 SQL 或创建数据仪表盘。这一切都是关于如何做出贡献并与社区合作。如果你正在面试的人不是任何 web3 数据社区的一员(而且似乎对这一块没有任何兴趣),你可能要问问自己这是否是一个危险信号。

原文链接:

https://ath.mirror.xyz/w2cxg5OP1OEcqvSgsEjSSyKRJhPmam0w-fXGogiG-8g

作者?|?Andrew Hong

译者:GaryMa 吴说区块链

标签:WEBWEB3APIDEXweb3币种web3.0币种怎么提现apix币最新价格Polyient DEX

以太坊最新价格热门资讯
区块链:金色硬核|从数百万SEC文件看美国对加密货币的接受

近日链上数据服务商Coin?Metrics通过检索美国SEC数百万文件中提及加密货币相关术语,研究了美国实体接受加密货币的演变趋势.

1900/1/1 0:00:00
ENS:NFT估值需要考虑哪些因素?

不可替代代币(NFT)市场正在飙升,越来越多的人正在创造、购买、出售和交换NFT。这个新市场存在许多挑战,最大的挑战之一是NFT的估值。NFT的估值是一个很大的未知数.

1900/1/1 0:00:00
区块链:火爆的数字藏品:定闹钟多手机抢购 线下交易赚10倍

数字藏品仍处于早期阶段,认可度、法律风险等有待进一步厘清。链新(ID:ChinaBlockchainNews)原创? ?作者 | 杨郑君2月6日,在女足亚洲杯决赛中,中国女足3比2逆转夺冠.

1900/1/1 0:00:00
NFT:同为NFT项目 为何国内的项目迟迟发展不起来?

原标题:为什么国内的项目就是发展不起来?从nft市场看中西文化的差异最近nft市场一路向前狂奔,完全无视币圈的持续阴跌.

1900/1/1 0:00:00
OpenSea:NFT将在2022年成为主流

在 2021 年经历了巨大的突破之后,很明显,在消费内容和与应用程序(包括数码照片、图像、游戏、音乐、视频)以及可能在其他领域(如房地产),NFT 用例正在增长.

1900/1/1 0:00:00
WEB3:金色观察|万卉:Web2的背面不是Web3

本文来自twitter“Dovey “Rug The Fiat” Wan”整理而来,转载请注明出处。“Web2的背面不是Web3”?这大概是今年我重复说的最多的一句话.

1900/1/1 0:00:00